Áudio e vídeo nativos

O áudio-vídeo nativo significa que um sampler emite imagem e uma trilha sonora sincronizada (discurso, efeitos, música). Essa capacidade é anunciada em Wan 2,5 e produto posterior APIs. Não é uma propriedade dos pesos abertos Wan2.2-T2V/I2V.

Wan 2.5API-onlysync
Nesta página 5
Wan2.2 vídeo silencioso aberto versus Wan 2,5+ áudio-vídeo nativo APIs
Mantenha a linha de produtos e os pontos de controlo abertos em caixas separadas.

O que os modelos abertos emitem

  • T2V-A14B / I2V-A14B / TI2V-5B vídeo silencioso.
  • S2V-14B - Traz o áudio; o modelo anima.
  • Animate-14B Transferência de movimento; áudio não gerado.

O que adicionam os produtos 2.5+

As notas públicas 2.5 (fal, DashScope-style APIs, agregadores) descrevem a geração conjunta de diálogo, ambiente e música, 1080P, e clips mais longos do que as receitas de 2,2 ~ 5 s. Mais tarde 2.6/2.7/3.0 mantém AV nativa e adiciona controles de multi-shot ou de referência. Nenhum deles é publicado como checkpoints Wan2.2-style GitHub.

Substitutos de peso aberto

Para ficar no Apache-2.0 / pesos públicos: gerar vídeo silencioso Wan2.2, então ThinkSound (ou outro V2A) para folha; ou dirigir S2V com CosyVoice para cabeças de conversa. Isso são dois (ou três) modelos, não AV nativo.

Perguntas frequentes

Um 2.2 GGUF vai magicamente adicionar áudio?
A quantização altera o tipo de peso, não a modalidade de saída.
Contam-se S2V como AV nativo?
Não, o AV nativo sintetiza o som. S2V Consome som.

Fontes primárias

Verificado com o README do Wan-Video/Wan2.2 · 28 de agosto de 2026

© 2026 wan2.video