O que os modelos abertos emitem
- T2V-A14B / I2V-A14B / TI2V-5B vídeo silencioso.
- S2V-14B - Traz o áudio; o modelo anima.
- Animate-14B Transferência de movimento; áudio não gerado.
O que adicionam os produtos 2.5+
As notas públicas 2.5 (fal, DashScope-style APIs, agregadores) descrevem a geração conjunta de diálogo, ambiente e música, 1080P, e clips mais longos do que as receitas de 2,2 ~ 5 s. Mais tarde 2.6/2.7/3.0 mantém AV nativa e adiciona controles de multi-shot ou de referência. Nenhum deles é publicado como checkpoints Wan2.2-style GitHub.
Substitutos de peso aberto
Para ficar no Apache-2.0 / pesos públicos: gerar vídeo silencioso Wan2.2, então ThinkSound (ou outro V2A) para folha; ou dirigir S2V com CosyVoice para cabeças de conversa. Isso são dois (ou três) modelos, não AV nativo.
Perguntas frequentes
- Um 2.2 GGUF vai magicamente adicionar áudio?
- A quantização altera o tipo de peso, não a modalidade de saída.
- Contam-se S2V como AV nativo?
- Não, o AV nativo sintetiza o som. S2V Consome som.
Fontes primárias
Verificado com o README do Wan-Video/Wan2.2 · 28 de agosto de 2026