Qué emiten los modelos abiertos 2.2
- T2V-A14B / I2V-A14B / TI2V-5B Video silencioso.
- S2V-14B trae el audio; el modelo anima.
- Animate-14B Transferencia de movimiento; audio no generado.
Qué añaden los productos 2.5+
Las escrituras públicas 2.5 (fal, DashScope estilo APIs, agregadores) describen la generación conjunta de diálogo, ambiente y música, 1080P, y clips más largos que las recetas de 2.2 ~ 5 s. Más tarde 2.6/2.7/3.0 mantiene AV nativo y añade controles de múltiples disparos o referencias. Ninguno de ellos se publica como puntos de control Wan2.2-style GitHub.
Substituciones de peso abierto
Para mantenerse en Apache 2.0 / pesos públicos: generar un video silencioso Wan2.2, luego ThinkSound (o otro V2A) para folletos; o conducir S2V con CosyVoice para cabezas de habla. Eso es dos (o tres) modelos, no AV nativo.
Preguntas frecuentes
- ¿Un 2.2 GGUF añadirá mágicamente audio?
- No. La cuantificación cambia el tipo de peso, no la modalidad de salida.
- ¿Cuenta el S2V como AV nativo?
- No, el AV nativo sintetiza el sonido. S2V Consume el sonido.
Fuentes primarias
Verificado con el README de Wan-Video/Wan2.2 · 28 de agosto de 2026