Audio y vídeo nativos

El audio-video nativo significa que un muestreo emite una imagen y una banda sonora sincronizada (habla, efectos, música). Esta capacidad se anuncia en Wan 2.5 y productos posteriores APIs. No es una propiedad de los pesos abiertos Wan2.2-T2V/I2V.

Wan 2.5API-onlysync
En esta página 5
Wan2.2 video silencioso abierto versus Wan 2,5+ audio-video nativo APIs
Mantenga la línea de productos y los puestos de control abiertos en cajas separadas.

Qué emiten los modelos abiertos 2.2

  • T2V-A14B / I2V-A14B / TI2V-5B Video silencioso.
  • S2V-14B trae el audio; el modelo anima.
  • Animate-14B Transferencia de movimiento; audio no generado.

Qué añaden los productos 2.5+

Las escrituras públicas 2.5 (fal, DashScope estilo APIs, agregadores) describen la generación conjunta de diálogo, ambiente y música, 1080P, y clips más largos que las recetas de 2.2 ~ 5 s. Más tarde 2.6/2.7/3.0 mantiene AV nativo y añade controles de múltiples disparos o referencias. Ninguno de ellos se publica como puntos de control Wan2.2-style GitHub.

Substituciones de peso abierto

Para mantenerse en Apache 2.0 / pesos públicos: generar un video silencioso Wan2.2, luego ThinkSound (o otro V2A) para folletos; o conducir S2V con CosyVoice para cabezas de habla. Eso es dos (o tres) modelos, no AV nativo.

Preguntas frecuentes

¿Un 2.2 GGUF añadirá mágicamente audio?
No. La cuantificación cambia el tipo de peso, no la modalidad de salida.
¿Cuenta el S2V como AV nativo?
No, el AV nativo sintetiza el sonido. S2V Consume el sonido.

Fuentes primarias

Verificado con el README de Wan-Video/Wan2.2 · 28 de agosto de 2026

© 2026 wan2.video