Vídeo a audio

Video a audio (V2A) es el inverso de S2V: imagen silenciosa (o con escoreo inferior) en, banda sonora fuera. Wan2.2 T2V/I2V El compañero abierto en este sitio es ThinkSound (FunAudioLLM), un modelo de flujo de compatibilidad con la Guía CoT Any2Audio.

ThinkSoundV2Afoley
En esta página 5
Video silencioso en ThinkSound y luego banda sonora muxta
Flujo de trabajo típico 2.2: generar marcos silenciosos Wan, luego ejecutar un modelo V2A y mux.

¿Por qué este es un modelo diferente?

T2V/I2V Los DTs están capacitados para denogar el RGB (o VAE) latencias. V2A El modelo denota las latencias de audio condicionadas a las características de vídeo (CLIPLa mezcla de esas cabezas en una ckpt abierta 2.2 no formaba parte del lanzamiento de julio de 2025.

ThinkSound en esta familia de herramientas

  • Documento: Razonamiento de la cadena de pensamiento en MLLM para la generación y edición de audio (arXiv:2506.21448, NeurIPS 2025).
  • Tres etapas: folleto de vídeo, refinación centrada en objeto (clic/región), edición guiada por lenguaje.
  • Espiona: MM-DiT con VideoLLaMA 2 CoT; pesos en Hugging Face FunAudioLLM/ThinkSound.

Mucos prácticos

Mantenga la frecuencia de fotogramas y la duración de Wan clip. Generar audio a una longitud correspondiente, luego ffmpeg -c:v copia -c:a aac. Si necesita voz sincronizada con labios, ir a S2V en lugar de V2A V2A no reconstruirá la boca de un actor específico de una onda que ya tiene.

Preguntas frecuentes

¿Puede TI2V-5B emitir AAC?
No. Decode es un marco de vídeo. Cualquier banda sonora es un segundo modelo o un posterior Wan API cerrado.
¿Es PrismAudio lo mismo?
PrismAudio es una línea de seguimiento V2A (CoT-RL) de los autores de ThinkSound. La misma familia de problemas, punto de control diferente.

Fuentes primarias

Verificado con el README de Wan-Video/Wan2.2 · 28 de agosto de 2026

© 2026 wan2.video