¿Por qué este es un modelo diferente?
T2V/I2V Los DTs están capacitados para denogar el RGB (o VAE) latencias. V2A El modelo denota las latencias de audio condicionadas a las características de vídeo (CLIPLa mezcla de esas cabezas en una ckpt abierta 2.2 no formaba parte del lanzamiento de julio de 2025.
ThinkSound en esta familia de herramientas
- Documento: Razonamiento de la cadena de pensamiento en MLLM para la generación y edición de audio (arXiv:2506.21448, NeurIPS 2025).
- Tres etapas: folleto de vídeo, refinación centrada en objeto (clic/región), edición guiada por lenguaje.
- Espiona: MM-DiT con VideoLLaMA 2 CoT; pesos en Hugging Face FunAudioLLM/ThinkSound.
Mucos prácticos
Mantenga la frecuencia de fotogramas y la duración de Wan clip. Generar audio a una longitud correspondiente, luego ffmpeg -c:v copia -c:a aac. Si necesita voz sincronizada con labios, ir a S2V en lugar de V2A V2A no reconstruirá la boca de un actor específico de una onda que ya tiene.
Preguntas frecuentes
- ¿Puede TI2V-5B emitir AAC?
- No. Decode es un marco de vídeo. Cualquier banda sonora es un segundo modelo o un posterior Wan API cerrado.
- ¿Es PrismAudio lo mismo?
- PrismAudio es una línea de seguimiento V2A (CoT-RL) de los autores de ThinkSound. La misma familia de problemas, punto de control diferente.
Fuentes primarias
Verificado con el README de Wan-Video/Wan2.2 · 28 de agosto de 2026