Pourquoi c'est un modèle différent
T2V/I2V Les DTs sont formés à dénoncer le RGB (ou VAE) latentes. V2A Le modèle désigne les latences audio conditionnées sur des fonctionnalités vidéo (CLIPLe mélange de ces têtes dans un ckpt ouvert 2.2 n'était pas une partie de la sortie de juillet 2025.
ThinkSound dans cette famille d'outils
- Document: Réflexion par chaîne de pensée dans les MLLM pour la génération et l'édition audio (arXiv:2506.21448, NeurIPS 2025).
- Trois étapes: feuille de vidéo, raffinage centré sur l'objet (clique/région), édition guidée par le langage.
- L'épine dorsale: MM-DiT avec VideoLLaMA 2 CoT; poids sur Hugging Face FunAudioLLM/ThinkSound.
Les mouches pratiques
Gardez le Wan clips fréquence d'images et durée. Générer de l'audio à une longueur correspondante, puis ffmpeg -c:v copie -c:a aac. Si vous avez besoin de la synchronisation des lèvres, allez à S2V au lieu de V2A — V2A ne reconstruira pas la bouche d'un acteur spécifique à partir d'une ondulation que vous avez déjà.
Questions fréquentes
- Est-ce que TI2V-5B peut produire une AC?
- Non, le décode est des images vidéo. Wan API.
- PrismAudio est le même?
- PrismAudio est une ligne de suivi V2A (CoT-RL) des auteurs de ThinkSound. La même famille de problèmes, point de contrôle différent.
Sources primaires
Vérifié avec le README Wan-Video/Wan2.2 · 28 août 2026