Vidéo vers audio

La vidéo à l'audio (V2A) est l'inverse de S2V: image silencieuse (ou sous-notée) dans, bande sonore. Wan2.2 T2V/I2V ne font pas cela. Le compagnon ouvert sur ce site est ThinkSound (FunAudioLLM), un modèle de co-guidé par co-codage Any2Audio.

ThinkSoundV2Afoley
Sur cette page 5
Vidéo silencieuse dans ThinkSound puis bande sonore mélangée
Flux de travail typique 2.2: générer des cadres Wan silencieux, puis exécuter un modèle V2A et mux.

Pourquoi c'est un modèle différent

T2V/I2V Les DTs sont formés à dénoncer le RGB (ou VAE) latentes. V2A Le modèle désigne les latences audio conditionnées sur des fonctionnalités vidéo (CLIPLe mélange de ces têtes dans un ckpt ouvert 2.2 n'était pas une partie de la sortie de juillet 2025.

ThinkSound dans cette famille d'outils

  • Document: Réflexion par chaîne de pensée dans les MLLM pour la génération et l'édition audio (arXiv:2506.21448, NeurIPS 2025).
  • Trois étapes: feuille de vidéo, raffinage centré sur l'objet (clique/région), édition guidée par le langage.
  • L'épine dorsale: MM-DiT avec VideoLLaMA 2 CoT; poids sur Hugging Face FunAudioLLM/ThinkSound.

Les mouches pratiques

Gardez le Wan clips fréquence d'images et durée. Générer de l'audio à une longueur correspondante, puis ffmpeg -c:v copie -c:a aac. Si vous avez besoin de la synchronisation des lèvres, allez à S2V au lieu de V2A — V2A ne reconstruira pas la bouche d'un acteur spécifique à partir d'une ondulation que vous avez déjà.

Questions fréquentes

Est-ce que TI2V-5B peut produire une AC?
Non, le décode est des images vidéo. Wan API.
PrismAudio est le même?
PrismAudio est une ligne de suivi V2A (CoT-RL) des auteurs de ThinkSound. La même famille de problèmes, point de contrôle différent.

Sources primaires

Vérifié avec le README Wan-Video/Wan2.2 · 28 août 2026

© 2026 wan2.video