Video zu Audio

Video-to-Audio (V2A) ist das Gegenteil von S2V: stille (oder untergeschnitten) Bild in, Soundtrack aus. Wan2.2 T2V/I2V tun dies nicht. Der offene Begleiter auf dieser Website ist ThinkSound (FunAudioLLM), ein CoT-geleitetes Flow-Matching Any2Audio-Modell.

ThinkSoundV2Afoley
Auf dieser Seite 5
Stille Video in ThinkSound und dann Mused Soundtrack
Typischer 2.2 Workflow: Generen Sie stillen Wan-Frame, dann führen Sie ein V2A-Modell und mux aus.

Warum ist das ein anderes Modell

T2V/I2V Die DiT sind dazu ausgebildet, RGB (oder VAE) latent. V2A Modell bezeichnet Audio-Latente, die auf Videofunktionen bedingt sind (CLIPDie Vermischung dieser Köpfe in einen offenen 2.2 ckpt war nicht Teil der Veröffentlichung im Juli 2025.

ThinkSound in dieser Werkzeugfamilie

  • Papier: Denkkette-Rasoning in MLLM für Audio-Generation und -bearbeitung (arXiv:2506.21448, NeurIPS 2025).
  • Drei Stufen: Foley aus Video, objektzentrische Verfeinerung (Klick/Region), sprachgeführte Bearbeitung.
  • Rückgrat: MM-DiT mit VideoLLaMA 2 CoT; Gewichte auf Hugging Face FunAudioLLM/ThinkSound.

Praktische Muscheln

Halten Sie die Wan clips Bildrate und Dauer. Erzeugen Sie Audio in einer entsprechenden Länge, dann ffmpeg -c:v kopieren -c:a aac. Wenn Sie Lippen-Synchronisierung Sprache benötigen, gehen Sie zu S2V anstelle von V2A V2A wird nicht wiederherstellen, eine bestimmte Schauspieler s Mund aus einer Welle Sie bereits haben.

Häufige Fragen

Kann TI2V-5B AAC auslaufen?
Die Decode ist ein Video-Frame. Jeder Soundtrack ist ein zweites Modell oder ein später geschlossenes Wan API.
Ist PrismAudio das gleiche?
PrismAudio ist eine Folge V2A Linie (CoT-RL) von den ThinkSound Autoren.

Primärquellen

Mit dem Wan-Video/Wan2.2 README abgeglichen · 28. August 2026

© 2026 wan2.video