Warum ist das ein anderes Modell
T2V/I2V Die DiT sind dazu ausgebildet, RGB (oder VAE) latent. V2A Modell bezeichnet Audio-Latente, die auf Videofunktionen bedingt sind (CLIPDie Vermischung dieser Köpfe in einen offenen 2.2 ckpt war nicht Teil der Veröffentlichung im Juli 2025.
ThinkSound in dieser Werkzeugfamilie
- Papier: Denkkette-Rasoning in MLLM für Audio-Generation und -bearbeitung (arXiv:2506.21448, NeurIPS 2025).
- Drei Stufen: Foley aus Video, objektzentrische Verfeinerung (Klick/Region), sprachgeführte Bearbeitung.
- Rückgrat: MM-DiT mit VideoLLaMA 2 CoT; Gewichte auf Hugging Face FunAudioLLM/ThinkSound.
Praktische Muscheln
Halten Sie die Wan clips Bildrate und Dauer. Erzeugen Sie Audio in einer entsprechenden Länge, dann ffmpeg -c:v kopieren -c:a aac. Wenn Sie Lippen-Synchronisierung Sprache benötigen, gehen Sie zu S2V anstelle von V2A V2A wird nicht wiederherstellen, eine bestimmte Schauspieler s Mund aus einer Welle Sie bereits haben.
Häufige Fragen
- Kann TI2V-5B AAC auslaufen?
- Die Decode ist ein Video-Frame. Jeder Soundtrack ist ein zweites Modell oder ein später geschlossenes Wan API.
- Ist PrismAudio das gleiche?
- PrismAudio ist eine Folge V2A Linie (CoT-RL) von den ThinkSound Autoren.
Primärquellen
Mit dem Wan-Video/Wan2.2 README abgeglichen · 28. August 2026