為什麼是另一個模型
T2V/I2V DiT 訓練目標是去噪 RGB(或 VAE)潛變數。V2A 去噪的是音訊潛變數,條件來自影片特徵(CLIP/Sync)、字幕,常常還有思維鏈。2025-07 的 2.2 開源釋出沒有把這兩個頭焊在同一個 ckpt 裡。
這條工具鏈裡的 ThinkSound
- 論文:Chain-of-Thought Reasoning in MLLMs for Audio Generation and Editing(arXiv:2506.21448,NeurIPS 2025)。
- 三階段:從影片出 Foley、點選/區域細化、語言指令編輯。
- 骨幹:帶 VideoLLaMA 2 CoT 的 MM-DiT;權重在 Hugging Face FunAudioLLM/ThinkSound。
混流實務
保持 Wan 片段的幀率與時長。生成等長音訊,再用 ffmpeg -c:v copy -c:a aac。若要指定口型的對白,去 S2V 而不是 V2A——V2A 不會按你已有的 wav 重建某個演員的嘴型。
常見問題
- TI2V-5B 能直接出 AAC 嗎?
- 不能。解碼結果是影片幀。任何聲帶都是第二個模型或後續閉源 Wan API。
- PrismAudio 是同一個嗎?
- PrismAudio 是 ThinkSound 作者後續的 V2A(CoT-RL)。同一問題族,不同 checkpoint。
一手來源
已對照 Wan-Video/Wan2.2 README 核對 · 2026-08-28