影片生音訊

影片生音訊(V2A)是 S2V 的反方向:無聲(或欠配樂)畫面進,聲帶出。Wan2.2 的 T2V/I2V 不做這件事。本站對應的開源搭檔是 ThinkSound(FunAudioLLM),CoT 引導的流匹配 Any2Audio。

ThinkSoundV2Afoley
本頁目錄 5
無聲影片進入 ThinkSound 再混流聲帶
常見 2.2 工作流:先出無聲 Wan 幀,再跑 V2A,最後混流。

為什麼是另一個模型

T2V/I2V DiT 訓練目標是去噪 RGB(或 VAE)潛變數。V2A 去噪的是音訊潛變數,條件來自影片特徵(CLIP/Sync)、字幕,常常還有思維鏈。2025-07 的 2.2 開源釋出沒有把這兩個頭焊在同一個 ckpt 裡。

這條工具鏈裡的 ThinkSound

  • 論文:Chain-of-Thought Reasoning in MLLMs for Audio Generation and Editing(arXiv:2506.21448,NeurIPS 2025)。
  • 三階段:從影片出 Foley、點選/區域細化、語言指令編輯。
  • 骨幹:帶 VideoLLaMA 2 CoT 的 MM-DiT;權重在 Hugging Face FunAudioLLM/ThinkSound。

混流實務

保持 Wan 片段的幀率與時長。生成等長音訊,再用 ffmpeg -c:v copy -c:a aac。若要指定口型的對白,去 S2V 而不是 V2A——V2A 不會按你已有的 wav 重建某個演員的嘴型。

常見問題

TI2V-5B 能直接出 AAC 嗎?
不能。解碼結果是影片幀。任何聲帶都是第二個模型或後續閉源 Wan API。
PrismAudio 是同一個嗎?
PrismAudio 是 ThinkSound 作者後續的 V2A(CoT-RL)。同一問題族,不同 checkpoint。

一手來源

已對照 Wan-Video/Wan2.2 README 核對 · 2026-08-28

© 2026 wan2.video