原生音影片一體

原生音影片指一次取樣同時出畫面和同步聲帶(對白、音效、配樂)。這是 Wan 2.5 起產品 API 宣傳的能力,不是 Wan2.2-T2V/I2V 開源權重的屬性。

Wan 2.5API-onlysync
本頁目錄 5
Wan2.2 開源無聲影片 vs Wan 2.5+ 原生音影片 API
把產品線與開源 checkpoint 分開放。

2.2 開源模型實際輸出

  • T2V-A14B / I2V-A14B / TI2V-5B — 無聲影片。
  • S2V-14B — 你提供音訊,模型做動畫。
  • Animate-14B — 動作遷移,不生成音訊。

2.5+ 產品補了什麼

公開的 2.5 介紹(fal、DashScope 類 API、聚合平臺)描述了對白、環境聲、配樂聯合生成,1080P,以及比 2.2 約 5 秒配方更長的片段。後續 2.6/2.7/3.0 繼續原生 AV,並加上多鏡頭或參考控制元件。這些都沒有以 Wan2.2 那種 GitHub checkpoint 形式釋出。

仍想留在開源權重上

繼續用 Apache-2.0 / 公開權重:先生成無聲 Wan2.2 影片,再用 ThinkSound(或其他 V2A)配 Foley;說話人頭用 CosyVoice + S2V。那是兩(或三)個模型,不是原生 AV。

常見問題

2.2 的 GGUF 會不會魔法加音訊?
不會。量化改的是權重量化型別,不是輸出模態。
S2V 算原生 AV 嗎?
不算。原生 AV 合成聲音;S2V 消費聲音。

一手來源

已對照 Wan-Video/Wan2.2 README 核對 · 2026-08-28

© 2026 wan2.video