2.2 開源模型實際輸出
- T2V-A14B / I2V-A14B / TI2V-5B — 無聲影片。
- S2V-14B — 你提供音訊,模型做動畫。
- Animate-14B — 動作遷移,不生成音訊。
2.5+ 產品補了什麼
公開的 2.5 介紹(fal、DashScope 類 API、聚合平臺)描述了對白、環境聲、配樂聯合生成,1080P,以及比 2.2 約 5 秒配方更長的片段。後續 2.6/2.7/3.0 繼續原生 AV,並加上多鏡頭或參考控制元件。這些都沒有以 Wan2.2 那種 GitHub checkpoint 形式釋出。
仍想留在開源權重上
繼續用 Apache-2.0 / 公開權重:先生成無聲 Wan2.2 影片,再用 ThinkSound(或其他 V2A)配 Foley;說話人頭用 CosyVoice + S2V。那是兩(或三)個模型,不是原生 AV。
常見問題
- 2.2 的 GGUF 會不會魔法加音訊?
- 不會。量化改的是權重量化型別,不是輸出模態。
- S2V 算原生 AV 嗎?
- 不算。原生 AV 合成聲音;S2V 消費聲音。
一手來源
已對照 Wan-Video/Wan2.2 README 核對 · 2026-08-28