原生音视频一体

原生音视频指一次采样同时出画面和同步声带(对白、音效、配乐)。这是 Wan 2.5 起产品 API 宣传的能力,不是 Wan2.2-T2V/I2V 开源权重的属性。

Wan 2.5API-onlysync
本页目录 5
Wan2.2 开源无声视频 vs Wan 2.5+ 原生音视频 API
把产品线与开源 checkpoint 分开放。

2.2 开源模型实际输出

  • T2V-A14B / I2V-A14B / TI2V-5B — 无声视频。
  • S2V-14B — 你提供音频,模型做动画。
  • Animate-14B — 动作迁移,不生成音频。

2.5+ 产品补了什么

公开的 2.5 介绍(fal、DashScope 类 API、聚合平台)描述了对白、环境声、配乐联合生成,1080P,以及比 2.2 约 5 秒配方更长的片段。后续 2.6/2.7/3.0 继续原生 AV,并加上多镜头或参考控件。这些都没有以 Wan2.2 那种 GitHub checkpoint 形式发布。

仍想留在开源权重上

继续用 Apache-2.0 / 公开权重:先生成无声 Wan2.2 视频,再用 ThinkSound(或其他 V2A)配 Foley;说话人头用 CosyVoice + S2V。那是两(或三)个模型,不是原生 AV。

常见问题

2.2 的 GGUF 会不会魔法加音频?
不会。量化改的是权重量化类型,不是输出模态。
S2V 算原生 AV 吗?
不算。原生 AV 合成声音;S2V 消费声音。

一手来源

对照 Wan-Video/Wan2.2 README 核对 · 2026-08-28

© 2026 wan2.video