2.2 开源模型实际输出
- T2V-A14B / I2V-A14B / TI2V-5B — 无声视频。
- S2V-14B — 你提供音频,模型做动画。
- Animate-14B — 动作迁移,不生成音频。
2.5+ 产品补了什么
公开的 2.5 介绍(fal、DashScope 类 API、聚合平台)描述了对白、环境声、配乐联合生成,1080P,以及比 2.2 约 5 秒配方更长的片段。后续 2.6/2.7/3.0 继续原生 AV,并加上多镜头或参考控件。这些都没有以 Wan2.2 那种 GitHub checkpoint 形式发布。
仍想留在开源权重上
继续用 Apache-2.0 / 公开权重:先生成无声 Wan2.2 视频,再用 ThinkSound(或其他 V2A)配 Foley;说话人头用 CosyVoice + S2V。那是两(或三)个模型,不是原生 AV。
常见问题
- 2.2 的 GGUF 会不会魔法加音频?
- 不会。量化改的是权重量化类型,不是输出模态。
- S2V 算原生 AV 吗?
- 不算。原生 AV 合成声音;S2V 消费声音。
一手来源
对照 Wan-Video/Wan2.2 README 核对 · 2026-08-28