为什么是另一个模型
T2V/I2V DiT 训练目标是去噪 RGB(或 VAE)潜变量。V2A 去噪的是音频潜变量,条件来自视频特征(CLIP/Sync)、字幕,常常还有思维链。2025-07 的 2.2 开源发布没有把这两个头焊在同一个 ckpt 里。
这条工具链里的 ThinkSound
- 论文:Chain-of-Thought Reasoning in MLLMs for Audio Generation and Editing(arXiv:2506.21448,NeurIPS 2025)。
- 三阶段:从视频出 Foley、点选/区域细化、语言指令编辑。
- 骨干:带 VideoLLaMA 2 CoT 的 MM-DiT;权重在 Hugging Face FunAudioLLM/ThinkSound。
混流实务
保持 Wan 片段的帧率与时长。生成等长音频,再用 ffmpeg -c:v copy -c:a aac。若要指定口型的对白,去 S2V 而不是 V2A——V2A 不会按你已有的 wav 重建某个演员的嘴型。
常见问题
- TI2V-5B 能直接出 AAC 吗?
- 不能。解码结果是视频帧。任何声带都是第二个模型或后续闭源 Wan API。
- PrismAudio 是同一个吗?
- PrismAudio 是 ThinkSound 作者后续的 V2A(CoT-RL)。同一问题族,不同 checkpoint。
一手来源
对照 Wan-Video/Wan2.2 README 核对 · 2026-08-28