视频生音频

视频生音频(V2A)是 S2V 的反方向:无声(或欠配乐)画面进,声带出。Wan2.2 的 T2V/I2V 不做这件事。本站对应的开源搭档是 ThinkSound(FunAudioLLM),CoT 引导的流匹配 Any2Audio。

ThinkSoundV2Afoley
本页目录 5
无声视频进入 ThinkSound 再混流声带
常见 2.2 工作流:先出无声 Wan 帧,再跑 V2A,最后混流。

为什么是另一个模型

T2V/I2V DiT 训练目标是去噪 RGB(或 VAE)潜变量。V2A 去噪的是音频潜变量,条件来自视频特征(CLIP/Sync)、字幕,常常还有思维链。2025-07 的 2.2 开源发布没有把这两个头焊在同一个 ckpt 里。

这条工具链里的 ThinkSound

  • 论文:Chain-of-Thought Reasoning in MLLMs for Audio Generation and Editing(arXiv:2506.21448,NeurIPS 2025)。
  • 三阶段:从视频出 Foley、点选/区域细化、语言指令编辑。
  • 骨干:带 VideoLLaMA 2 CoT 的 MM-DiT;权重在 Hugging Face FunAudioLLM/ThinkSound。

混流实务

保持 Wan 片段的帧率与时长。生成等长音频,再用 ffmpeg -c:v copy -c:a aac。若要指定口型的对白,去 S2V 而不是 V2A——V2A 不会按你已有的 wav 重建某个演员的嘴型。

常见问题

TI2V-5B 能直接出 AAC 吗?
不能。解码结果是视频帧。任何声带都是第二个模型或后续闭源 Wan API。
PrismAudio 是同一个吗?
PrismAudio 是 ThinkSound 作者后续的 V2A(CoT-RL)。同一问题族,不同 checkpoint。

一手来源

对照 Wan-Video/Wan2.2 README 核对 · 2026-08-28

© 2026 wan2.video