扩散 Transformer

Wan 的生成器是压缩视频潜变量上的扩散 Transformer,用流匹配训练——不是 U-Net。token 是时空补丁;文本经 UMT5 交叉注意力进来;时间步调制 AdaLN。

DiTflow matchingUMT5
本页目录 5
DiT 视频栈:噪声潜变量、补丁化、Transformer 块、反补丁、速度场
Wan2.2 DiT 循环。序列长度 = 帧数 × 空间补丁,所以 VAE 压缩直接决定显存。

为什么不是 U-Net

经典图像扩散用卷积 U-Net。DiT(Peebles & Xie)把骨干换成补丁潜变量上的 Transformer 块。视频把补丁网格伸到时间维。Wan 走这条线(与 2024–2025 多数视频模型相同),注意力才能建模长程运动和运镜。

流匹配,不只是 ε 预测

官方代码使用流匹配 / 整流流风格求解器(UniPC、Flow DPM)。网络预测从噪声到数据的速度场,而不只是 ε。README 与 ComfyUI 模板里的步数默认这套调度。

条件怎么进网络

  • 文本:UMT5-XXL 嵌入,每块交叉注意力。
  • 图像(I2V/FLF2V):CLIP-vision + VAE token,外加 MLP 投影(Wan2.1 的 FLF2V 还有 257×2 的首尾位置嵌入)。
  • 音频(S2V):独立注入路径(见官方 S2V 音频图)。
  • 时间步 / SNR:AdaLN;在 A14B 上还决定当前激活哪位专家。

常见问题

Wan 是自回归视频 LLM 吗?
不是。它是潜变量网格上的迭代去噪器。时间轴是扩散时间,不是从左到右的词。
U-Net 在哪?
Wan2.2 里没有。ComfyUI 图里若出现 UNetLoader,只是加载器名字——权重仍是 DiT 块。

一手来源

对照 Wan-Video/Wan2.2 README 核对 · 2026-08-28

© 2026 wan2.video