为什么不是 U-Net
经典图像扩散用卷积 U-Net。DiT(Peebles & Xie)把骨干换成补丁潜变量上的 Transformer 块。视频把补丁网格伸到时间维。Wan 走这条线(与 2024–2025 多数视频模型相同),注意力才能建模长程运动和运镜。
流匹配,不只是 ε 预测
官方代码使用流匹配 / 整流流风格求解器(UniPC、Flow DPM)。网络预测从噪声到数据的速度场,而不只是 ε。README 与 ComfyUI 模板里的步数默认这套调度。
条件怎么进网络
- 文本:UMT5-XXL 嵌入,每块交叉注意力。
- 图像(I2V/FLF2V):CLIP-vision + VAE token,外加 MLP 投影(Wan2.1 的 FLF2V 还有 257×2 的首尾位置嵌入)。
- 音频(S2V):独立注入路径(见官方 S2V 音频图)。
- 时间步 / SNR:AdaLN;在 A14B 上还决定当前激活哪位专家。
常见问题
- Wan 是自回归视频 LLM 吗?
- 不是。它是潜变量网格上的迭代去噪器。时间轴是扩散时间,不是从左到右的词。
- U-Net 在哪?
- Wan2.2 里没有。ComfyUI 图里若出现 UNetLoader,只是加载器名字——权重仍是 DiT 块。
一手来源
对照 Wan-Video/Wan2.2 README 核对 · 2026-08-28

