混合专家 MoE

Wan2.2 的 A14B 是扩散时间轴上的双专家 MoE:一个 14B 专家管高噪声布局,一个 14B 专家管低噪声细节。总参约 27B;每步只跑约 14B,算力接近稠密 14B。

A14BSNR27B/14B
本页目录 5
官方 Wan2.2 MoE 架构:前期高噪声专家,后期低噪声专家
(a)早期去噪用高噪声专家。(b)后期用低噪声专家。每步只激活一个。

SNR 切换,不是 token 路由

LLM MoE 常把每个 token 路由到一部分专家。Wan2.2 公开设计更粗:整个去噪步共用一个专家。SNR 随 t 下降。开始时 t 大、噪声高、SNR 处于 SNR_min,高噪声专家接管。阈值 t_moe 定义在 SNR_min 的一半;当 t < t_moe 切到低噪声专家。

官方 SNR 曲线与 MoE 专家切换阈值
官方基于 SNR 的专家日程(README:assets/moe_2.png)。

为什么要两个专家

前期步决定全局布局与运动,后期步决定纹理与人脸。把容量沿这条轴切开,增大模型却不把每步 FLOPs 翻倍。README 对比验证损失:Wan2.1 稠密、混用「Wan2.1 + 一个新专家」、完整 Wan2.2 MoE——成对专家收敛最低。

推理时意味着什么

  • 显存仍按 14B DiT 计,若两个专家都常驻还要加上闲置专家的权重。offload 可以把闲置专家换出。
  • LoRA 通常需要高噪声文件 + 低噪声文件各一份。
  • TI2V-5B 不是 MoE——它是带更强 VAE 的稠密 5B。
  • 社区缓存(Cache-dit)可以分别跳过各专家内部计算。

常见问题

一次前向会跑两个专家吗?
按公开日程不会。每个时间步一个专家,沿 SNR 曲线切换一次。
能否只微调低噪声专家?
可以,README 的消融甚至测过混用专家——但质量低于成对训练。

一手来源

对照 Wan-Video/Wan2.2 README 核对 · 2026-08-28

© 2026 wan2.video