SNR 切换,不是 token 路由
LLM MoE 常把每个 token 路由到一部分专家。Wan2.2 公开设计更粗:整个去噪步共用一个专家。SNR 随 t 下降。开始时 t 大、噪声高、SNR 处于 SNR_min,高噪声专家接管。阈值 t_moe 定义在 SNR_min 的一半;当 t < t_moe 切到低噪声专家。
为什么要两个专家
前期步决定全局布局与运动,后期步决定纹理与人脸。把容量沿这条轴切开,增大模型却不把每步 FLOPs 翻倍。README 对比验证损失:Wan2.1 稠密、混用「Wan2.1 + 一个新专家」、完整 Wan2.2 MoE——成对专家收敛最低。
推理时意味着什么
- 显存仍按 14B DiT 计,若两个专家都常驻还要加上闲置专家的权重。offload 可以把闲置专家换出。
- LoRA 通常需要高噪声文件 + 低噪声文件各一份。
- TI2V-5B 不是 MoE——它是带更强 VAE 的稠密 5B。
- 社区缓存(Cache-dit)可以分别跳过各专家内部计算。
常见问题
- 一次前向会跑两个专家吗?
- 按公开日程不会。每个时间步一个专家,沿 SNR 曲线切换一次。
- 能否只微调低噪声专家?
- 可以,README 的消融甚至测过混用专家——但质量低于成对训练。
一手来源
对照 Wan-Video/Wan2.2 README 核对 · 2026-08-28