SNR 切換,不是 token 路由
LLM MoE 常把每個 token 路由到一部分專家。Wan2.2 公開設計更粗:整個去噪步共用一個專家。SNR 隨 t 下降。開始時 t 大、噪聲高、SNR 處於 SNR_min,高噪聲專家接管。閾值 t_moe 定義在 SNR_min 的一半;當 t < t_moe 切到低噪聲專家。
為什麼要兩個專家
前期步決定全域性佈局與運動,後期步決定紋理與人臉。把容量沿這條軸切開,增大模型卻不把每步 FLOPs 翻倍。README 對比驗證損失:Wan2.1 稠密、混用「Wan2.1 + 一個新專家」、完整 Wan2.2 MoE——成對專家收斂最低。
推理時意味著什麼
- 視訊記憶體仍按 14B DiT 計,若兩個專家都常駐還要加上閒置專家的權重。offload 可以把閒置專家換出。
- LoRA 通常需要高噪聲檔案 + 低噪聲檔案各一份。
- TI2V-5B 不是 MoE——它是帶更強 VAE 的稠密 5B。
- 社群快取(Cache-dit)可以分別跳過各專家內部計算。
常見問題
- 一次前向會跑兩個專家嗎?
- 按公開日程不會。每個時間步一個專家,沿 SNR 曲線切換一次。
- 能否只微調低噪聲專家?
- 可以,README 的消融甚至測過混用專家——但質量低於成對訓練。
一手來源
已對照 Wan-Video/Wan2.2 README 核對 · 2026-08-28