混合專家 MoE

Wan2.2 的 A14B 是擴散時間軸上的雙專家 MoE:一個 14B 專家管高噪聲佈局,一個 14B 專家管低噪聲細節。總參約 27B;每步只跑約 14B,算力接近稠密 14B。

A14BSNR27B/14B
本頁目錄 5
官方 Wan2.2 MoE 架構:前期高噪聲專家,後期低噪聲專家
(a)早期去噪用高噪聲專家。(b)後期用低噪聲專家。每步只啟用一個。

SNR 切換,不是 token 路由

LLM MoE 常把每個 token 路由到一部分專家。Wan2.2 公開設計更粗:整個去噪步共用一個專家。SNR 隨 t 下降。開始時 t 大、噪聲高、SNR 處於 SNR_min,高噪聲專家接管。閾值 t_moe 定義在 SNR_min 的一半;當 t < t_moe 切到低噪聲專家。

官方 SNR 曲線與 MoE 專家切換閾值
官方基於 SNR 的專家日程(README:assets/moe_2.png)。

為什麼要兩個專家

前期步決定全域性佈局與運動,後期步決定紋理與人臉。把容量沿這條軸切開,增大模型卻不把每步 FLOPs 翻倍。README 對比驗證損失:Wan2.1 稠密、混用「Wan2.1 + 一個新專家」、完整 Wan2.2 MoE——成對專家收斂最低。

推理時意味著什麼

  • 視訊記憶體仍按 14B DiT 計,若兩個專家都常駐還要加上閒置專家的權重。offload 可以把閒置專家換出。
  • LoRA 通常需要高噪聲檔案 + 低噪聲檔案各一份。
  • TI2V-5B 不是 MoE——它是帶更強 VAE 的稠密 5B。
  • 社群快取(Cache-dit)可以分別跳過各專家內部計算。

常見問題

一次前向會跑兩個專家嗎?
按公開日程不會。每個時間步一個專家,沿 SNR 曲線切換一次。
能否只微調低噪聲專家?
可以,README 的消融甚至測過混用專家——但質量低於成對訓練。

一手來源

已對照 Wan-Video/Wan2.2 README 核對 · 2026-08-28

© 2026 wan2.video