SNR スイッチ,トークンルーターではない
LLM MOEはしばしば各トークンを専門家小組に転送します. Wan2.2sの公開設計は粗略です:全デノイズステップは1専門家を使用します. SNRは tが減少するにつれて落ちます.開始時に,tは大きい,騒音は高い, SNRはSNR_minで,高騒音専門家がステップを所有します.T_moeの限界値は SNR_minの半分で定義されます.
なぜ2人の専門家
初期段階では,全体的なレイアウトと動きを決定する.後段階ではテクスチャと面を決定する.その軸に沿ってFLOPを倍増せずにモデルを拡大する. READMEは検証損失を比較する. Wan2.1密集,混合 Wan2.1 +新しい専門家,と完全な Wan2.2 MoE は,完全なペアが最も低い収束です.
推移の結果
- VRAM は,まだ 14B DiT を 追跡する.両者とも居住している場合,第2の専門家の重み加算する.
- LoRAsは通常,高騒音ファイルと低騒音ファイルが必要です.
- TI2V-5B は MoE でありませんが,重度の VAE が多い密度の 5B です.
- コミュニティキャッシュ (Cache-dit) は各専門家内部での作業を別々にスキップすることができます.
よくある質問
- 専門家が2人とも1人ずつ進んでいるのか?
- 公開されたスケジュールではありません タイムステップごとに1人の専門家が SNR 曲線に沿って1回切り替えます
- 低音の専門家だけ 調整できる?
- 可能なこと,そして READMEのアブラレーションは混合専門家をテストするにも関わらず が,ペアを訓練するよりも質が低下する.
一次資料
Wan-Video/Wan2.2 README と照合済み · 2026年8月28日