なぜU-Netではなく DiT
クラシック画像拡散は,コンボルショナル U-Nets を使用した. DiT (Peebles & Xie) は,パッチされたラテンツ上のトランスフォーマーブロックで背骨を置き換えます.ビデオは,パッチグリッドを時間へと拡張します. Wan はその線 (多くの 20242025 ビデオモデルと共有) を続行します.注意は長距離動きとカメラの動きをモデル化することができます.
流れの匹配,エプシロン予測のみではありません
公式コードはフローマッチング/リクティフィード・フロースタイルソルバー (UniPC,Flow DPM) を使用している.ネットワークは,音からデータへの速度フィールドを ε ではなく,単に計算する. README (および ComfyUI テンプレート) でサンプリングステップのカウントは,スケジュラーファミリーを想定する.
調節
- テキスト: UMT5-XXL 埋め込み,各ブロックの横断注意.
- 画像 (I2V/FLF2V): CLIP-vision + VAEトークン,追加 MLPプロジェクト (FLF2V は Wan2.1 に 257×2トークンの最初の/最後のポジショナルの埋め込みを追加します).
- 音声 (S2V): 専用注射路 (公式の注射路を参照) S2V 音声図)
- タイムステップ / SNR: AdaLN; A14B で,この場合は,どの専門家がライブであることを選択します.
よくある質問
- Wanは,自動退屈ビデオLLMですか?
- 代引式は,左から右に文字ではなく,散らばる時間です.
- U-Netはどこだ?
- 部屋には1つもない Wan2.2仮に ComfyUI 負荷器の名前です 負荷器の名前です DiT ブロック
一次資料
Wan-Video/Wan2.2 README と照合済み · 2026年8月28日

