Wiki に戻る アーキテクチャ

Diffusion Transformer

Wans生成子は,圧縮されたビデオラテンツ上のディフュージョントランスフォーマーで, U-Netではなく,フローマッチングで訓練されています.トークンはスペースタイムパッチです.テキストは UMT5 横断注意力を通して届きます.タイムステップは AdaLN をモジュラ化します.

DiTflow matchingUMT5
このページの目次 5
DiTビデオスタック:騒音の潜伏,パッチファイ,トランスフォーマーブロック,パッチ解除,速度
Wan2.2 DiTループ. 序列長さはフレーム × 空間パッチであるため, VAE 圧縮が VRAM を支配する.

なぜU-Netではなく DiT

クラシック画像拡散は,コンボルショナル U-Nets を使用した. DiT (Peebles & Xie) は,パッチされたラテンツ上のトランスフォーマーブロックで背骨を置き換えます.ビデオは,パッチグリッドを時間へと拡張します. Wan はその線 (多くの 20242025 ビデオモデルと共有) を続行します.注意は長距離動きとカメラの動きをモデル化することができます.

流れの匹配,エプシロン予測のみではありません

公式コードはフローマッチング/リクティフィード・フロースタイルソルバー (UniPC,Flow DPM) を使用している.ネットワークは,音からデータへの速度フィールドを ε ではなく,単に計算する. README (および ComfyUI テンプレート) でサンプリングステップのカウントは,スケジュラーファミリーを想定する.

調節

  • テキスト: UMT5-XXL 埋め込み,各ブロックの横断注意.
  • 画像 (I2V/FLF2V): CLIP-vision + VAEトークン,追加 MLPプロジェクト (FLF2V は Wan2.1 に 257×2トークンの最初の/最後のポジショナルの埋め込みを追加します).
  • 音声 (S2V): 専用注射路 (公式の注射路を参照) S2V 音声図)
  • タイムステップ / SNR: AdaLN; A14B で,この場合は,どの専門家がライブであることを選択します.

よくある質問

Wanは,自動退屈ビデオLLMですか?
代引式は,左から右に文字ではなく,散らばる時間です.
U-Netはどこだ?
部屋には1つもない Wan2.2仮に ComfyUI 負荷器の名前です 負荷器の名前です DiT ブロック

一次資料

Wan-Video/Wan2.2 README と照合済み · 2026年8月28日

© 2026 wan2.video