擴散 Transformer

Wan 的生成器是壓縮影片潛變數上的擴散 Transformer,用流匹配訓練——不是 U-Net。token 是時空補丁;文字經 UMT5 交叉注意力進來;時間步調製 AdaLN。

DiTflow matchingUMT5
本頁目錄 5
DiT 影片棧:噪聲潛變數、補丁化、Transformer 塊、反補丁、速度場
Wan2.2 DiT 迴圈。序列長度 = 幀數 × 空間補丁,所以 VAE 壓縮直接決定視訊記憶體。

為什麼不是 U-Net

經典影象擴散用卷積 U-Net。DiT(Peebles & Xie)把骨幹換成補丁潛變數上的 Transformer 塊。影片把補丁網格伸到時間維。Wan 走這條線(與 2024–2025 多數影片模型相同),注意力才能建模長程運動和運鏡。

流匹配,不只是 ε 預測

官方程式碼使用流匹配 / 整流流風格求解器(UniPC、Flow DPM)。網路預測從噪聲到資料的速度場,而不只是 ε。README 與 ComfyUI 模板裡的步數預設這套排程。

條件怎麼進網路

  • 文字:UMT5-XXL 嵌入,每塊交叉注意力。
  • 影象(I2V/FLF2V):CLIP-vision + VAE token,外加 MLP 投影(Wan2.1 的 FLF2V 還有 257×2 的首尾位置嵌入)。
  • 音訊(S2V):獨立注入路徑(見官方 S2V 音訊圖)。
  • 時間步 / SNR:AdaLN;在 A14B 上還決定當前啟用哪位專家。

常見問題

Wan 是自迴歸影片 LLM 嗎?
不是。它是潛變數網格上的迭代去噪器。時間軸是擴散時間,不是從左到右的詞。
U-Net 在哪?
Wan2.2 裡沒有。ComfyUI 圖裡若出現 UNetLoader,只是載入器名字——權重仍是 DiT 塊。

一手來源

已對照 Wan-Video/Wan2.2 README 核對 · 2026-08-28

© 2026 wan2.video