為什麼不是 U-Net
經典影象擴散用卷積 U-Net。DiT(Peebles & Xie)把骨幹換成補丁潛變數上的 Transformer 塊。影片把補丁網格伸到時間維。Wan 走這條線(與 2024–2025 多數影片模型相同),注意力才能建模長程運動和運鏡。
流匹配,不只是 ε 預測
官方程式碼使用流匹配 / 整流流風格求解器(UniPC、Flow DPM)。網路預測從噪聲到資料的速度場,而不只是 ε。README 與 ComfyUI 模板裡的步數預設這套排程。
條件怎麼進網路
- 文字:UMT5-XXL 嵌入,每塊交叉注意力。
- 影象(I2V/FLF2V):CLIP-vision + VAE token,外加 MLP 投影(Wan2.1 的 FLF2V 還有 257×2 的首尾位置嵌入)。
- 音訊(S2V):獨立注入路徑(見官方 S2V 音訊圖)。
- 時間步 / SNR:AdaLN;在 A14B 上還決定當前啟用哪位專家。
常見問題
- Wan 是自迴歸影片 LLM 嗎?
- 不是。它是潛變數網格上的迭代去噪器。時間軸是擴散時間,不是從左到右的詞。
- U-Net 在哪?
- Wan2.2 裡沒有。ComfyUI 圖裡若出現 UNetLoader,只是載入器名字——權重仍是 DiT 塊。
一手來源
已對照 Wan-Video/Wan2.2 README 核對 · 2026-08-28

