Warum DiT statt U-Net
Die klassische Bilddiffusion verwendet konvolutionale U-Nets. DiT (Peebles & Xie) ersetzt das Rückgrat durch Transformatorblöcke auf patched latents. Video erweitert das Patch-Gitter in die Zeit. Wan folgt dieser Linie (geteilt mit vielen 20242025 Video Modelle), so dass Aufmerksamkeit kann langfristige Bewegung und Kamerabewegungen modellieren.
Durchflussgleichung, nicht nur Epsilon-Vorhersage
Der offizielle Code verwendet Flow-Matching / rectified-flow-style-Solver (UniPC, Flow DPM). Das Netzwerk prognostiziert ein Geschwindigkeitsfeld vom Lärm bis zu Daten und nicht nur ε. Die Sammelschritte zählen in den README (und ComfyUI Vorlagen) davon aus, dass die Planerfamilie.
Verpackung
- Text: UMT5-XXL Einbettungen, Kreuz-Aufmerksamkeit in jedem Block.
- Bild (I2V/FLF2V): CLIP-vision + VAE Token, zusätzliches MLP-Projekt (FLF2V fügt eine erste/letzte positionale Einbettung von 257×2 Token in Wan2.1 hinzu).
- Audio (S2V): ein spezieller Injektionsweg (siehe S2V (audio-figur).
- Zeitstufe / SNR: AdaLN; bei A14B wird auch ausgewählt, welcher Experte live ist.
Häufige Fragen
- Ist Wan ein autoregressiver Video-LLM?
- Nein, es ist ein iterativer Kennzeichen auf einem latenten Raster.
- Wo ist das U-Net?
- Es gibt keinen in Wan2.2. Wenn ein ComfyUI Graph einen UNetLoader zeigt, ist das ein Lader-Name die Gewichte sind immer noch DiT Blöcke.
Primärquellen
Mit dem Wan-Video/Wan2.2 README abgeglichen · 28. August 2026

