Pourquoi DiT au lieu de U-Net
La diffusion d'images classique utilise des U-Nets convolus. DiT (Peebles & Xie) remplace la colonne vertébrale par des blocs transformateurs sur des latents parchetés. La vidéo étend la grille de parchet dans le temps. Wan suit cette ligne (partagée avec de nombreux modèles vidéo 20242025) afin que l'attention puisse modéliser le mouvement à longue portée et les mouvements de la caméra.
Parallèle de flux, pas seulement de prédiction d'epsilon
Le code officiel utilise des résolveurs de style de flux de correspondance / de flux rectifié (UniPC, Flow DPM). Le réseau prédit un champ de vitesse du bruit aux données plutôt que seulement ε. Les étapes de prise d'échantillons sont comptées dans les modèles README (et ComfyUI) en supposant que la famille des planificateurs.
Conditionnement
- Text: UMT5-XXL incrustations, attention croisée dans chaque bloc.
- Image (I2V/FLF2V): CLIP-vision + VAE jetons, projet MLP supplémentaire (FLF2V ajoute une première/dernière intégration positionnelle de jetons 257×2 dans Wan2.1).
- Audio (S2V): une voie d'injection dédiée (voir le document officiel S2V figure audio).
- Étapes de temps / SNR: AdaLN; sur A14B, il est également possible de choisir l'expert en direct.
Questions fréquentes
- Est-ce que Wan est un LLM vidéo autorégressif?
- Non, c'est un dénonciateur itératif sur une grille latente.
- Où est le U-Net?
- Il n'y en a pas dans Wan2.2. Si un graphique ComfyUI affiche un UNetLoader, c'est un nom de chargement les poids sont toujours DiT blocs.
Sources primaires
Vérifié avec le README Wan-Video/Wan2.2 · 28 août 2026

