Wiki des modèles Wan 2.2
Une carte source-vérifiée de la famille Apache-2.0 Wan2.2: points de contrôle officiels de tâches, DiT MoE et Wan-VAE chiffres du papier / README, et la pile d'inférence communautaire (LoRA, FP8, GGUF, VRAM, async APIs). Plus tard Wan 2.5+ audio natif est documenté comme une ligne de produit et non comme 2,2 poids.
Vérifié avec le README Wan-Video/Wan2.2 · 28 août 2026
Rechercher dans le Wiki
17 articles
Famille de modèles
Quels sont les points de contrôle ouverts et quels sont les produits fermés Wan ajoutés plus tard.
Famille de modèles Wan
Mettez en cartographie les points de contrôle Apache-2.0 Wan2.1 / Wan2.2 contre les produits Wan 2.53.0 fermés plus tard, et voyez quelle tâche chaque poids couvre réellement.
Lire l’articleTâches
T2V, I2V, FLF2V, référence, discours, V2A, et audio vidéo natif.
Texte vers vidéo
Wan2.2-T2V-A14B et TI2V-5B transformer une demande en 480P ou 720P Vidéo silencieuse. generate.py les tâches, les tailles et VRAM Les étages.
Lire l’articleImage vers vidéo
I2V-A14B et TI2V-5B animate un fixe. L'aspect suit l'image d'entrée; une demande est facultative si Qwen-VL l'étend.
Lire l’articleVidéo avec première et dernière image
Le code d'ouverture dédié FLF2V est Wan2.1-FLF2V, pas un Wan2.2 point de contrôle. Comment ComfyUI classe deux cadres de clés et ce que 2.2 I2V fait à la place.
Lire l’articleRéférence vers vidéo
Identification et mouvement à partir d'images de référence ou d'une vidéo de lecteur: Wan2.1-VACE (R2V / V2V / MV2V) et Wan2.2-Animate-14B.
Lire l’articleVoix vers vidéo
Wan2.2-S2V-14B Il est possible de transformer un portrait plus un discours ou une chanson en vidéo cinématographique synchronisée par des lèvres. generate.py Les drapeaux.
Lire l’articleVidéo vers audio
Wan2.2 T2V/I2V Foley et les scores proviennent d'un V2A Un modèle comme ThinkSound, puis mux.
Lire l’articleAudio et vidéo natifs
La photo commune + dialogue + SFX est une fonctionnalité de produit Wan 2.5+. Les poids T2V/I2V ouverts 2.2 ne génèrent pas de bande son.
Lire l’articleArchitecture
DiT L'épaule, haut/bas bruit MoE des experts, et Wan-VAE - La compression.
Diffusion Transformer
Wan est un flux de correspondance DiT sur 3D VAE Les jetons de patch, les jetons de patch, les jetons de patch, les jetons de patch, les jetons de patch, les jetons de patch. UMT5 - l'attention croisée et l'étape de temps AdaLN.
Lire l’article
Mixture of Experts (MoE)
A14B utilise deux ~14B les experts (27B au total, 14B Les premières étapes de la mise en place de la structure de la structure de l'appareil sont actives. SNR - Je suis en train de changer.
Lire l’article
Wan-VAE
Wan2.2-VAE comprime T×H×W par 4×16×16 (taux 64) et bat encore plusieurs VAE 4×8×8 sur PSNR / SSIM / LPIPS.
Lire l’articleInférence
Extension rapide, LoRA, quantification, VRAM, et travail de synchronisation APIs.
Extension de prompt
Le generate.py officiel peut étendre un prompt court (ou une image) avec DashScope Qwen ou un local Qwen2.5 / Qwen2.5-VL.
Lire l’articleLoRA vidéo
Adapters à basse fréquence activés Wan DiT. MoE Il faut généralement une paire haute bruit + faible bruit. T2V LoRAs sur le Animate.
Lire l’articleQuantification vidéo
De la distribution officielle dtype à la communauté FP8, GGUF, la distillation et le cache.
Lire l’articleFP8 vs GGUF
FP8 reste un matmul GPU dense. GGUF est un fichier de poids quantique de bloc pour les chargeurs de faible VRAM. Ils résolvent différents problèmes de mémoire.
Lire l’articleVRAM des modèles vidéo
Planches officielles: A14B ≥ 80 GB simple GPU; TI2V-5B ≥ 24 GB avec décharge. Là où T5, DiT, les activations et VAE sont placés dans la pile.
Lire l’articleTâches asynchrones d’API vidéo
Wan Le prélèvement prend quelques minutes. DashScope, Gradio Spaces, Replicate et fal tous renvoyer un identifiant d'emploi et sondage ne tiennent pas HTTP ouvert.
Lire l’articleSources
Les poids ouverts s'arrêtent à Wan2.2 (plus Wan2.1 FLF2V / VACE). Wan 2.5, 2.6, 2.7 et 3.0 audio-vidéo natifs sont des produits API sans points de contrôle publics de type 2.2.