Wan 2.2 मॉडल Wiki
Apache-2.0 Wan2.2 परिवार का स्रोत-जाँच किया गया नक्शाः आधिकारिक कार्य चेकपोइंट, कागज / README से DiT MoE और Wan-VAE आंकड़े, और सामुदायिक निष्कर्ष स्टैक (LoRA, FP8, GGUF, VRAM, async APIs) । बाद में Wan 2.5+ मूल ऑडियो को उत्पाद लाइन के रूप में दस्तावेज किया जाता है 2.2 वजन के रूप में नहीं।
Wan-Video/Wan2.2 README से सत्यापित · 28 अगस्त 2026
Wiki में खोजें
17 लेख
मॉडल परिवार
कौन सा खुला चेकपॉइंट मौजूद है, और बाद में कौन सा बंद Wan उत्पाद जोड़ा गया है।
Wan मॉडल परिवार
बाद में बंद Wan 2.53.0 उत्पादों के साथ Apache-2.0 Wan2.1 / Wan2.2 चेकपोइंट का नक्शा बनाएं, और देखें कि प्रत्येक वजन वास्तव में किस कार्य को कवर करता है।
लेख पढ़ेंकार्य
T2V, I2V, FLF2V, संदर्भ, भाषण, V2A, और मूल ऑडियो-वीडियो।
टेक्स्ट से वीडियो
Wan2.2-T2V-A14B और TI2V-5B एक प्रॉम्प्ट को 480P या 720P मूक वीडियो में बदल दें। आधिकारिक generate.py कार्य, आकार और VRAM मंजिलें।
लेख पढ़ेंइमेज से वीडियो
I2V-A14B और TI2V-5B animate एक स्थिर। पहलू इनपुट छवि का अनुसरण करता है; एक प्रॉम्प्ट वैकल्पिक है यदि Qwen-VL इसे बढ़ाता है।
लेख पढ़ेंपहले और अंतिम फ़्रेम से वीडियो
समर्पित खुला FLF2V Wan2.1-FLF2V है, Wan2.2 चेकपॉइंट नहीं। ComfyUI कैसे दो कीफ्रेम बुक करता है और इसके बजाय 2.2 I2V क्या करता है।
लेख पढ़ेंरेफ़रेंस से वीडियो
संदर्भ चित्रों या ड्राइव वीडियो से पहचान और गतिः Wan2.1-VACE (R2V / V2V / MV2V) और Wan2.2-Animate-14B।
लेख पढ़ेंआवाज़ से वीडियो
Wan2.2-S2V-14B एक चित्र और भाषण या गीत को लिप सिंक किए गए सिनेमाई वीडियो में बदल देता है। आधिकारिक पाइपलाइन आंकड़े और generate.py ध्वज।
लेख पढ़ेंवीडियो से ऑडियो
Wan2.2 T2V/I2V मूक तस्वीर emit. फ़ोली और स्कोर एक अलग V2A मॉडल से आते हैं जैसे कि थिंकसाउंड, फिर म्यूक्स।
लेख पढ़ेंनेटिव ऑडियो-वीडियो
संयुक्त चित्र + संवाद + SFX Wan 2.5+ उत्पाद सुविधा है। 2.2 खुला T2V/I2V वजन एक साउंडट्रैक उत्पन्न नहीं करते हैं।
लेख पढ़ेंआर्किटेक्चर
DiT रीढ़ की हड्डी, उच्च/कम शोर MoE विशेषज्ञ, और Wan-VAE संपीड़न।
Diffusion Transformer
Wan एक 3D VAE लटेंट्स पर एक प्रवाह-मिलान DiT है, एक यू-नेट नहीं। पैच टोकन, UMT5 क्रॉस-अटेंशन, और टाइमस्टेप AdaLN।
लेख पढ़ें
Mixture of Experts (MoE)
A14B दो ~14B विशेषज्ञों (27B कुल, 14B सक्रिय) का उपयोग करता है। उच्च शोर लेआउट प्रारंभिक चरणों; SNR स्विच के बाद कम शोर परिष्कृत करता है।
लेख पढ़ें
इन्फ़रेंस
शीघ्र विस्तार, LoRA, क्वांटिज़ेशन, VRAM, और समक्रमण कार्य APIs।
प्रॉम्प्ट विस्तार
आधिकारिक generate.py DashScope Qwen या स्थानीय Qwen2.5 / Qwen2.5-VL के साथ एक छोटा प्रॉम्प्ट (या एक छवि) बढ़ा सकता है।
लेख पढ़ेंवीडियो LoRA
Wan DiT पर कम रैंक वाले एडाप्टर। MoE को आमतौर पर उच्च शोर + कम शोर वाले जोड़े की आवश्यकता होती है। T2V LoRAs को Animate पर न छोड़ें।
लेख पढ़ेंवीडियो क्वांटाइज़ेशन
आधिकारिक डीटाइप कास्ट से सामुदायिक FP8, GGUF, डिस्टिलिशन और कैश तक। ग्राफ में प्रत्येक पथ वास्तव में क्या बदलता है।
लेख पढ़ेंFP8 बनाम GGUF
FP8 घने GPU matmul रहता है। GGUF कम-VRAM लोडर के लिए एक ब्लॉक-क्वांटम वजन फ़ाइल है। वे विभिन्न मेमोरी समस्याओं को हल करते हैं।
लेख पढ़ेंवीडियो मॉडल VRAM
आधिकारिक मंजिलेंः A14B ≥ 80 GB एकल GPU; TI2V-5B ≥ 24 GB ढीला लोड के साथ। जहां T5, DiT, सक्रियण और VAE स्टैक में बैठते हैं।
लेख पढ़ेंअसिंक्रोनस वीडियो API जॉब
Wan नमूनाकरण मिनटों में होता है. DashScope, ग्रेडियो स्पेस, प्रतिकृति और फ़ल सभी एक नौकरी आईडी और सर्वेक्षण HTTP खुला नहीं रखते हैं।
लेख पढ़ेंस्रोत
खुले वजन Wan2.2 पर रुकते हैं (और Wan2.1 FLF2V / VACE) । Wan 2.5, 2.6, 2.7 और 3.0 नेटिव ऑडियो-वीडियो सार्वजनिक 2.2 शैली के चेकपोइंट के बिना API उत्पाद हैं।