ويكي نماذج Wan 2.2
خريطة مصدر معتدلة لعائلة Apache-2.0 Wan2.2: نقاط التفتيش الرسمية للمهمة ، DiT MoE و Wan-VAE الأرقام من الورق / README ، ومجموعة استنتاجات المجتمع (LoRA ، FP8 ، GGUF ، VRAM ، async APIs). يتم توثيق الصوت الأصلي بعد ذلك Wan 2.5+ كخط منتج وليس كوزن 2.2.
تمت المراجعة وفق README لمشروع Wan-Video/Wan2.2 · 28 أغسطس 2026
البحث في الويكي
17 مقالة
عائلة النماذج
أي نقطة تفتيش مفتوحة موجودة، وما الذي أضافها لاحقا منتجات مغلقة Wan.
عائلة نماذج Wan
خريطة نقاط تفتيش Apache-2.0 Wan2.1 / Wan2.2 ضد منتجات مغلقة لاحقا Wan 2.53.0 ، ورؤية ما هي المهمة التي تغطي كل وزن في الواقع.
قراءة المقالالمهام
T2V، I2V، FLF2V، المرجعية، الخطاب، V2A، والصوت الفيديو الأصلي.
تحويل النص إلى فيديو
Wan2.2-T2V-A14B و TI2V-5B تحويل عرض استشارة إلى 480P أو 720P فيديو صامت. المهام الرسمية generate.py، والأحجام، و VRAM الأرضيات.
قراءة المقالتحويل الصورة إلى فيديو
I2V-A14B و TI2V-5B animate ثابت. الجانب يتبع الصورة المدخلة. إن عرض إضافي لا يخلف خيارًا إذا تمددها Qwen-VL.
قراءة المقالفيديو من الإطار الأول والأخير
المخصص مفتوح FLF2V هو Wan2.1-FLF2V ، وليس نقطة تفتيش Wan2.2. كيف ComfyUI يكتب اثنين من الأطر الرئيسية وما يفعله 2.2 I2V بدلاً من ذلك.
قراءة المقالتحويل المرجع إلى فيديو
الهوية والحركة من صور المرجعية أو فيديو محرك: Wan2.1-VACE (R2V / V2V / MV2V) و Wan2.2-Animate-14B.
قراءة المقالتحويل الصوت إلى فيديو
Wan2.2-S2V-14B تحويل صورة بالإضافة إلى خطاب أو أغنية إلى فيديو سينمائي مزامنة شفاه generate.py العلامات
قراءة المقالتحويل الفيديو إلى صوت
Wan2.2 T2V/I2V ينبعث الصورة الصامتة. فولي والنقاط تأتي من نموذج منفصل V2A مثل ThinkSound ، ثم mux.
قراءة المقالتوليد الصوت والفيديو معًا
الصورة المشتركة + الحوار + SFX هي ميزة منتج Wan 2.5 +. لا تولد الأوزان المفتوحة T2V/I2V 2.2 مسار صوتي.
قراءة المقالالبنية
DiT العمود الفقري، عالية/خفضة الضوضاء MoE الخبراء، و Wan-VAE الضغط.
Diffusion Transformer
Wan هو توازن تدفق DiT على 3D VAE latences ، وليس U-Net. علامات اللمسات ، UMT5 الانتباه المتقاطع ، والخطوة الزمنية AdaLN.
قراءة المقال
Mixture of Experts (MoE)
A14B تستخدم اثنين ~14B الخبراء (27B إجمالي 14B النشاطات عالية الضوضاء الخطوات المبكرة؛ تصفيفات منخفضة الضوضاء بعد SNR -تغيير
قراءة المقال
Wan-VAE
Wan2.2-VAE تضغط على T×H×W بمقدار 4×16×16 (معدل 64) ولا يزال يضرب العديد من 4×8×8 VAEs على PSNR / SSIM / LPIPS.
قراءة المقالالاستدلال
التوسع السريع، LoRA، الكميات، VRAM، والعمل التزامن APIs.
توسيع المطالبة
يمكن أن يوسع generate.py الرسمي عرضًا قصيرًا (أو صورة) مع DashScope Qwen أو محلي Qwen2.5 / Qwen2.5-VL.
قراءة المقالLoRA للفيديو
المعدلات المنخفضة على Wan DiT. MoE عادة ما تحتاج إلى زوج عالٍ من الضوضاء + منخفضة الضوضاء. لا تقذف T2V LoRAs على Animate.
قراءة المقالتكميم نماذج الفيديو
من النماذج الرسمية dtype إلى المجتمع FP8، GGUF، التقطير والكاش. ما كل مسار يتغير في الواقع في الرسم البياني.
قراءة المقالFP8 مقابل GGUF
FP8 يبقى GPU متمول كثيف. GGUF هو ملف وزن الكم الكلي للحمليات منخفضة VRAM. فإنها تحل مشاكل الذاكرة المختلفة.
قراءة المقالذاكرة VRAM لنماذج الفيديو
الطوابق الرسمية: A14B ≥ 80 GB واحد GPU؛ TI2V-5B ≥ 24 GB مع إزالة الحمل. حيث T5، DiT، التفعيلات و VAE تجلس في كومة.
قراءة المقالمهام API الفيديو غير المتزامنة
Wan أخذ العينات يستغرق دقائق. DashScope، فجوات دراديو، نسخة و fal جميعها تعيد هوية وظيفة والمسح لا تبقي HTTP مفتوحة.
قراءة المقالالمصادر
توقف الوزن المفتوح عند Wan2.2 (بضافة Wan2.1 FLF2V / VACE). Wan 2.5، 2.6، 2.7 و 3.0 الصوت الفيديو الأصلي هي API المنتجات دون نقاط تفتيش عامة في نمط 2.2.