Mixture of Experts (MoE)

Wan2.2s A14B النماذج هي خبيرين MoE على خط زمني للتوزيع: واحد 14B خبير في تصميمات الضوضاء العالية، واحد 14B خبير للتفاصيل المنخفضة الضوضاء27B المعلمات فقط14B يذهبون في كل خطوة، لذلك الحساب يبقى قريب من كثافة 14B.

A14BSNR27B/14B
محتويات الصفحة 5
رسمية Wan2.2 MoE الهندسة المعمارية: خبير ضجيج كبير في وقت مبكر، خبير ضجيج منخفض في وقت لاحق
(أ) استخدام الخبير في التخفيض المبكر لضوضاء عالية. (ب) استخدام الخبير في الخطوات اللاحقة لضوضاء منخفضة.

SNR المفتاح، وليس جهاز توجيه رمزي

غالبا ما توجه مؤسسات الـ LLM MOE كل رمز إلى مجموعة فرعية من الخبراء. Wan2.2 تصميم المنشور أكثر حدة: تستخدم الخطوة الكاملة للتخفيض خبير واحد. SNR تسقط مع انخفاض t. في البداية ، t كبير ، الضجيج مرتفع ، SNR هو في SNR_min ، وخبير الضجيج العالي يمتلك الخطوة. يتم تعريف عتبة t_moe في نصف SNR_min ؛ عندما t < t_moe يتولى الخبير منخفض الضجيج.

المتحول الرسمي SNR والعالم MoE عتبة المتحول
جدول الخبراء الرسمي القائم على SNR (README: الأصول/moe_2.png).

لماذا خبيران

الخطوات الأولى تحدد التخطيط والحركة العالمية؛ الخطوات اللاحقة تحدد النسيج والوجوه. وتكبير القدرة على امتداد هذا المحور دون مضاعفة FLOPs في كل خطوة. README يُقارن خسارة التحقق: Wan2.1 كثيفة، مختلطة Wan2.1 + خبير جديد، و كامل Wan2.2 MoE يلتقي الزوج الكامل أدنى.

عواقب الإستثمار

  • VRAM لا يزال يتتبع 14B DiT زائد ثقيلة الخبير الثاني إذا كان كلاهما يظل مقيما.
  • LoRAs عادة ما تحتاج إلى ملف عالٍ من الضوضاء وملف منخفض الضوضاء.
  • TI2V-5B ليست MoE انها 5B كثيفة مع ثقيلة VAE.
  • يمكن أن يفرض الكاش المجتمعي (Cache-dit) العمل داخل كل خبير بشكل منفصل.

أسئلة شائعة

هل يذهب كل الخبراء في واحد إلى الأمام؟
ليس في الجدول الزمني المنشورة، خبير واحد لكل خطوة زمنية، يتحول مرة واحدة على طول منحنى SNR
هل يمكنني تحسين فقط الخبير منخفض الضوضاء؟
ممكن، و READMEs التجاوز حتى اختبار الخبراء المختلطة ولكن الجودة تنخفض مقابل تدريب الزوج.

المصادر الأولية

تمت المراجعة وفق README لمشروع Wan-Video/Wan2.2 · 28 أغسطس 2026

© 2026 wan2.video