SNR المفتاح، وليس جهاز توجيه رمزي
غالبا ما توجه مؤسسات الـ LLM MOE كل رمز إلى مجموعة فرعية من الخبراء. Wan2.2 تصميم المنشور أكثر حدة: تستخدم الخطوة الكاملة للتخفيض خبير واحد. SNR تسقط مع انخفاض t. في البداية ، t كبير ، الضجيج مرتفع ، SNR هو في SNR_min ، وخبير الضجيج العالي يمتلك الخطوة. يتم تعريف عتبة t_moe في نصف SNR_min ؛ عندما t < t_moe يتولى الخبير منخفض الضجيج.
لماذا خبيران
الخطوات الأولى تحدد التخطيط والحركة العالمية؛ الخطوات اللاحقة تحدد النسيج والوجوه. وتكبير القدرة على امتداد هذا المحور دون مضاعفة FLOPs في كل خطوة. README يُقارن خسارة التحقق: Wan2.1 كثيفة، مختلطة Wan2.1 + خبير جديد، و كامل Wan2.2 MoE يلتقي الزوج الكامل أدنى.
عواقب الإستثمار
- VRAM لا يزال يتتبع 14B DiT زائد ثقيلة الخبير الثاني إذا كان كلاهما يظل مقيما.
- LoRAs عادة ما تحتاج إلى ملف عالٍ من الضوضاء وملف منخفض الضوضاء.
- TI2V-5B ليست MoE انها 5B كثيفة مع ثقيلة VAE.
- يمكن أن يفرض الكاش المجتمعي (Cache-dit) العمل داخل كل خبير بشكل منفصل.
أسئلة شائعة
- هل يذهب كل الخبراء في واحد إلى الأمام؟
- ليس في الجدول الزمني المنشورة، خبير واحد لكل خطوة زمنية، يتحول مرة واحدة على طول منحنى SNR
- هل يمكنني تحسين فقط الخبير منخفض الضوضاء؟
- ممكن، و READMEs التجاوز حتى اختبار الخبراء المختلطة ولكن الجودة تنخفض مقابل تدريب الزوج.
المصادر الأولية
تمت المراجعة وفق README لمشروع Wan-Video/Wan2.2 · 28 أغسطس 2026