SNR स्विच, टोकन राउटर नहीं
LLM MOE अक्सर प्रत्येक टोकन को विशेषज्ञों के एक उपसमूह को रूट करते हैं। Wan2.2s प्रकाशित डिजाइन अधिक कठोर हैः पूरे निरूपण चरण में एक विशेषज्ञ का उपयोग किया जाता है। SNR घटता है क्योंकि t घटता है। शुरुआत में, t बड़ा है, शोर उच्च है, SNR SNR_min पर है, और उच्च शोर विशेषज्ञ चरण का मालिक है। एक सीमा t_moe को SNR_min के आधे पर परिभाषित किया जाता है; जब t < t_moe कम शोर विशेषज्ञ को संभालना पड़ता है।
दो विशेषज्ञ क्यों
प्रारंभिक चरण वैश्विक लेआउट और आंदोलन को निर्धारित करते हैं; बाद के चरण बनावट और चेहरे को निर्धारित करते हैं। उस अक्ष के साथ विभाजन क्षमता प्रति चरण FLOPs को दोगुना किए बिना मॉडल को बढ़ाती है। README सत्यापन हानि की तुलना करता हैः Wan2.1 घने, मिश्रित Wan2.1 + एक नया विशेषज्ञ, और पूर्ण Wan2.2 MoE पूर्ण जोड़ी सबसे कम अभिसरण करती है।
इन्फेरेंस परिणाम
- VRAM अभी भी 14B DiT प्लस दूसरे विशेषज्ञ के वजन को ट्रैक करता है यदि दोनों निवासी रहते हैं। अपलोड निष्क्रिय विशेषज्ञ को कॉल कर सकता है।
- LoRAs को आमतौर पर एक उच्च शोर फ़ाइल और एक कम शोर फ़ाइल की आवश्यकता होती है।
- TI2V-5B MoE नहीं है यह एक घने 5B है और एक भारी VAE है।
- सामुदायिक कैश (Cache-dit) प्रत्येक विशेषज्ञ के भीतर काम को अलग से छोड़ सकता है।
अक्सर पूछे जाने वाले प्रश्न
- क्या दोनों विशेषज्ञ एक ही आगे दौड़ते हैं?
- प्रकाशित कार्यक्रम में नहीं। समय चरण प्रति एक विशेषज्ञ, SNR वक्र के साथ एक बार स्विच।
- क्या मैं केवल कम शोर विशेषज्ञ को ठीक कर सकता हूँ?
- संभव है, और READMEs ablation भी मिश्रित विशेषज्ञों का परीक्षण करता है लेकिन गुणवत्ता जोड़ी के प्रशिक्षण के मुकाबले गिरती है।
प्राथमिक स्रोत
Wan-Video/Wan2.2 README से सत्यापित · 28 अगस्त 2026