SNR Schalter, kein Token-Router
LLM-MMO-Unternehmen verweisen häufig jedes Token an einen Teil von Experten. Wan2.2die veröffentlichte Konzeption ist groben: Der gesamte Verklagungsschritt setzt einen Experten ein. SNR Wenn die Zahl der T-Klasse abnimmt, ist die Zahl der T-Klasse hoch. SNR Die Schrittgröße ist bei der Hälfte der SNR_min definiert, wenn t < t_moe der Schallschwachstexperte übernimmt.
Warum zwei Experten
Die ersten Schritte entscheiden über das globale Layout und die Bewegung; die späteren Schritte entscheiden über Texturen und Gesichter. Die Spaltungskapazität entlang dieser Achse vergrößert das Modell, ohne die FLOPs pro Schritt zu verdoppeln. Das README vergleicht den Validierungsverlust: Wan2.1 dicht, gemischt Wan2.1 + ein neuer Experte, und voll Wan2.2 MoE das vollständige Paar konvergiert am niedrigsten.
Folgen von Verurteilung
- VRAM - Sie ist noch nicht 14B DiT Die zweite Expertin wird mit dem Gewicht der beiden Experten belegt, wenn beide in der Wohnung bleiben.
- LoRAs Normalerweise brauchen wir eine Lärmdatei und eine Lärmdatei.
- TI2V-5B ist nicht MoE es ist ein dickes 5B mit einem schwereren VAE.
- Die Community-Cache (Cache-dit) kann die Arbeit innerhalb eines jeden Experten separat überspringen.
Häufige Fragen
- Laufen beide Experten in einer Richtung vorne?
- Ein Experte pro Zeitschritt wechselt einmal entlang der SNR Kurve.
- Kann ich nur den Geräusch-Experten feinen Ton geben?
- Es ist möglich, und die Ablation von READMEs testet sogar gemischte Experten aber die Qualität sinkt im Vergleich zum Training des Paares.
Primärquellen
Mit dem Wan-Video/Wan2.2 README abgeglichen · 28. August 2026