Un interruptor SNR, no un router de token
Los MoE de LLM a menudo dirigen cada token a un subconjunto de expertos. Wan2.2s diseño publicado es más grueso: todo el paso denociante utiliza un experto. SNR cae a medida que t disminuye. Al principio, t es grande, el ruido es alto, SNR está en SNR_min, y el experto en alto ruido es dueño del paso. Un umbral t_moe se define en la mitad de SNR_min; cuando t < t_moe el experto de bajo ruido se hace cargo.
¿Por qué dos expertos
Los primeros pasos deciden el diseño global y el movimiento; los pasos posteriores deciden las texturas y caras. La capacidad de división a lo largo de ese eje amplia el modelo sin duplicar los FLOP por paso. El README compara la pérdida de validación: Wan2.1 denso, mixto Wan2.1 + un nuevo experto, y completo Wan2.2 MoE el par completo converge más bajo.
Consecuencias de la inferencia
- VRAM sigue siguiendo un 14B DiT más los pesos del segundo experto si ambos permanecen residentes.
- LoRAs generalmente necesita un archivo de alto ruido y un archivo de bajo ruido.
- TI2V-5B no es MoE es un 5B denso con un VAE más pesado.
- El caché comunitario (Cache-dit) puede omitir el trabajo dentro de cada experto por separado.
Preguntas frecuentes
- ¿Los dos expertos corren en un solo avance?
- Un experto por paso de tiempo, cambia una vez a lo largo de la curva SNR.
- ¿Puedo ajustar sólo el experto en bajo ruido?
- Es posible, y la ablación de READMEs incluso prueba expertos mixtos pero la calidad cae en comparación con el entrenamiento del par.
Fuentes primarias
Verificado con el README de Wan-Video/Wan2.2 · 28 de agosto de 2026