Commutador SNR, não um roteador de tokens
As empresas de MoE LLM geralmente encaminham cada token para um subconjunto de especialistas. Wan2.2s design publicado é mais grosseiro: todo o passo denúncia usa um especialista. SNR cai à medida que t diminui. No início, t é grande, o ruído é alto, SNR está em SNR_min, e o especialista em alto ruído é o dono do passo. Um limiar t_moe é definido na metade de SNR_min; quando t < t_moe o especialista de baixo ruído assume.
Por que dois especialistas
Os primeiros passos decidem o layout e o movimento global; passos posteriores decidem as texturas e as faces. A capacidade de divisão ao longo desse eixo amplia o modelo sem duplicar os FLOPs por passo. O README compara a perda de validação: Wan2.1 densa, misturada Wan2.1 + um novo especialista, e completo Wan2.2 MoE o par completo converge mais baixo.
Consequências da inferência
- O VRAM ainda acompanha um 14B DiT mais os pesos do segundo especialista se ambos permanecerem residentes.
- LoRAs Normalmente, precisamos de um arquivo de alto ruído e um arquivo de baixo ruído.
- TI2V-5B não é MoE é um 5B denso com um VAE mais pesado.
- O caché comunitário (Cache-dit) pode ignorar o trabalho dentro de cada especialista separadamente.
Perguntas frequentes
- Os dois especialistas correm em uma só frente?
- Um especialista por passo, muda uma vez ao longo da curva SNR.
- Posso ajustar apenas o especialista em baixo ruído?
- Possivel, e a ablação READMEs até teste especialistas mistos mas a qualidade cai em comparação com o treinamento do par.
Fontes primárias
Verificado com o README do Wan-Video/Wan2.2 · 28 de agosto de 2026