Voltar à Wiki Arquitetura

Diffusion Transformer

O gerador Wans é um Transformador de Difusão sobre latentes de vídeo comprimidos, treinado com fluxo de correspondência não uma U-Net. Tokens são patches de espaçotempo; texto chega através da atenção cruzada UMT5; o passo-tempo modula AdaLN.

DiTflow matchingUMT5
Nesta página 5
DiT Estaca de vídeo: latentes ruidosos, parcheamento, blocos de transformador, desparcheamento, velocidade
Loop Wan2.2 DiT. O comprimento da sequência é quadros × parches espaciais, por isso a compressão VAE domina VRAM.

Por que DiT em vez de U-Net

A difusão clássica de imagem usava U-Nets convolucionais. DiT (Peebles & Xie) substitui a espinha dorsal com blocos transformadores em latentes parcheados. O vídeo estende a grade de parche no tempo. Wan segue essa linha (compartilhada com muitos modelos de vídeo 20242025), para que a atenção possa modelar o movimento de longo alcance e os movimentos da câmera.

Combinação de fluxo, não apenas previsão de epsilon

O código oficial usa solventes de estilo de fluxo de correspondência / fluxo rectificado (UniPC, Flow DPM). README (e ComfyUI As informações sobre o programação são fornecidas por um grupo de empresas.

Condicionamento

  • Texto: UMT5-XXL embutidos, atenção cruzada em cada bloco.
  • Imagem (I2V/FLF2V): CLIP-visão + VAE tokens, projeto MLP extra (FLF2V adiciona uma primeira/última inserção posicional de tokens 257×2 em Wan2.1).
  • Áudio (S2V): um caminho de injecção específico (ver S2V Figura de áudio).
  • Tempo / SNR: AdaLN; em A14B, elege também qual especialista está em directo.

Perguntas frequentes

O Mestrado em Direito em Vídeo autoregressivo é Wan?
Não, é um denotador iterativo numa grade latente.
Onde está a U-Net?
Não há um em Wan2.2. Se um gráfico ComfyUI mostra um UNetLoader, que é um nome de carregador os pesos ainda são DiT blocos.

Fontes primárias

Verificado com o README do Wan-Video/Wan2.2 · 28 de agosto de 2026

© 2026 wan2.video