Por que DiT em vez de U-Net
A difusão clássica de imagem usava U-Nets convolucionais. DiT (Peebles & Xie) substitui a espinha dorsal com blocos transformadores em latentes parcheados. O vídeo estende a grade de parche no tempo. Wan segue essa linha (compartilhada com muitos modelos de vídeo 20242025), para que a atenção possa modelar o movimento de longo alcance e os movimentos da câmera.
Combinação de fluxo, não apenas previsão de epsilon
O código oficial usa solventes de estilo de fluxo de correspondência / fluxo rectificado (UniPC, Flow DPM). README (e ComfyUI As informações sobre o programação são fornecidas por um grupo de empresas.
Condicionamento
- Texto: UMT5-XXL embutidos, atenção cruzada em cada bloco.
- Imagem (I2V/FLF2V): CLIP-visão + VAE tokens, projeto MLP extra (FLF2V adiciona uma primeira/última inserção posicional de tokens 257×2 em Wan2.1).
- Áudio (S2V): um caminho de injecção específico (ver S2V Figura de áudio).
- Tempo / SNR: AdaLN; em A14B, elege também qual especialista está em directo.
Perguntas frequentes
- O Mestrado em Direito em Vídeo autoregressivo é Wan?
- Não, é um denotador iterativo numa grade latente.
- Onde está a U-Net?
- Não há um em Wan2.2. Se um gráfico ComfyUI mostra um UNetLoader, que é um nome de carregador os pesos ainda são DiT blocos.
Fontes primárias
Verificado com o README do Wan-Video/Wan2.2 · 28 de agosto de 2026

