Volver a la Wiki Arquitectura

Diffusion Transformer

El generador de Wans es un Transformador de Difusión sobre latencias de vídeo comprimidas, entrenado con flujo de coincidencia no una U-Net. Las fichas son parches de espaciotiempo; el texto llega a través de la atención cruzada UMT5; el paso de tiempo modula AdaLN.

DiTflow matchingUMT5
En esta página 5
DiT Video stack: latencia ruidosa, parcheado, bloques de transformador, desparcheado, velocidad
Wan2.2 DiT La longitud de la secuencia es los marcos × parches espaciales, por lo que VAE la compresión domina VRAM.

¿Por qué DiT en lugar de U-Net

La difusión de imágenes clásica utiliza U-Nets convolucionales. DiT (Peebles & Xie) reemplaza la columna vertebral con bloques transformadores en latentes parcheados. El video extiende la parche en el tiempo. Wan sigue esa línea (compartida con muchos modelos de video 20242025) para que la atención pueda modelar movimientos de cámara y movimientos de largo alcance.

Aparecimiento de flujo, no sólo predicción de epsilon

El código oficial utiliza soluciones de estilo de flujo de coincidencia / rectificado de flujo (UniPC, Flow DPM). README (y ComfyUI Las plantillas) asumen que la familia de programadores.

El acondicionamiento

  • Texto: UMT5-XXL incrustaciones, atención cruzada en cada bloque.
  • Imagen (I2V/FLF2V): CLIP-visión + VAE tokens, proyecto MLP adicional (FLF2V añade una primera / última incorporación posicional de 257×2 tokens en Wan2.1).
  • Audio (S2V): una vía de inyección específica (ver el formulario oficial S2V figura de audio).
  • Punto de tiempo / SNR: AdaLN; en A14B también se selecciona el experto en vivo.

Preguntas frecuentes

¿Es usted Wan ¿Un LLM de vídeo autoregresivista?
No, es un denoizador iterativo en una cuadrícula latente.
¿Dónde está la U-Net?
No hay uno en Wan2.2. Si un gráfico ComfyUI muestra un UNetLoader, es un nombre de cargador los pesos siguen siendo DiT bloques.

Fuentes primarias

Verificado con el README de Wan-Video/Wan2.2 · 28 de agosto de 2026

© 2026 wan2.video