¿Por qué DiT en lugar de U-Net
La difusión de imágenes clásica utiliza U-Nets convolucionales. DiT (Peebles & Xie) reemplaza la columna vertebral con bloques transformadores en latentes parcheados. El video extiende la parche en el tiempo. Wan sigue esa línea (compartida con muchos modelos de video 20242025) para que la atención pueda modelar movimientos de cámara y movimientos de largo alcance.
Aparecimiento de flujo, no sólo predicción de epsilon
El código oficial utiliza soluciones de estilo de flujo de coincidencia / rectificado de flujo (UniPC, Flow DPM). README (y ComfyUI Las plantillas) asumen que la familia de programadores.
El acondicionamiento
- Texto: UMT5-XXL incrustaciones, atención cruzada en cada bloque.
- Imagen (I2V/FLF2V): CLIP-visión + VAE tokens, proyecto MLP adicional (FLF2V añade una primera / última incorporación posicional de 257×2 tokens en Wan2.1).
- Audio (S2V): una vía de inyección específica (ver el formulario oficial S2V figura de audio).
- Punto de tiempo / SNR: AdaLN; en A14B también se selecciona el experto en vivo.
Preguntas frecuentes
- ¿Es usted Wan ¿Un LLM de vídeo autoregresivista?
- No, es un denoizador iterativo en una cuadrícula latente.
- ¿Dónde está la U-Net?
- No hay uno en Wan2.2. Si un gráfico ComfyUI muestra un UNetLoader, es un nombre de cargador los pesos siguen siendo DiT bloques.
Fuentes primarias
Verificado con el README de Wan-Video/Wan2.2 · 28 de agosto de 2026

