Lo que hace el repo oficial
--convert_model_dtype convierte los parámetros en config.param_dtype (normalmente bf16/fp16). Combinado con --offload_model True y --t5_cpu es el 80 GB → un poco menos de camino no de 4 bits.
Compresión comunitaria
- DiffSynth-Studio FP8, descarga de capas, secuencia paralela, LoRA.
- LightX2V destilación a pasos, envases cuantificados, ligero VAE, poca atención.
- FastVideo destilado Wan con escasa atención.
- Cache-dit DBCache / TaylorSeer / Cache-CFG en Wan2.2 MoE (salta el cálculo, no los bits).
- ComfyUI-GGUF / Kijai WanVideoWrapper GGUF y trucos a nivel de núcleo.
Cómo elegir
Necesita una muestra oficial de calidad → bf16 + descarga o multi-GPU. Necesita un 4090 en calidad casi completa → FP8 (ver FP8 vs GGUF). Necesita un paquete de 1216 GB → GGUF o un paquete destilado LightX2V, y espera pérdida de textura.
Preguntas frecuentes
- ¿La cuantización añade audio?
- - No, no lo sé.
- ¿Es la cuantización de caché?
- No. Cache-dit reutiliza las activaciones a través de los pasos. Los pesos permanecen con total precisión a menos que también cuantice.
Fuentes primarias
Verificado con el README de Wan-Video/Wan2.2 · 28 de agosto de 2026
