Volver a la Wiki Inferencia

Cuantización de vídeo

La cuantificación se reduce Wan pesas para que se ajusten a un más pequeño GPU- Oficial. generate.py sólo los tipos de fundición (--convert_model_dtype¿Qué es eso? FP8, GGUF, destilación y caché viven en LightX2V, DiffSynth, FastVideo, Cache-dit, y ComfyUI GGUF cargadores.

FP8GGUFLightX2V
En esta página 5
Las rutas BF16, FP8, GGUF y NVFP4 destiladas para Wan DiT
Cuatro gráficos diferentes. No utilice quantizado como si fueran un formato.

Lo que hace el repo oficial

--convert_model_dtype convierte los parámetros en config.param_dtype (normalmente bf16/fp16). Combinado con --offload_model True y --t5_cpu es el 80 GB → un poco menos de camino no de 4 bits.

Compresión comunitaria

  • DiffSynth-Studio FP8, descarga de capas, secuencia paralela, LoRA.
  • LightX2V destilación a pasos, envases cuantificados, ligero VAE, poca atención.
  • FastVideo destilado Wan con escasa atención.
  • Cache-dit DBCache / TaylorSeer / Cache-CFG en Wan2.2 MoE (salta el cálculo, no los bits).
  • ComfyUI-GGUF / Kijai WanVideoWrapper GGUF y trucos a nivel de núcleo.

Cómo elegir

Necesita una muestra oficial de calidad → bf16 + descarga o multi-GPU. Necesita un 4090 en calidad casi completa → FP8 (ver FP8 vs GGUF). Necesita un paquete de 1216 GB → GGUF o un paquete destilado LightX2V, y espera pérdida de textura.

Preguntas frecuentes

¿La cuantización añade audio?
- No, no lo sé.
¿Es la cuantización de caché?
No. Cache-dit reutiliza las activaciones a través de los pasos. Los pesos permanecen con total precisión a menos que también cuantice.

Fuentes primarias

Verificado con el README de Wan-Video/Wan2.2 · 28 de agosto de 2026

© 2026 wan2.video