O que o repo oficial faz
--convert_model_dtype converte parâmetros em config.param_dtype (normalmente bf16/fp16). Combinado com --offload_model True e --t5_cpu é o 80 GB → caminho ligeiramente menor não 4-bit suportado.
Compressão comunitária
- DiffSynth-Studio FP8, descarga de camadas, sequência paralela, LoRA.
- LightX2V destilação a passo, embalagens quantificadas, leve VAE, pouca atenção.
- FastVideo destilado Wan com pouca atenção.
- Cache-dit DBCache / TaylorSeer / Cache-CFG em Wan2.2 MoE (salta computação, não bits).
- ComfyUI-GGUF / Kijai WanVideoWrapper GGUF e truques de nível do kernel.
Como escolher
Precisa de qualidade oficial de amostragem → bf16 + descarga ou multi-GPU. Precisa de um 4090 com qualidade quase completa → FP8 (ver FP8 vs GGUF). Precisa de 1216 GB → GGUF ou um pacote destilado LightX2V, e espere perda de textura.
Perguntas frequentes
- A quantização adiciona áudio?
- - Não, não.
- É quantização do cache?
- Não. Cache-dit reutiliza a ativação através de passos. Pesos permanecem com total precisão a menos que você também quantize.
Fontes primárias
Verificado com o README do Wan-Video/Wan2.2 · 28 de agosto de 2026
