Voltar à Wiki Inferência

Quantização de vídeo

Quantização diminui Wan pesos para que se encaixem em um menor GPU- Oficial. generate.py Apenas tipos de lançamento (--convert_model_dtypeÉ verdade. FP8, GGUF, destilação e cache viver em LightX2V, DiffSynth, FastVideo, Cache-dit, e ComfyUI GGUF Carregadores.

FP8GGUFLightX2V
Nesta página 5
BF16, FP8, GGUF e destilado NVFP4 rotas para Wan DiT
Quatro gráficos diferentes. Não use quantizado como se fossem um formato.

O que o repo oficial faz

--convert_model_dtype converte parâmetros em config.param_dtype (normalmente bf16/fp16). Combinado com --offload_model True e --t5_cpu é o 80 GB → caminho ligeiramente menor não 4-bit suportado.

Compressão comunitária

  • DiffSynth-Studio FP8, descarga de camadas, sequência paralela, LoRA.
  • LightX2V destilação a passo, embalagens quantificadas, leve VAE, pouca atenção.
  • FastVideo destilado Wan com pouca atenção.
  • Cache-dit DBCache / TaylorSeer / Cache-CFG em Wan2.2 MoE (salta computação, não bits).
  • ComfyUI-GGUF / Kijai WanVideoWrapper GGUF e truques de nível do kernel.

Como escolher

Precisa de qualidade oficial de amostragem → bf16 + descarga ou multi-GPU. Precisa de um 4090 com qualidade quase completa → FP8 (ver FP8 vs GGUF). Precisa de 1216 GB → GGUF ou um pacote destilado LightX2V, e espere perda de textura.

Perguntas frequentes

A quantização adiciona áudio?
- Não, não.
É quantização do cache?
Não. Cache-dit reutiliza a ativação através de passos. Pesos permanecem com total precisão a menos que você também quantize.

Fontes primárias

Verificado com o README do Wan-Video/Wan2.2 · 28 de agosto de 2026

© 2026 wan2.video