FP8 (e4m3 / e5m2)
- Nativo de núcleos de tensor Ada/Hopper/Blackwell.
- Normalmente, uma FP8 DiT mais um caminho residual FP32/BF16; VAE muitas vezes permanece com maior precisão.
- Ferramentas: DiffSynth-Studio, LightX2V, alguns ComfyUI fp8_e4m3fn safetensores.
- Qualidade: normalmente a mais próxima de bf16 das opções baratas se a calibração for sensata.
GGUF (Q8_0, Q5_K, Q4_K,...)
- Quantização de blocos com matrizes de importância opcionais (quantos K).
- Popular em ComfyUI-GGUF para WAN/Flux/Qwen para que uma carta 16 GB possa carregar um 27B-total MoE.
- A velocidade depende do núcleo dequant. Em um forte GPU, o Q4 pode ser mais lento que FP8 devido ao uso de dequant + menos núcleo tensor.
- Dois especialistas ainda significam dois arquivos GGUF para A14B em muitos gráficos.
| O que é? | FP8 | GGUF Q4 / Q5 |
|---|---|---|
| Tipo GPU | 4090 / 5090 / A100+ | 1224 GB consumidor |
| Grafico | Densa FP8 GEMM | Tela de decânteis → GEMM |
| Qualidade mais próxima de bf16 | Normalmente FP8 | Q8 fechado; Q4 mais suave |
| Carregador | DiffSynth, nativo Comfy | ComfyUI-GGUF, estilo llama.cpp |
| MoE | Mantém os dois especialistas; talvez descarregem | Frequentemente arquivos divididos + descarga sequencial |
Perguntas frequentes
- O modelo oficial quantizado é o GGUF?
- É um re-pacote da comunidade. Hash e VAE devem corresponder ao pai (A14B vs 5B vs I2V).
- NVFP4?
- Mais recente LightX2V- estilo de 4 bits GPU - Os formatos mais próximos FP8 em espírito (GPU GEMM) do que a GGUF Arquivos.
Fontes primárias
Verificado com o README do Wan-Video/Wan2.2 · 28 de agosto de 2026
