FP8 (e4m3 / e5m2)
- Nativo en núcleos de tensor Ada/Hopper/Blackwell.
- Por lo general, un FP8 DiT más un camino residual FP32/BF16; VAE a menudo se mantiene con mayor precisión.
- Herramientas: DiffSynth-Studio, LightX2V, algunos ComfyUI fp8_e4m3fn safetensores.
- Calidad: generalmente la más cercana a bf16 de las opciones baratas si la calibración es sensata.
GGUF (Q8_0, Q5_K, Q4_K, …)
- Cuantización de bloques con matrices de importancia opcionales (quantios K).
- Popular en ComfyUI-GGUF para WAN/Flux/Qwen para que una tarjeta 16 GB pueda cargar un 27B-total MoE.
- La velocidad depende del núcleo de cuantificación. En un GPU fuerte, Q4 puede ser más lento que FP8 debido al uso de cuantificación + menos núcleo tensor.
- Dos expertos todavía significan dos archivos GGUF para A14B en muchos gráficos.
| ¿Qué es esto? | FP8 | GGUF P/P5 |
|---|---|---|
| Tipico GPU | 4090 / 5090 / A100+ | 1224 GB consumidor |
| Grafico | Densa FP8 GEMM | Tela decantada → GEMM |
| Calidad más cercana a bf16 | Por lo general FP8 | Q8 cerrado; Q4 más suave |
| Cargador | DiffSynth, nativo Comfy | ComfyUI-GGUF, llama.cpp estilo |
| MoE | Mantenga a ambos expertos; tal vez descarga | A menudo archivos divididos + descarga secuencial |
Preguntas frecuentes
- ¿Es usted GGUF ¿El modelo oficial cuantizado?
- Es un re-paque de la comunidad. Hash y VAE deben coincidir con el padre (A14B vs 5B vs I2V).
- NVFP4?
- Formato de 4 bits GPU de estilo LightX2V más nuevo. Más cerca de FP8 en espíritu (GPU GEMM) que de archivos GGUF.
Fuentes primarias
Verificado con el README de Wan-Video/Wan2.2 · 28 de agosto de 2026
