FP8 (e4m3 / e5m2)
- Native sur les cœurs de tensor Ada/Hopper/Blackwell.
- Habituellement, une FP8 DiT plus un chemin résiduel FP32/BF16; VAE reste souvent plus précis.
- Les outils: DiffSynth-Studio, LightX2V, certains ComfyUI fp8_e4m3fn séfétensors.
- Qualité: généralement la plus proche de bf16 des options bon marché si l'étalonnage est raisonnable.
GGUF (Q8_0, Q5_K, Q4_K, …)
- Quantisation de bloc avec des matrices d'importance optionnelles (quants K).
- Populaire dans ComfyUI-GGUF pour WAN/Flux/Qwen afin qu'une carte 16 GB puisse charger un 27B-total MoE.
- La vitesse dépend du noyau dequant. Sur un GPU fort, Q4 peut être plus lent que FP8 en raison de l'utilisation de dequant + moins de noyau tensor.
- Deux experts signifient toujours deux fichiers GGUF pour A14B dans de nombreux graphiques.
| Le dépôt | FP8 | GGUF Q4 et Q5 |
|---|---|---|
| Typique GPU | 4090 / 5090 / A100+ | 12–24 GB consommateur |
| Graphique | Densité FP8 GEMM | Tire de déquant → GEMM |
| Qualité la plus proche de bf16 | Généralement FP8 | Q8 fermé; Q4 plus doux |
| Chargement | DiffSynth, originaire Comfy | ComfyUI-GGUF, à la forme de llama.cpp |
| MoE | Gardez les deux experts, peut-être décharger | Souvent, les fichiers sont divisés + déchargement séquentiel |
Questions fréquentes
- Le modèle officiel quantifié est-il GGUF?
- Il s'agit d'un re-pack communautaire. Hash et VAE doivent correspondre à la parenté (A14B vs 5B vs I2V).
- NVFP4?
- Les formats LightX2V de style 4 bits GPU plus récents. plus proches de FP8 en esprit (GPU GEMM) que des fichiers GGUF.
Sources primaires
Vérifié avec le README Wan-Video/Wan2.2 · 28 août 2026
