FP8 (e4m3 / e5m2)
- Native auf Ada/Hopper/Blackwell Tensorkerne.
- Normalerweise eine FP8 DiT plus ein FP32/BF16 Restweg; VAE bleibt oft höhere Präzision.
- Werkzeuge: DiffSynth-Studio, LightX2V, einige ComfyUI fp8_e4m3fn Sicherheitssensoren.
- Qualität: in der Regel die am nächsten bf16 der günstigen Optionen, wenn die Kalibrierung vernünftig ist.
GGUF (Q8_0, Q5_K, Q4_K, …)
- Blockquantifizierung mit optional wichtigen Matrizen (K-Quanten).
- Populär in ComfyUI-GGUF für WAN/Flux/Qwen, so dass eine 16 GB Karte eine 27B-Gesamt MoE laden kann.
- Die Geschwindigkeit hängt vom Dequant-Kernel ab. Bei einem starken GPU kann Q4 aufgrund des Dequant + weniger Tensor-Kerns langsamer als FP8 sein.
- Zwei Experten bedeuten immer noch zwei GGUF Dateien für A14B in vielen Grafiken.
| Die | FP8 | GGUF Q4 / Q5 |
|---|---|---|
| Typische GPU | 4090 / 5090 / A100+ | 12–24 GB Verbraucher |
| Grafik | Dichte FP8 GEMM | Dequant-Fliesen → GEMM |
| Qualität, die der bf16 nahe liegt | Normalerweise FP8 | Q8 schließen; Q4 weicher |
| Ladegerät | DiffSynth, einheimisch Comfy | ComfyUI-GGUF, Llama.cpp-Stil |
| MoE | Behalten Sie beide Experten; vielleicht entladen | Häufig aufgeteilte Dateien + aufeinanderfolgende Ablastung |
Häufige Fragen
- Ist GGUF das quantifizierte offizielle Modell?
- Das ist ein Community-Re-Pack. Hash und VAE müssen mit dem Elternteil übereinstimmen (A14B vs 5B vs I2V).
- NVFP4?
- Neue LightX2V-Stil 4-Bit GPU-Formate. Näher an FP8 im Geist (GPU GEMM) als an GGUF-Dateien.
Primärquellen
Mit dem Wan-Video/Wan2.2 README abgeglichen · 28. August 2026
