FP8 vs GGUF

FP8 und GGUF schrumpfen beide Wan, sind aber nicht austauschbar. FP8 ist ein GPU Tensor-Kern-Elementtyp auf einem dichten Graph. GGUF ist ein Block-Quantifiziertes Dateifat (Q4Q8) für Ladegeräte, die Fliesen auf der Fliege dequantifizieren.

e4m3Q4_KComfyUI
Auf dieser Seite 4
FP8 gegen GGUF Gegenüber anderen Wan Kompressionswege
FP8 bleibt im CUDA matmul-Pfad. GGUF ist ein Speicher-/Laufzeitformat aus der llama.cpp-Welt.

FP8 (e4m3 / e5m2)

  • Native auf Ada/Hopper/Blackwell Tensorkerne.
  • Normalerweise eine FP8 DiT plus ein FP32/BF16 Restweg; VAE bleibt oft höhere Präzision.
  • Werkzeuge: DiffSynth-Studio, LightX2V, einige ComfyUI fp8_e4m3fn Sicherheitssensoren.
  • Qualität: in der Regel die am nächsten bf16 der günstigen Optionen, wenn die Kalibrierung vernünftig ist.

GGUF (Q8_0, Q5_K, Q4_K, …)

  • Blockquantifizierung mit optional wichtigen Matrizen (K-Quanten).
  • Populär in ComfyUI-GGUF für WAN/Flux/Qwen, so dass eine 16 GB Karte eine 27B-Gesamt MoE laden kann.
  • Die Geschwindigkeit hängt vom Dequant-Kernel ab. Bei einem starken GPU kann Q4 aufgrund des Dequant + weniger Tensor-Kerns langsamer als FP8 sein.
  • Zwei Experten bedeuten immer noch zwei GGUF Dateien für A14B in vielen Grafiken.
DieFP8GGUF Q4 / Q5
Typische GPU4090 / 5090 / A100+12–24 GB Verbraucher
GrafikDichte FP8 GEMMDequant-Fliesen → GEMM
Qualität, die der bf16 nahe liegtNormalerweise FP8Q8 schließen; Q4 weicher
LadegerätDiffSynth, einheimisch ComfyComfyUI-GGUF, Llama.cpp-Stil
MoEBehalten Sie beide Experten; vielleicht entladenHäufig aufgeteilte Dateien + aufeinanderfolgende Ablastung

Häufige Fragen

Ist GGUF das quantifizierte offizielle Modell?
Das ist ein Community-Re-Pack. Hash und VAE müssen mit dem Elternteil übereinstimmen (A14B vs 5B vs I2V).
NVFP4?
Neue LightX2V-Stil 4-Bit GPU-Formate. Näher an FP8 im Geist (GPU GEMM) als an GGUF-Dateien.

Primärquellen

Mit dem Wan-Video/Wan2.2 README abgeglichen · 28. August 2026

© 2026 wan2.video