FP8 と GGUF

FP8と GGUFは両方とも Wanを縮小するが,交換できない. FP8は密集したグラフ上の GPUテンソールコア要素タイプである. GGUFは,飛んでいるタイルをデクアンティスするロードヤー向けに設計されたブロック量化ファイル形式 (Q4Q8) である.

e4m3Q4_KComfyUI
このページの目次 4
FP8対 GGUF対 Wanの他の圧縮経路
FP8 は CUDA マムルパスに留まります. GGUF は llama.cppの世界からのストレージ/ランタイムフォーマットです.

FP8 (e4m3 / e5m2)

  • Ada/Hopper/Blackwellのテンザーコアに生まれました
  • 通常は1 FP8 DiTとFP32/BF16残留経路が加え, VAEはしばしばより高い精度を維持します.
  • ツール: DiffSynth-Studio, LightX2V, ComfyUI fp8_e4m3fnセーフェテンサー.
  • 品質: 校准が合理的である場合,通常は安価なオプションのうち bf16 に最も近い.

GGUF (Q8_0, Q5_K, Q4_K, …)

  • 選択的重要マトリックス (K量子) のブロック量子化
  • WAN/Flux/Qwen のために ComfyUI-GGUF で人気があり,16 GB カードで 27B-総 MoE をロードできます.
  • 速度はデクアンタカーネルに依存する.強い GPU で,Q4 はデクアンタ +テンソールコアの使用が少ないため FP8 より遅い可能性があります.
  • グラフの多くでは 2 つの GGUF ファイルが A14B であることを意味します
についてFP8GGUF Q4 / Q5
典型的な GPU4090 / 5090 / A100+1224 GB消費者
グラフ密度 FP8 GEMMデクラントタイル → GEMM
品質が bf16に近い通常は FP8Q8は閉じる; Q4は柔らかい
ローダリングダイフシンス,ネイティブ コンフィComfyUI-GGUFクラゲの風格
MoE専門家を2人で保持し,おそらく卸してファイルはしばしば分割され,連続的なオフロード

よくある質問

している GGUF 量子化された公式モデル
VAE と VAE は親 (A14B vs 5B vs I2V) に一致する必要があります.
NVFP4?
LightX2Vスタイルの新しい4ビット GPUフォーマット. FP8に精神的に GPU GEMM (GEMM) より近い GGUFファイル.

一次資料

Wan-Video/Wan2.2 README と照合済み · 2026年8月28日

© 2026 wan2.video