FP8 (e4m3 / e5m2)
- Ada/Hopper/Blackwellのテンザーコアに生まれました
- 通常は1 FP8 DiTとFP32/BF16残留経路が加え, VAEはしばしばより高い精度を維持します.
- ツール: DiffSynth-Studio, LightX2V, ComfyUI fp8_e4m3fnセーフェテンサー.
- 品質: 校准が合理的である場合,通常は安価なオプションのうち bf16 に最も近い.
GGUF (Q8_0, Q5_K, Q4_K, …)
- 選択的重要マトリックス (K量子) のブロック量子化
- WAN/Flux/Qwen のために ComfyUI-GGUF で人気があり,16 GB カードで 27B-総 MoE をロードできます.
- 速度はデクアンタカーネルに依存する.強い GPU で,Q4 はデクアンタ +テンソールコアの使用が少ないため FP8 より遅い可能性があります.
- グラフの多くでは 2 つの GGUF ファイルが A14B であることを意味します
| について | FP8 | GGUF Q4 / Q5 |
|---|---|---|
| 典型的な GPU | 4090 / 5090 / A100+ | 1224 GB消費者 |
| グラフ | 密度 FP8 GEMM | デクラントタイル → GEMM |
| 品質が bf16に近い | 通常は FP8 | Q8は閉じる; Q4は柔らかい |
| ローダリング | ダイフシンス,ネイティブ コンフィ | ComfyUI-GGUFクラゲの風格 |
| MoE | 専門家を2人で保持し,おそらく卸して | ファイルはしばしば分割され,連続的なオフロード |
よくある質問
- している GGUF 量子化された公式モデル
- VAE と VAE は親 (A14B vs 5B vs I2V) に一致する必要があります.
- NVFP4?
- LightX2Vスタイルの新しい4ビット GPUフォーマット. FP8に精神的に GPU GEMM (GEMM) より近い GGUFファイル.
一次資料
Wan-Video/Wan2.2 README と照合済み · 2026年8月28日
