FP8(e4m3 / e5m2)
- Ada / Hopper / Blackwell tensor core 原生支援。
- 通常是 FP8 DiT 加一條 FP32/BF16 殘差;VAE 往往保持更高精度。
- 工具:DiffSynth-Studio、LightX2V、部分 ComfyUI 的 fp8_e4m3fn safetensors。
- 畫質:校準正常時,通常是便宜方案裡最接近 bf16 的。
GGUF(Q8_0、Q5_K、Q4_K …)
- 分塊量化,可選重要性矩陣(K-quant)。
- 在 ComfyUI-GGUF 裡流行,讓 16 GB 卡也能載入總參 27B 的 MoE。
- 速度取決於反量化核心。在強 GPU 上 Q4 可能比 FP8 更慢,因為要反量化、tensor core 利用率更低。
- 很多圖裡 A14B 仍是兩個專家對應兩個 GGUF 檔案。
| FP8 | GGUF Q4/Q5 | |
|---|---|---|
| 典型 GPU | 4090 / 5090 / A100+ | 12–24 GB 消費卡 |
| 計算圖 | 稠密 FP8 GEMM | 反量化 tile → GEMM |
| 相對 bf16 畫質 | 通常 FP8 更近 | Q8 接近;Q4 更軟 |
| 載入器 | DiffSynth、原生 Comfy | ComfyUI-GGUF、llama.cpp 風格 |
| MoE | 兩個專家都留著,或 offload | 常拆檔案 + 順序換入 |
常見問題
- GGUF 是「官方量化模型」嗎?
- 是社群重打包。雜湊和 VAE 必須對上父模型(A14B vs 5B vs I2V)。
- NVFP4?
- 更新的 LightX2V 風格 4-bit GPU 格式。精神上更接近 FP8(GPU GEMM),而不是 GGUF 檔案。
一手來源
已對照 Wan-Video/Wan2.2 README 核對 · 2026-08-28
