FP8 (e4m3 / e5m2)
- एडा / हॉपर / ब्लैकवेल टेन्सर कोर पर मूल।
- आमतौर पर एक FP8 DiT प्लस एक FP32/BF16 अवशिष्ट पथ; VAE अक्सर अधिक सटीकता रहता है।
- उपकरणः DiffSynth-Studio, LightX2V, कुछ ComfyUI fp8_e4m3fn सेफेटेंसर।
- गुणवत्ताः यदि माप उचित है तो आमतौर पर सस्ते विकल्पों में bf16 के निकटतम है।
GGUF (Q8_0, Q5_K, Q4_K,...)
- वैकल्पिक महत्व मैट्रिक्स (के-क्वैंट) के साथ ब्लॉक क्वांटिज़ेशन।
- ComfyUI-GGUF में WAN/Flux/Qwen के लिए लोकप्रिय है ताकि 16 GB कार्ड 27B-कुल MoE लोड कर सके।
- गति डीक्वांट कर्नल पर निर्भर करती है। एक मजबूत GPU पर, Q4 डीक्वांट + कम टेन्सर कोर के उपयोग के कारण FP8 से धीमा हो सकता है।
- दो विशेषज्ञ अभी भी कई ग्राफ में A14B के लिए दो GGUF फ़ाइलों का मतलब है।
| कच्चे | FP8 | GGUF Q4 Q5 |
|---|---|---|
| विशिष्ट GPU | 4090 / 5090 / A100+ | 12–24 GB उपभोक्ता |
| ग्राफ | घने FP8 जीएमएम | डीक्वांटेड टाइल → जीएमएम |
| bf16 के निकटतम गुणवत्ता | सामान्यतः FP8 | Q8 बंद; Q4 नरम |
| लोडर | DiffSynth, मूल Comfy | ComfyUI-GGUF, llama.cpp शैली |
| MoE | दोनों विशेषज्ञों को रखें; शायद लोड से बाहर | अक्सर विभाजित फ़ाइलें + अनुक्रमिक अपलोड |
अक्सर पूछे जाने वाले प्रश्न
- क्या GGUF क्वांटिज़ेड आधिकारिक मॉडल है?
- यह एक सामुदायिक री-पैक है। हैश और VAE को माता-पिता के साथ मेल खाना चाहिए (A14B बनाम 5B बनाम I2V) ।
- NVFP4?
- LightX2V शैली के नए 4-बिट GPU प्रारूप। FP8 के साथ GPU GEMM (आत्मा में FP8) के करीब GGUF फ़ाइलों की तुलना में।
प्राथमिक स्रोत
Wan-Video/Wan2.2 README से सत्यापित · 28 अगस्त 2026
