Wiki पर वापस जाएँ इन्फ़रेंस

FP8 बनाम GGUF

FP8 और GGUF दोनों Wan को छोटा करते हैं, लेकिन वे परस्पर नहीं बदलते हैं। FP8 घने ग्राफ पर GPU टेन्सर-कोर तत्व प्रकार है। GGUF एक ब्लॉक-क्वांटीज़ेड फ़ाइल प्रारूप (Q4Q8) है जो लोडरों के लिए डिज़ाइन किया गया है जो उड़ते समय टाइलों को डिक्वांटीज करते हैं।

e4m3Q4_KComfyUI
इस पृष्ठ पर 4
FP8 बनाम GGUF बनाम अन्य Wan संपीड़न पथ
FP8 CUDA matmul पथ में रहता है. GGUF llama.cpp दुनिया से एक भंडारण/रनटाइम प्रारूप है.

FP8 (e4m3 / e5m2)

  • एडा / हॉपर / ब्लैकवेल टेन्सर कोर पर मूल।
  • आमतौर पर एक FP8 DiT प्लस एक FP32/BF16 अवशिष्ट पथ; VAE अक्सर अधिक सटीकता रहता है।
  • उपकरणः DiffSynth-Studio, LightX2V, कुछ ComfyUI fp8_e4m3fn सेफेटेंसर।
  • गुणवत्ताः यदि माप उचित है तो आमतौर पर सस्ते विकल्पों में bf16 के निकटतम है।

GGUF (Q8_0, Q5_K, Q4_K,...)

  • वैकल्पिक महत्व मैट्रिक्स (के-क्वैंट) के साथ ब्लॉक क्वांटिज़ेशन।
  • ComfyUI-GGUF में WAN/Flux/Qwen के लिए लोकप्रिय है ताकि 16 GB कार्ड 27B-कुल MoE लोड कर सके।
  • गति डीक्वांट कर्नल पर निर्भर करती है। एक मजबूत GPU पर, Q4 डीक्वांट + कम टेन्सर कोर के उपयोग के कारण FP8 से धीमा हो सकता है।
  • दो विशेषज्ञ अभी भी कई ग्राफ में A14B के लिए दो GGUF फ़ाइलों का मतलब है।
कच्चेFP8GGUF Q4 Q5
विशिष्ट GPU4090 / 5090 / A100+12–24 GB उपभोक्ता
ग्राफघने FP8 जीएमएमडीक्वांटेड टाइल → जीएमएम
bf16 के निकटतम गुणवत्तासामान्यतः FP8Q8 बंद; Q4 नरम
लोडरDiffSynth, मूल ComfyComfyUI-GGUF, llama.cpp शैली
MoEदोनों विशेषज्ञों को रखें; शायद लोड से बाहरअक्सर विभाजित फ़ाइलें + अनुक्रमिक अपलोड

अक्सर पूछे जाने वाले प्रश्न

क्या GGUF क्वांटिज़ेड आधिकारिक मॉडल है?
यह एक सामुदायिक री-पैक है। हैश और VAE को माता-पिता के साथ मेल खाना चाहिए (A14B बनाम 5B बनाम I2V) ।
NVFP4?
LightX2V शैली के नए 4-बिट GPU प्रारूप। FP8 के साथ GPU GEMM (आत्मा में FP8) के करीब GGUF फ़ाइलों की तुलना में।

प्राथमिक स्रोत

Wan-Video/Wan2.2 README से सत्यापित · 28 अगस्त 2026

© 2026 wan2.video