FP8 مقابل GGUF

FP8 و GGUF كل منهما يقلص Wan ، ولكنهما لا يمكن تبادلها. FP8 هو نوع عنصر GPU من عناصر النواة على الرسم البياني الكثيف. GGUF هو شكل ملف مقعد كتلة (Q4Q8) مصمم للحمليات التي تُقعد البلاطات على متن الطائرة.

e4m3Q4_KComfyUI
محتويات الصفحة 4
FP8 مقابل GGUF مقابل مسارات الضغط الأخرى Wan
FP8 يبقى في مسار CUDA matmul. GGUF هو التخزين / تشغيل وقت من عالم llama.cpp.

FP8 (e4m3 / e5m2)

  • أصلي على نواة الانسدادات (أدا) / (هوبر) / (بلاكويل)
  • عادة ما يكون واحد FP8 DiT زائد مسار بقايا FP32/BF16؛ VAE غالبا ما يبقى دقة أعلى.
  • الأدوات: DiffSynth-Studio، LightX2V، بعض ComfyUI fp8_e4m3fn مضخات الأمان.
  • الجودة: عادة أقرب إلى bf16 من الخيارات الرخيصة إذا كانت التصفية منطقية.

GGUF (Q8_0، Q5_K، Q4_K،...)

  • الكمية الحجم مع المصفوفات ذات الأهمية الاختيارية (K-quant).
  • شعبية في ComfyUI-GGUF ل WAN/Flux/Qwen بحيث يمكن للكارطة 16 GB تحميل 27B- إجمالي MoE.
  • السرعة تعتمد على جوهر الديكانت. في GPU قوية، يمكن أن يكون Q4 أبطأ من FP8 بسبب استخدام الديكانت + أقل من نواة التنسور.
  • لا يزال الخبراء يعنيان ملفين GGUF ل A14B في العديد من الرسوم البيانية.
(مصدر)FP8GGUF Q4/Q5
النموذجية GPU4090 / 5090 / A100+1224 GB المستهلك
الرسم البيانيالكثافة FP8 GEMMالبلاط المعدني → GEMM
أقرب نوعية إلى bf16عادة FP8ق8 مغلق، ق4 أكثر لينة
الحمولة(ديفسينث) ، (أصله (كوفي)ComfyUI-GGUF، طراز llama.cpp
MoEإبقوا خبراً، ربما لا تتركواغالباً ما يتم تقسيم الملفات + التفريغ المتسلسل

أسئلة شائعة

هل GGUF النموذج الرسمي المعدل؟
إنها إعادة حزمة مجتمع. يجب أن تتطابق الهاش و VAE مع الوالد (A14B مقابل 5B مقابل I2V).
NVFP4?
أحدث أشكال LightX2V ذات أسلوب 4 بتات GPU. أقرب إلى FP8 في الروح (GPU GEMM) من ملفات GGUF.

المصادر الأولية

تمت المراجعة وفق README لمشروع Wan-Video/Wan2.2 · 28 أغسطس 2026

© 2026 wan2.video