FP8 (e4m3 / e5m2)
- أصلي على نواة الانسدادات (أدا) / (هوبر) / (بلاكويل)
- عادة ما يكون واحد FP8 DiT زائد مسار بقايا FP32/BF16؛ VAE غالبا ما يبقى دقة أعلى.
- الأدوات: DiffSynth-Studio، LightX2V، بعض ComfyUI fp8_e4m3fn مضخات الأمان.
- الجودة: عادة أقرب إلى bf16 من الخيارات الرخيصة إذا كانت التصفية منطقية.
GGUF (Q8_0، Q5_K، Q4_K،...)
- الكمية الحجم مع المصفوفات ذات الأهمية الاختيارية (K-quant).
- شعبية في ComfyUI-GGUF ل WAN/Flux/Qwen بحيث يمكن للكارطة 16 GB تحميل 27B- إجمالي MoE.
- السرعة تعتمد على جوهر الديكانت. في GPU قوية، يمكن أن يكون Q4 أبطأ من FP8 بسبب استخدام الديكانت + أقل من نواة التنسور.
- لا يزال الخبراء يعنيان ملفين GGUF ل A14B في العديد من الرسوم البيانية.
| (مصدر) | FP8 | GGUF Q4/Q5 |
|---|---|---|
| النموذجية GPU | 4090 / 5090 / A100+ | 1224 GB المستهلك |
| الرسم البياني | الكثافة FP8 GEMM | البلاط المعدني → GEMM |
| أقرب نوعية إلى bf16 | عادة FP8 | ق8 مغلق، ق4 أكثر لينة |
| الحمولة | (ديفسينث) ، (أصله (كوفي) | ComfyUI-GGUF، طراز llama.cpp |
| MoE | إبقوا خبراً، ربما لا تتركوا | غالباً ما يتم تقسيم الملفات + التفريغ المتسلسل |
أسئلة شائعة
- هل GGUF النموذج الرسمي المعدل؟
- إنها إعادة حزمة مجتمع. يجب أن تتطابق الهاش و VAE مع الوالد (A14B مقابل 5B مقابل I2V).
- NVFP4?
- أحدث أشكال LightX2V ذات أسلوب 4 بتات GPU. أقرب إلى FP8 في الروح (GPU GEMM) من ملفات GGUF.
المصادر الأولية
تمت المراجعة وفق README لمشروع Wan-Video/Wan2.2 · 28 أغسطس 2026
