FP8 (e4m3 / e5m2)
- 아다/호퍼/블랙웰 텐서 코어에서 본래
- 일반적으로 1 FP8 DiT + FP32/BF16 잔여 경로; VAE는 종종 더 높은 정확성을 유지합니다.
- 도구: DiffSynth-Studio, LightX2V, ComfyUI fp8_e4m3fn 안전 센서
- 품질: 일반적으로 기량 평가가 합성되면 저렴한 옵션 중 bf16에 가장 가깝습니다.
GGUF (Q8_0, Q5_K, Q4_K,...)
- 선택적 중요성 매트릭스 (K-쿼트) 를 가진 블록 양자화
- ComfyUI-GGUF에서 WAN/Flux/Qwen에 인기가 있으므로 16 GB 카드에서 27B-총 MoE를 로드 할 수 있습니다.
- 속도 는 덱ванта 커널 에 달려 있다. 강한 GPU 에서, Q4 는 덱ванта + 덜 텐서 코어 사용으로 인해 FP8 보다 느리게 될 수 있다.
- 두 전문가들은 여전히 GGUF 파일의 두 개의 A14B 파일을 많은 그래프에서 의미합니다.
| 이럴 때 | FP8 | GGUF Q4/Q5 |
|---|---|---|
| 전형적인 GPU | 4090 / 5090 / A100+ | 1224 GB 소비자 |
| 그래프 | 밀도가 FP8 GEMM | 덱ванта트 타일 → GEMM |
| bf16에 가장 가까운 품질 | 보통 FP8 | Q8 닫고, Q4 부드럽다 |
| 로더 | 디프스시스, 토착 코프리 | ComfyUI-GGUF, llama.cpp 스타일 |
| MoE | 두 전문가 모두 유지; 아마도 하하 | 종종 파일이 분할되어 + 순서적으로 풀 수 있습니다 |
자주 묻는 질문
- GGUF 는 양자화된 공식 모델이 있습니까?
- 이 Community Re-pack 입니다. 해시와 VAE는 부모 (A14B vs 5B vs I2V) 와 일치해야 합니다.
- NVFP4?
- LightX2V 스타일의 4비트 GPU 형식. FP8에 가까운 GPU GEMM (영어: GPU GEMM) 보다 GGUF 파일.
1차 출처
Wan-Video/Wan2.2 README 기준 확인 · 2026년 8월 28일
