FP8과 GGUF

FP8와 GGUF은 모두 Wan를 축소하지만 교환이 불가능합니다. FP8는 밀집 그래프에서 GPU 텐서 코어 요소 유형입니다. GGUF는 비행 중에 타일을 분량화하는 로더를 위해 설계된 블록 양분화 파일 형식 (Q4Q8) 이다.

e4m3Q4_KComfyUI
이 페이지의 목차 4
FP8와 GGUF와 Wan의 다른 압축 경로
FP8는 CUDA 매트무얼 경로에 머무르며 GGUF는 llama.cpp 세계로부터 저장/경영 시간 형식입니다.

FP8 (e4m3 / e5m2)

  • 아다/호퍼/블랙웰 텐서 코어에서 본래
  • 일반적으로 1 FP8 DiT + FP32/BF16 잔여 경로; VAE는 종종 더 높은 정확성을 유지합니다.
  • 도구: DiffSynth-Studio, LightX2V, ComfyUI fp8_e4m3fn 안전 센서
  • 품질: 일반적으로 기량 평가가 합성되면 저렴한 옵션 중 bf16에 가장 가깝습니다.

GGUF (Q8_0, Q5_K, Q4_K,...)

  • 선택적 중요성 매트릭스 (K-쿼트) 를 가진 블록 양자화
  • ComfyUI-GGUF에서 WAN/Flux/Qwen에 인기가 있으므로 16 GB 카드에서 27B-총 MoE를 로드 할 수 있습니다.
  • 속도 는 덱ванта 커널 에 달려 있다. 강한 GPU 에서, Q4 는 덱ванта + 덜 텐서 코어 사용으로 인해 FP8 보다 느리게 될 수 있다.
  • 두 전문가들은 여전히 GGUF 파일의 두 개의 A14B 파일을 많은 그래프에서 의미합니다.
이럴 때FP8GGUF Q4/Q5
전형적인 GPU4090 / 5090 / A100+1224 GB 소비자
그래프밀도가 FP8 GEMM덱ванта트 타일 → GEMM
bf16에 가장 가까운 품질보통 FP8Q8 닫고, Q4 부드럽다
로더디프스시스, 토착 코프리ComfyUI-GGUF, llama.cpp 스타일
MoE두 전문가 모두 유지; 아마도 하하종종 파일이 분할되어 + 순서적으로 풀 수 있습니다

자주 묻는 질문

GGUF 는 양자화된 공식 모델이 있습니까?
이 Community Re-pack 입니다. 해시와 VAE는 부모 (A14B vs 5B vs I2V) 와 일치해야 합니다.
NVFP4?
LightX2V 스타일의 4비트 GPU 형식. FP8에 가까운 GPU GEMM (영어: GPU GEMM) 보다 GGUF 파일.

1차 출처

Wan-Video/Wan2.2 README 기준 확인 · 2026년 8월 28일

© 2026 wan2.video