Retour au Wiki Inférence

Quantification vidéo

Réduction de la quantification Wan les poids pour qu'ils s'adaptent à un plus petit GPU- Officiel. generate.py uniquement des types de lanceurs (--convert_model_dtypeC' est vrai. FP8, GGUF, la distillation et le caché vivent dans LightX2V, DiffSynth, FastVideo, Cache-dit, et ComfyUI GGUF les chargeurs.

FP8GGUFLightX2V
Sur cette page 5
Les traces de BF16, FP8, GGUF et des traces de NVFP4 distillées pour Wan DiT
Quatre graphiques différents. N'utilisez pas quantifié comme s'ils étaient un format.

Ce que fait le repo officiel

--convert_model_dtype convertit les paramètres en config.param_dtype (généralement bf16/fp16). Combiné avec --offload_model True et --t5_cpu, il s'agit du 80 GB → légèrement moins de chemin non de 4 bits pris en charge.

Compression communautaire

  • DiffSynth-Studio — FP8, couche de décharge, parallèle de séquence, LoRA.
  • LightX2V distillation à pas, emballages quantifiés, légers VAE- Je ne suis pas très attentive.
  • FastVideo distillés Wan avec une attention rare.
  • Cache-dit DBCache / TaylorSeer / Cache-CFG sur Wan2.2 MoE (saute le calcul, pas les bits).
  • ComfyUI-GGUF - Kijai WanVideoWrapper — GGUF et des trucs au niveau du noyau.

Comment choisir

Il faut une qualité d'échantillonnage officielle → bf16 + déchargement ou multi-GPU. Il faut une 4090 à une qualité presque complète → FP8 (voir FP8 vs GGUF). Il faut 1216 GB → GGUF ou un emballage distillé LightX2V, et on s'attend à une perte de texture.

Questions fréquentes

La quantification ajoute-t-elle de l'audio?
- Je ne peux pas.
C'est une quantification du cache?
- Je ne peux pas. Cache-dit Les poids restent parfaitement précis à moins que vous ne quantifiez.

Sources primaires

Vérifié avec le README Wan-Video/Wan2.2 · 28 août 2026

© 2026 wan2.video