動画モデルの量子化

定量化によって,小型の Wan 重量が縮小され,小型の GPU に収まる.公式 generate.py は,dtypes (--convert_model_dtype) をのみ投げます. True FP8, GGUF,蒸留とキャッシュは LightX2V, DiffSynth, FastVideo, Cache-dit, ComfyUI GGUF ローダーで生息します.

FP8GGUFLightX2V
このページの目次 5
BF16, FP8, GGUF, NVFP4の蒸留された Wan DiTの経路
グラフは4つです. 量化を単体として使用しないでください.

公式レポが何をしているか

--convert_model_dtypeはパラメータを config.param_dtype (通常 bf16/fp16) に変換します. --offload_model Trueと --t5_cpu を組み合わせると,サポートされている 80 GB → 略微の Path ではなく 4-bitです.

共同体圧縮

  • DiffSynth-Studio — FP8層の放出,シーケンス並行 LoRA.
  • LightX2V ステップ蒸留,量化パッケージ,軽量 VAE注目が少ない
  • FastVideo 蒸留された Wan 注目が少ない
  • Cache-dit DBCache / TaylorSeer / Cache-CFG に Wan2.2 MoE (ビットではなく計算をスキップします).
  • ComfyUI-GGUF / キジャイ WanVideoWrapper — GGUF カーネルレベルでのトリックも

選択する方法

公式サンプル品質 → bf16 + 卸載または多重GPU 必要な4090はほぼ完全な品質 → FP8 (FP8 vs GGUF を参照). 1216 GB → GGUF または蒸留された LightX2V 包装が必要であり,質感の損失を期待します.

よくある質問

量子化によって音が追加されるのか?
違うわ
キャッシュは量子化ですか?
違うわ Cache-dit 量度化も行わない限り 重さは完全な精度で保持されます

一次資料

Wan-Video/Wan2.2 README と照合済み · 2026年8月28日

© 2026 wan2.video