Wiki に戻る タスク

テキストから動画

公開 2.2 ラインのテキスト・トゥ・ビデオには,2 つのレシピがあります.映画 MoE T2V-A14B (480P/720P, ~80 GB) とハイブリッド TI2V-5B (720P@24 fps) は,オフロード付きの 24 GB カードで. 両方とも静音フレームを解読します.

t2v-A14Bti2v-5B720P
このページの目次 6
UMT5と DiT MoEから VAEまでのプロンプトからビデオへのパイプライン
T2V パス: prompt → UMT5-XXL → Wan2.2 DiT → VAE 解読.

2つの公式の T2Vエントリー

任務旗モデル典型的なサイズVRAM (公式)記号
t2v-A14BWan2.2-T2V-A14B1280×720 及び 480P≥ 80 GB 単身 GPUMoE 低音/高音の専門家
ti2v-5BWan2.2-TI2V-5B1280×704 及び 704×1280負荷が解けたとき ≥ 24 GB720P @ 24 fps混合物 T2V+I2V

公式の単行GPUコマンド

T2V-A14B (80 GB クラス)
python generate.py --task t2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-T2V-A14B --offload_model True --convert_model_dtype --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."
TI2V-5B (24 GB /4090クラス)
python generate.py --task ti2v-5B --size 1280*704 --ckpt_dir ./Wan2.2-TI2V-5B --offload_model True --convert_model_dtype --t5_cpu --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage"

Multi-GPU は --dit_fsdp --t5_fsdp --ulysses_size の torchrun を使っています.単一の 80 GB カードが利用できない場合,8 つの GPU の README 例はサポートされたパスです.

積み木が何をしているのか

  • テキストエンコード: UMT5-XXL. --t5_cpu でダウンロードする. VRAM が密集している場合.
  • 脊椎: 流れの対応 DiT. A14B は専門家を SNR に切り替える. TI2V-5B は密集している.
  • 遅刻: Wan-VAE (2.1スタイル 4×8×8 A14B; 2.2 4×16×16 TI2V-5B).
  • 速延長は推奨される. 速延のウィキを参照してください.

品質主張は源から取れる

READMEは Wan2.2 を Wan-Bench 2.0 と複数の閉ざされたモデルに比べて, Wan2.1 より多くの動き/意味力/美学データを持つ位置に置いています.同じベンチと同じ2.2チェックポイントを引用しない限り,第三者の SOTA表をマーケティングとみなします (A14B vs 5B vs 量化コミュニティパック).

よくある質問

どのサイズで合格する?
A14B 使用 1280*720 (またはa 480P 配列) TI2V-5B 720P している 1280*704 及び 704*1280 ありません 1280*720違いは公式の README.
clip はどのくらいの長さですか?
公的なレシピは短縮映画撮影 (5秒の順序) です. S2V 時間は代わりにオーディオトラックに従います.
Diffusers?
わかった Wan-AI/Wan2.2-T2V-A14B-Diffusers 及び Wan2.2-TI2V-5B-Diffusers ニュースブロックは2025年7月28日

一次資料

Wan-Video/Wan2.2 README と照合済み · 2026年8月28日

© 2026 wan2.video