圖生影片

圖生影片在同一套 DiT 家族上再條件化起始幀。Wan2.2-I2V-A14B 是 80 GB 電影感路徑;TI2V-5B --image 是 24 GB 的 720P 路徑。size 是面積預算——畫幅比例跟隨照片。

i2v-A14BCLIPaspect
本頁目錄 5
圖生影片:起始圖、可選提示詞、條件 DiT、VAE 解碼
I2V 條件是 CLIP/VAE 影象 token 加文字。畫幅來自靜幀。

官方命令

I2V-A14B
python generate.py --task i2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-I2V-A14B --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard. …"
TI2V-5B 影象模式
python generate.py --task ti2v-5B --size 1280*704 --ckpt_dir ./Wan2.2-TI2V-5B --offload_model True --convert_model_dtype --t5_cpu --image examples/i2v_input.JPG --prompt "…"

ti2v-5B 一旦帶 --image 就是圖生影片,否則是文生影片。這就是 README 說的混合設計。

只上傳圖(空提示詞)

I2V 可以 --prompt '' 並開啟 --use_prompt_extend。DashScope 的 qwen-vl-max(或本地 Qwen2.5-VL)根據靜幀寫運動提示詞。這是官方支援的「只上傳照片」路徑。

起始圖實際鎖什麼

  • t = 0 的主體身份與服裝。
  • 輸出寬高比(強行錯配 size 會得到letterbox)。
  • 光線與背景作為先驗——不是鎖定的底板。大運鏡仍會漂。

常見問題

480P 還是 720P?
I2V-A14B 兩者都支援。TI2V-5B 是消費級 720P@24 fps 混合模型。有 80 GB 級 GPU 時選 A14B 衝畫質。
I2V 能把臉釘死嗎?
會盡量保持。若要「角色圖 + 另一段動作」,請用 Animate-14B 或 VACE 參考,而不是裸 I2V。

一手來源

已對照 Wan-Video/Wan2.2 README 核對 · 2026-08-28

© 2026 wan2.video