图生视频

图生视频在同一套 DiT 家族上再条件化起始帧。Wan2.2-I2V-A14B 是 80 GB 电影感路径;TI2V-5B --image 是 24 GB 的 720P 路径。size 是面积预算——画幅比例跟随照片。

i2v-A14BCLIPaspect
本页目录 5
图生视频:起始图、可选提示词、条件 DiT、VAE 解码
I2V 条件是 CLIP/VAE 图像 token 加文本。画幅来自静帧。

官方命令

I2V-A14B
python generate.py --task i2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-I2V-A14B --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard. …"
TI2V-5B 图像模式
python generate.py --task ti2v-5B --size 1280*704 --ckpt_dir ./Wan2.2-TI2V-5B --offload_model True --convert_model_dtype --t5_cpu --image examples/i2v_input.JPG --prompt "…"

ti2v-5B 一旦带 --image 就是图生视频,否则是文生视频。这就是 README 说的混合设计。

只上传图(空提示词)

I2V 可以 --prompt '' 并打开 --use_prompt_extend。DashScope 的 qwen-vl-max(或本地 Qwen2.5-VL)根据静帧写运动提示词。这是官方支持的「只上传照片」路径。

起始图实际锁什么

  • t = 0 的主体身份与服装。
  • 输出宽高比(强行错配 size 会得到letterbox)。
  • 光线与背景作为先验——不是锁定的底板。大运镜仍会漂。

常见问题

480P 还是 720P?
I2V-A14B 两者都支持。TI2V-5B 是消费级 720P@24 fps 混合模型。有 80 GB 级 GPU 时选 A14B 冲画质。
I2V 能把脸钉死吗?
会尽量保持。若要「角色图 + 另一段动作」,请用 Animate-14B 或 VACE 参考,而不是裸 I2V。

一手来源

对照 Wan-Video/Wan2.2 README 核对 · 2026-08-28

© 2026 wan2.video