이미지 투 비디오

영상에서 비디오 조건은 시작 프레임에서 동일한 DiT 가족입니다. Wan2.2-I2V-A14B는 80 GB 영화 경로입니다. TI2V-5B --image는 24 GB 720P 경로입니다. 크기의 깃발은 면적 예산 측면 비율이 사진에 따라 있습니다.

i2v-A14BCLIPaspect
이 페이지의 목차 5
시작 이미지와 선택적 인 프롬프트, 조건화된 DiT 및 VAE 디코딩이 있는 이미지에서 비디오 파이프라인
I2V 조건은 CLIP/VAE 이미지 토큰과 텍스트에 있습니다.

공식 명령

I2V-A14B
python generate.py --task i2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-I2V-A14B --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard. …"
TI2V-5B 이미지 모드
python generate.py --task ti2v-5B --size 1280*704 --ckpt_dir ./Wan2.2-TI2V-5B --offload_model True --convert_model_dtype --t5_cpu --image examples/i2v_input.JPG --prompt "…"

--image가 ti2v-5B에 설정되면, 실행은 이미지-비디오; 그렇지 않으면 텍스트-비디오입니다. README가 광고하는 하이브리드 디자인입니다.

이미지만 (공허 prompt)

I2V는 --prompt ''로 실행될 수 있습니다. --use_prompt_extend가 작동할 때 DashScope qwen-vl-max (또는 로컬 Qwen2.5-VL) 는 고정된 상태에서 동작 명령어를 작성합니다. 이것이 그냥 사진을 업로드하는 지원하는 방법입니다.

시작 이미지가 실제로 제어하는

  • 피험자 신분 및 옷장 t = 0
  • 출력 측면 비율 (불합리한 크기를 강요하면 편지 박스)
  • 전면으로 조명 및 배경 잠금된 판이 아닙니다. 큰 카메라 움직임은 파동 할 수 있습니다.

자주 묻는 질문

480P 또는 720P?
I2V-A14B는 둘 다 지원합니다. TI2V-5B는 720P@24 fps 소비자 하이브리드입니다. 80 GB 클래스 GPU를 가지고 있다면 품질을 위해 A14B를 선택하십시오.
I2V가 얼굴을 가만히 유지합니까?
잠금된 캐릭터 + 다른 캐릭터의 움직임에 대해 clip, 사용 Animate-14B 또는 VACE 참고 바닐라가 아닌 I2V.

1차 출처

Wan-Video/Wan2.2 README 기준 확인 · 2026년 8월 28일

© 2026 wan2.video