텍스트 투 비디오

공개 2.2 라인에서 텍스트-비디오는 두 가지 요리법입니다. 영화 MoE T2V-A14B (480P/720P, ~80 GB) 및 하이브리드 TI2V-5B (720P@24 fps) 는 오프로드 24 GB 카드에 있습니다. 두 가지 모두 침묵 프레임을 해독합니다.

t2v-A14Bti2v-5B720P
이 페이지의 목차 6
UMT5 및 DiT MoE에서 VAE까지의 디코드를 통해 프롬프트에서 텍스트에서 비디오 파이프라인
T2V 경로: prompt → UMT5-XXL → Wan2.2 DiT → VAE 디코드

2개의 공식 T2V 항목

임무 깃발모델전형적인 크기는VRAM (공식)참고
t2v-A14BWan2.2-T2V-A14B1280×720 또는 480P≥ 80 GB 단일 GPUMoE 고/저음 전문가
ti2v-5BWan2.2-TI2V-5B1280×704 또는 704×1280≥ 24 GB 부하720P @ 24 fps; 하이브리드 T2V+I2V

공식 single-GPU 명령

T2V-A14B (80 GB 클래스)
python generate.py --task t2v-A14B --size 1280*720 --ckpt_dir ./Wan2.2-T2V-A14B --offload_model True --convert_model_dtype --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage."
TI2V-5B (24 GB / 4090급)
python generate.py --task ti2v-5B --size 1280*704 --ckpt_dir ./Wan2.2-TI2V-5B --offload_model True --convert_model_dtype --t5_cpu --prompt "Two anthropomorphic cats in comfy boxing gear and bright gloves fight intensely on a spotlighted stage"

멀티-GPU는 --dit_fsdp --t5_fsdp --ulysses_size와 함께 토치런을 사용합니다. 8개의 GPU에 대한 README 예는 단일 80 GB 카드가 사용할 수 없을 때 지원되는 경로입니다.

이 무엇을 하는지

  • 텍스트 코더: UMT5-XXL. --t5_cpu로 다운로드 하 고 VRAM가 밀려 있다면.
  • 척추: 흐름에 맞추어 DiT. A14B는 전문가들을 SNR로 전환합니다. TI2V-5B는 밀도가 높습니다.
  • 미적: Wan-VAE (2.1 스타일 4×8×8 A14B; 2.2 4×16×16 TI2V-5B).
  • 신속한 확장 프로그램은 권장됩니다.

출처에서 가져야 할 품질 주장

README는 Wan2.2를 Wan- 벤치 2.0에 비해 여러 폐쇄형 모델에 비해 Wan2.1보다 더 많은 운동/유화/아 эстетика 데이터를 가지고 있다. 같은 벤치와 같은 2.2 체크포인트 (A14B vs 5B vs 양자화된 커뮤니티 팩) 를 인용하지 않는 한 타사 SOTA 테이블을 마케팅으로 간주한다.

자주 묻는 질문

어느 크기를 통과해야 할까요?
A14B는 1280*720 (또는 480P 쌍을 사용합니다). TI2V-5B 720P는 1280*704 또는 704*1280 입니다. 1280*720이 아닙니다. 그 차이가 공식 README입니다.
clip는 얼마나 길까요?
공개 레시피는 짧은 영화 촬영 ( 5 초 정도) 이다. S2V 기간은 오디오 트랙을 따라가게 된다.
Diffusers?
예. Wan-AI/Wan2.2-T2V-A14B-Diffusers와 Wan2.2-TI2V-5B-Diffusers는 2025년 7월 28일 뉴스 블록에 나열되어 있습니다.

1차 출처

Wan-Video/Wan2.2 README 기준 확인 · 2026년 8월 28일

© 2026 wan2.video