공식적인 generate.py
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wavpython generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"단편 GPU 공식 바닥은 80 GB입니다. 추가 부가: --pose_video 포즈 중심의 노래 / 연기를 위해; --num_clip 짧은 미리보기 위해. requirements_s2v.txt를 설치하면 CosyVoice를 사용합니다. 크기는 면적 예산입니다. 측면은 이미지에 따라합니다.
출판된 비교 (프로젝트 페이지)
Wan-S2V 페이지에서는 FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 이 경쟁력 있는 Sync-C/EFID의 해당 메트릭스 에 대한 나열된 대화 헤드 기본 라인 중 가장 좋은 것으로 보고됩니다. 테이블은 범용 랭킹 표가 아닌 저자의 측정으로 간주하십시오.
자주 묻는 질문
- S2V는 원산지 오디오 비디오인가요?
- 음원을 공급하거나 CosyVoice 합성합니다. 모델은 그 트랙에 그림을 애니메이션화합니다. 네이티브 합동 AV는 Wan 2.5+ APIs입니다.
- Diffusers?
- S2V는 Wan2.2 todo (이명, ComfyUI, Diffusers) 에 통합된 것으로 나열된다. 포장지가 뒤떨어진 경우 공식 README 깃발을 선호한다.
1차 출처
Wan-Video/Wan2.2 README 기준 확인 · 2026년 8월 28일