음성 투 비디오

Wan2.2-S2V-14B (2025년 8월 26일) 는 공개 영화적 음성-비디오 모델입니다. 하나의 정체성 이미지 + 오디오 (+ 선택적 인 프롬프트 및 포즈) → 입술, 얼굴, 몸, 카메라. 오디오를 소비합니다. 텍스트에서 사운드 트랙을 발명하지 않습니다.

S2V-14BCosyVoicelip-sync
이 페이지의 목차 4
음성-비디오 입력: 이미지, 오디오, 선택적 인 프롬프트 및 포즈
S2V-14B 입력 시간 --num_clip가 더 짧은 절도를 미리 보지 않는 한 음향을 따라가야 합니다.
공식 Wan-S2V 파이프라인 개요
공식 Wan-S2V 방법 개요: 영화 생성기에 이미지와 오디오 및 텍스트.
공식적인 오디오 주입 파이프라인 Wan-S2V
공식적인 오디오 주입 파이프라인은 Wan-S2V.

공식적인 generate.py

이미지 + 파동
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wav
CosyVoice TTS
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"

단편 GPU 공식 바닥은 80 GB입니다. 추가 부가: --pose_video 포즈 중심의 노래 / 연기를 위해; --num_clip 짧은 미리보기 위해. requirements_s2v.txt를 설치하면 CosyVoice를 사용합니다. 크기는 면적 예산입니다. 측면은 이미지에 따라합니다.

출판된 비교 (프로젝트 페이지)

Wan-S2V 페이지에서는 FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 이 경쟁력 있는 Sync-C/EFID의 해당 메트릭스 에 대한 나열된 대화 헤드 기본 라인 중 가장 좋은 것으로 보고됩니다. 테이블은 범용 랭킹 표가 아닌 저자의 측정으로 간주하십시오.

공식 Wan-S2V 데이터 수집 키
공식 데이터 수집 다이어그램 (OpenHumanVid, Koala36M, 그리고 수동 영화 클립)

자주 묻는 질문

S2V는 원산지 오디오 비디오인가요?
음원을 공급하거나 CosyVoice 합성합니다. 모델은 그 트랙에 그림을 애니메이션화합니다. 네이티브 합동 AV는 Wan 2.5+ APIs입니다.
Diffusers?
S2V는 Wan2.2 todo (이명, ComfyUI, Diffusers) 에 통합된 것으로 나열된다. 포장지가 뒤떨어진 경우 공식 README 깃발을 선호한다.

1차 출처

Wan-Video/Wan2.2 README 기준 확인 · 2026년 8월 28일

© 2026 wan2.video