官方 generate.py
圖 + wav
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wavCosyVoice TTS
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"官方單卡下限 80 GB。附加:--pose_video 做姿態驅動演唱/表演;--num_clip 短預覽。用 CosyVoice 需裝 requirements_s2v.txt。size 是面積預算,畫幅跟隨輸入圖。
專案頁公佈的對比
Wan-S2V 頁給出 FID 15.66、SSIM 0.734、PSNR 20.49、CSIM 0.677——在列出的說話人基線裡這些指標最好,Sync-C / EFID 也具競爭力。把這張表當作者實測,而不是全球榜。
常見問題
- S2V 算原生音影片嗎?
- 不算。你提供(或用 CosyVoice 合成)音訊,模型按這條軌動畫。原生音畫一體是 Wan 2.5+ API。
- 有 Diffusers 嗎?
- Wan2.2 todo 把 S2V 標成已接推理 / ComfyUI / Diffusers。封裝若落後,仍以官方 README 引數為準。
一手來源
已對照 Wan-Video/Wan2.2 README 核對 · 2026-08-28