官方 generate.py
图 + wav
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wavCosyVoice TTS
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"官方单卡下限 80 GB。附加:--pose_video 做姿态驱动演唱/表演;--num_clip 短预览。用 CosyVoice 需装 requirements_s2v.txt。size 是面积预算,画幅跟随输入图。
项目页公布的对比
Wan-S2V 页给出 FID 15.66、SSIM 0.734、PSNR 20.49、CSIM 0.677——在列出的说话人基线里这些指标最好,Sync-C / EFID 也具竞争力。把这张表当作者实测,而不是全球榜。
常见问题
- S2V 算原生音视频吗?
- 不算。你提供(或用 CosyVoice 合成)音频,模型按这条轨动画。原生音画一体是 Wan 2.5+ API。
- 有 Diffusers 吗?
- Wan2.2 todo 把 S2V 标成已接推理 / ComfyUI / Diffusers。封装若落后,仍以官方 README 参数为准。
一手来源
对照 Wan-Video/Wan2.2 README 核对 · 2026-08-28