公式 generate.py
画像 + wav
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wavCosyVoice TTS
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"独身GPU 公式のフロアは 80 GB追加: --pose_video ポーズで歌う/演じる --num_clip 短暫のプレビューのために requirements_s2v.txt 服用している場合 CosyVoice面積は面積予算で,側面は画像に続く.
公開された比較 (プロジェクトページ)
Wan-S2Vページでは,FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 がこれらのメトリックの表記されたトークヘッドベースラインの中で最も良い. 競争力のあるSync-C / EFID.表は,普遍的なランキングボードではなく,著者の測定値として扱います.
よくある質問
- S2Vはネイティブオーディオビデオですか?
- 音声を供給 (または CosyVoice合成) する.モデルはそのトラックに画像をアニメ化します.ネイティブコイント AVは Wan 2.5+ APIsです.
- Diffusers?
- S2Vは, Wan2.2 todo (インフェレンスの, ComfyUI, Diffusers) に統合されているようにリストされている.包装が遅れている場合,公式 README 旗を好む.
一次資料
Wan-Video/Wan2.2 README と照合済み · 2026年8月28日