Offiziell generate.py
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wavpython generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"Einfach GPU offizieller Boden ist 80 GB. Zusätzliche Extras: --pose_video für pose-getriebenes Singen/Acting; --num_clip für eine kurze Vorschau. Installieren Sie requirements_s2v.txt, wenn Sie CosyVoice verwenden. Größe ist ein Flächenbudget; Aspekt folgt dem Bild.
Veröffentlichte Vergleiche (Projektseite)
Die Seite Wan-S2V berichtet über FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 am besten unter den aufgeführten Sprachkopf-Baselinen auf diesen Metriken mit kompetitiver Sync-C / EFID.
Häufige Fragen
- Ist S2V ein natives Audio-Video?
- Nein. Sie liefern (oder CosyVoice-Synthesen) das Audio. Das Modell animiert Bild zu diesem Track. Native Joint AV ist Wan 2.5+ APIs.
- Diffusers?
- S2V ist als integriert in den Wan2.2 das ComfyUI, DiffusersDie Beamten bevorzugen README Flaggen, wenn ein Umschlag zurückbleibt.
Primärquellen
Mit dem Wan-Video/Wan2.2 README abgeglichen · 28. August 2026