Le gouvernement generate.py
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wavpython generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"Je suis célibataire.GPU le plan officiel est 80 GB- Des extras supplémentaires: --pose_video pour le chant/acte en pose; --num_clip Pour une brève aperçu. requirements_s2v.txt si vous utilisez CosyVoice. La taille est un budget de superficie; l'aspect suit l'image.
Comparaisons publiées (page de projet)
La page Wan-S2V rapporte FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 le meilleur parmi les lignes de base de tête de discussion énumérées sur ces mesures avec synchronisation compétitive C / EFID. Traitez le tableau comme la mesure des auteurs, pas un classement universel.
Questions fréquentes
- Est-ce que S2V est une vidéo audio native?
- Non. Vous fournissez (ou CosyVoice-synthétisez) l'audio. Le modèle anime l'image à cette piste. AV commun natif est Wan 2.5+ APIs.
- Diffusers?
- S2V est inscrit comme intégré dans le Wan2.2 tout (inférence, ComfyUI, DiffusersJe préfère le fonctionnaire. README les drapeaux si un emballage est en retard.
Sources primaires
Vérifié avec le README Wan-Video/Wan2.2 · 28 août 2026