Voix vers vidéo

Wan2.2-S2V-14B (26 août 2025) est le modèle cinématographique ouvert de la parole à la vidéo: une image d'identité + audio (+ prompt et pose optionnels) → lèvre, visage, corps et caméra. Il consomme de l'audio; il n'invente pas de bande sonore à partir de texte.

S2V-14BCosyVoicelip-sync
Sur cette page 4
Entrées de discours à vidéo: image, audio, prompt et pose facultatives
S2V-14B La durée suit l'audio à moins que --num_clip prévoit une coupe plus courte.
Le gouvernement Wan-S2V vue d'ensemble des pipelines
Avis officiel de la méthode Wan-S2V: image, audio et texte dans le générateur cinématographique.
Le gouvernement Wan-S2V tuyau d'injection audio
L'équipement de production de l'eau Wan-S2V.

Le gouvernement generate.py

Image + wav
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wav
CosyVoice TTS
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"

Je suis célibataire.GPU le plan officiel est 80 GB- Des extras supplémentaires: --pose_video pour le chant/acte en pose; --num_clip Pour une brève aperçu. requirements_s2v.txt si vous utilisez CosyVoice. La taille est un budget de superficie; l'aspect suit l'image.

Comparaisons publiées (page de projet)

La page Wan-S2V rapporte FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 le meilleur parmi les lignes de base de tête de discussion énumérées sur ces mesures avec synchronisation compétitive C / EFID. Traitez le tableau comme la mesure des auteurs, pas un classement universel.

Le gouvernement Wan-S2V clé de collecte de données
Le diagramme officiel de collecte de données (OpenHumanVid, Koala36M, plus des clips cinématographiques manuels).

Questions fréquentes

Est-ce que S2V est une vidéo audio native?
Non. Vous fournissez (ou CosyVoice-synthétisez) l'audio. Le modèle anime l'image à cette piste. AV commun natif est Wan 2.5+ APIs.
Diffusers?
S2V est inscrit comme intégré dans le Wan2.2 tout (inférence, ComfyUI, DiffusersJe préfère le fonctionnaire. README les drapeaux si un emballage est en retard.

Sources primaires

Vérifié avec le README Wan-Video/Wan2.2 · 28 août 2026

© 2026 wan2.video