Sprache zu Video

Wan2.2-S2V-14B (6. August 2025) ist das offene kinematographische Sprach-zu-Video-Modell: ein Identitätsbild + Audio (+ optionales Prompt und Pose) → Lippe, Gesicht, Körper und Kamera. Es verbraucht Audio; es erfindet keinen Soundtrack aus Text.

S2V-14BCosyVoicelip-sync
Auf dieser Seite 4
Sprach-zu-Video-Eingaben: Bild, Audio, optionaler Anruf und Posen
S2V-14B Eingabe. Die Dauer folgt dem Audio, es sei denn, --num_clip sieht einen kürzeren Schnitt vor.
Offiziell Wan-S2V Überblick über die Pipeline
Offiziell Wan-S2V Überblick über die Methode: Bild, Audio und Text in den Filmengenerator.
Offiziell Wan-S2V Audiospritztrohr
Offizielle Audiospritze für Wan-S2V.

Offiziell generate.py

Bild + WAV
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wav
CosyVoice TTS
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"

Einfach GPU offizieller Boden ist 80 GB. Zusätzliche Extras: --pose_video für pose-getriebenes Singen/Acting; --num_clip für eine kurze Vorschau. Installieren Sie requirements_s2v.txt, wenn Sie CosyVoice verwenden. Größe ist ein Flächenbudget; Aspekt folgt dem Bild.

Veröffentlichte Vergleiche (Projektseite)

Die Seite Wan-S2V berichtet über FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 am besten unter den aufgeführten Sprachkopf-Baselinen auf diesen Metriken mit kompetitiver Sync-C / EFID.

Offiziell Wan-S2V Datenverarbeitung
Offizielle Datenerhebungsdiagramme (OpenHumanVid, Koala36M sowie manuelle Filmeklips).

Häufige Fragen

Ist S2V ein natives Audio-Video?
Nein. Sie liefern (oder CosyVoice-Synthesen) das Audio. Das Modell animiert Bild zu diesem Track. Native Joint AV ist Wan 2.5+ APIs.
Diffusers?
S2V ist als integriert in den Wan2.2 das ComfyUI, DiffusersDie Beamten bevorzugen README Flaggen, wenn ein Umschlag zurückbleibt.

Primärquellen

Mit dem Wan-Video/Wan2.2 README abgeglichen · 28. August 2026

© 2026 wan2.video