語音生影片

Wan2.2-S2V-14B(2025-08-26)是開源電影感語音生影片:一張身份圖 + 音訊(可選提示詞與姿態)→ 口型、表情、身體與鏡頭。它消費音訊,不會從文字憑空合成聲帶。

S2V-14BCosyVoicelip-sync
本頁目錄 4
語音生影片輸入:圖、音訊、可選提示詞與姿態
S2V-14B 輸入。時長跟音訊走,除非 --num_clip 只預覽短片段。
官方 Wan-S2V 流水線總覽
官方 Wan-S2V 方法總覽:影象、音訊、文字進入電影感生成器。
官方 Wan-S2V 音訊注入流水線
官方音訊注入流水線。

官方 generate.py

圖 + wav
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wav
CosyVoice TTS
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"

官方單卡下限 80 GB。附加:--pose_video 做姿態驅動演唱/表演;--num_clip 短預覽。用 CosyVoice 需裝 requirements_s2v.txt。size 是面積預算,畫幅跟隨輸入圖。

專案頁公佈的對比

Wan-S2V 頁給出 FID 15.66、SSIM 0.734、PSNR 20.49、CSIM 0.677——在列出的說話人基線裡這些指標最好,Sync-C / EFID 也具競爭力。把這張表當作者實測,而不是全球榜。

官方 Wan-S2V 資料收集桑基圖
官方資料收集圖(OpenHumanVid、Koala36M,外加人工電影感片段)。

常見問題

S2V 算原生音影片嗎?
不算。你提供(或用 CosyVoice 合成)音訊,模型按這條軌動畫。原生音畫一體是 Wan 2.5+ API。
有 Diffusers 嗎?
Wan2.2 todo 把 S2V 標成已接推理 / ComfyUI / Diffusers。封裝若落後,仍以官方 README 引數為準。

一手來源

已對照 Wan-Video/Wan2.2 README 核對 · 2026-08-28

© 2026 wan2.video