语音生视频

Wan2.2-S2V-14B(2025-08-26)是开源电影感语音生视频:一张身份图 + 音频(可选提示词与姿态)→ 口型、表情、身体与镜头。它消费音频,不会从文本凭空合成声带。

S2V-14BCosyVoicelip-sync
本页目录 4
语音生视频输入:图、音频、可选提示词与姿态
S2V-14B 输入。时长跟音频走,除非 --num_clip 只预览短片段。
官方 Wan-S2V 流水线总览
官方 Wan-S2V 方法总览:图像、音频、文本进入电影感生成器。
官方 Wan-S2V 音频注入流水线
官方音频注入流水线。

官方 generate.py

图 + wav
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wav
CosyVoice TTS
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"

官方单卡下限 80 GB。附加:--pose_video 做姿态驱动演唱/表演;--num_clip 短预览。用 CosyVoice 需装 requirements_s2v.txt。size 是面积预算,画幅跟随输入图。

项目页公布的对比

Wan-S2V 页给出 FID 15.66、SSIM 0.734、PSNR 20.49、CSIM 0.677——在列出的说话人基线里这些指标最好,Sync-C / EFID 也具竞争力。把这张表当作者实测,而不是全球榜。

官方 Wan-S2V 数据收集桑基图
官方数据收集图(OpenHumanVid、Koala36M,外加人工电影感片段)。

常见问题

S2V 算原生音视频吗?
不算。你提供(或用 CosyVoice 合成)音频,模型按这条轨动画。原生音画一体是 Wan 2.5+ API。
有 Diffusers 吗?
Wan2.2 todo 把 S2V 标成已接推理 / ComfyUI / Diffusers。封装若落后,仍以官方 README 参数为准。

一手来源

对照 Wan-Video/Wan2.2 README 核对 · 2026-08-28

© 2026 wan2.video