01
准备一张静帧
脸或角色清晰最好。照片、插画、动漫和宠物都可以当起始画面。
在线工具
图片 + 音频进去,MP4 出来。工作室直接调用 Wan-AI 官方 Hugging Face Space,不用你自己的 DashScope Key。
正在加载官方 Space。休眠中的 Demo 可能需要一分钟才能唤醒。
是什么
Wan 2.2 Speech to Video 接收一张静帧和一段音频,生成人物说话、唱歌或表演的视频。它是 Wan 2.2 家族里的 S2V 变体,面向说话照片、唱歌角色和音频驱动数字人。
它和只动嘴巴的对口型工具不同:音频会驱动更完整的表演,包括嘴唇、表情、头部,以及经常出现的上半身动作。用户搜索 talking photo、唱歌照片、音频转视频、AI 对口型或说话数字人,通常就是这类需求。
这个 Demo 只需要三样东西:图片、音频、分辨率。
01
脸或角色清晰最好。照片、插画、动漫和宠物都可以当起始画面。
02
视频长度跟随音频。干净人声比嘈杂背景更容易对上口型。
03
480P 更适合先试功能。720P 更清晰,但公开队列会更慢。
同一套管线可以做说话照片、唱歌表演、动漫翻唱和宠物开口。
让肖像说出一句话。适合讲解、问候和说话数字人。
把脸和人声配在一起。模型会把唱歌当成表演,而不是贴一层嘴型。
只要画得清楚,插画或动漫角色也能跟着歌曲对口型并动起来。
宠物照片加一小段语音很常见——让动物在画面里足够大。
如果你已有视频,只想让嘴巴跟上台词,对口型编辑器可能就够了。S2V 是从静帧和音频直接生成新视频。
| 对比项 | Wan 2.2 S2V | 常见对口型 |
|---|---|---|
| 动作 | 音频驱动面部、表情和身体表演 | 多半只改已有视频的嘴型 |
| 输入 | 静帧图片 + 音频 | 已有视频 + 音频 |
| 风格 | 说话、唱歌、表演 | 通常只有对白 |
| 更适合 | 说话照片、唱歌角色、音频转视频 | 给已有素材替换对白 |
这个公开 Demo 没有文本提示词框,导演工作由图片和音频完成。官方 API 以后可能加 style / prompt,这些搭配现在就有用。
本页使用 Wan-AI 官方公开 Hugging Face Space,访客无需 API Key 就能试 Image + Audio 生成。这是免费 Demo 后端,不是保证的生产额度。
没有。当前北京地域 wan2.2-s2v 价格表标明无免费额度。不要再按旧页面的「100 秒免费」来规划。
这个 Demo 不需要。后端由 Space 运营方提供。自己部署 14B Apache 2.0 权重是另一条路,官方推理对显存要求很高。
公开 Space 可能休眠、限流或暂停。可改用 480P、更短音频、官方 Space 标签,或 ModelScope Studio 备用入口。
相关,但更广。对口型通常是在已有视频上改嘴巴;S2V 是从静帧和音频生成一条新的说话/唱歌视频。
不能当成稳定的生产 API。有真实流量后再接付费服务。这个页面用来验证功能和搜索需求。