免费公开 Demo

Wan 2.2 Speech to Video

上传一张照片和一段语音。Wan 2.2 S2V 会生成说话、唱歌或表演视频,带动嘴唇、表情和身体动作。

访客免费 不用 API Key 480P / 720P

在线工具

生成说话视频

图片 + 音频进去,MP4 出来。工作室直接调用 Wan-AI 官方 Hugging Face Space,不用你自己的 DashScope Key。

分辨率 分辨率

是什么

Wan 2.2 S2V 是语音驱动视频,不只是对口型

Wan 2.2 Speech to Video 接收一张静帧和一段音频,生成人物说话、唱歌或表演的视频。它是 Wan 2.2 家族里的 S2V 变体,面向说话照片、唱歌角色和音频驱动数字人。

它和只动嘴巴的对口型工具不同:音频会驱动更完整的表演,包括嘴唇、表情、头部,以及经常出现的上半身动作。用户搜索 talking photo、唱歌照片、音频转视频、AI 对口型或说话数字人,通常就是这类需求。

Wan 2.2 S2V 怎么用

这个 Demo 只需要三样东西:图片、音频、分辨率。

01

准备一张静帧

脸或角色清晰最好。照片、插画、动漫和宠物都可以当起始画面。

02

加上说话或唱歌

视频长度跟随音频。干净人声比嘈杂背景更容易对上口型。

03

选择 480P 或 720P

480P 更适合先试功能。720P 更清晰,但公开队列会更慢。

图片要求

  • 主体尽量大、不要被遮挡。
  • 正面或四分之三侧面,比极端侧脸更稳。
  • 一个主要角色,比拥挤合影更可靠。
  • 照片、绘画和风格化角色都可以。

音频要求

  • 说话、唱歌、表演音频都在能力范围内。
  • 人声清晰比混音花哨更重要。
  • 短音频对免费公开队列更友好。
  • 这个 Demo 主要接受 MP3、WAV、M4A。

大家真正会生成的内容

同一套管线可以做说话照片、唱歌表演、动漫翻唱和宠物开口。

说话照片

让肖像说出一句话。适合讲解、问候和说话数字人。

唱歌照片

把脸和人声配在一起。模型会把唱歌当成表演,而不是贴一层嘴型。

动漫唱歌

只要画得清楚,插画或动漫角色也能跟着歌曲对口型并动起来。

宠物开口

宠物照片加一小段语音很常见——让动物在画面里足够大。

S2V 和对口型有什么差别

如果你已有视频,只想让嘴巴跟上台词,对口型编辑器可能就够了。S2V 是从静帧和音频直接生成新视频。

对比项Wan 2.2 S2V常见对口型
动作音频驱动面部、表情和身体表演多半只改已有视频的嘴型
输入静帧图片 + 音频已有视频 + 音频
风格说话、唱歌、表演通常只有对白
更适合说话照片、唱歌角色、音频转视频给已有素材替换对白

S2V 提示与搭配建议

这个公开 Demo 没有文本提示词框,导演工作由图片和音频完成。官方 API 以后可能加 style / prompt,这些搭配现在就有用。

  1. 01. 能量要对上:平静的声音配平静肖像,高亢演唱配表演姿态。
  2. 02. 脸周围留一点空间,避免头部动作把主体切出画面。
  3. 03. 背景不要太乱,表演才容易看清。
  4. 04. 音频里一个说话人,比多人叠音更干净。

Wan 2.2 S2V 常见问题

这里真的免费吗?

本页使用 Wan-AI 官方公开 Hugging Face Space,访客无需 API Key 就能试 Image + Audio 生成。这是免费 Demo 后端,不是保证的生产额度。

阿里云百炼还有 S2V 免费额度吗?

没有。当前北京地域 wan2.2-s2v 价格表标明无免费额度。不要再按旧页面的「100 秒免费」来规划。

需要 GPU 或自己的 Key 吗?

这个 Demo 不需要。后端由 Space 运营方提供。自己部署 14B Apache 2.0 权重是另一条路,官方推理对显存要求很高。

为什么排队或失败?

公开 Space 可能休眠、限流或暂停。可改用 480P、更短音频、官方 Space 标签,或 ModelScope Studio 备用入口。

这就是 AI 对口型吗?

相关,但更广。对口型通常是在已有视频上改嘴巴;S2V 是从静帧和音频生成一条新的说话/唱歌视频。

能拿它当付费产品后端吗?

不能当成稳定的生产 API。有真实流量后再接付费服务。这个页面用来验证功能和搜索需求。

© 2026 wan2.video