免费音频驱动数字人视频

OmniAvatar 免费在线演示

将一张角色图片与一段短语音组合,生成口型、表情和身体动作同步的说话数字人。实际推理由公开 Hugging Face ZeroGPU Space 完成。

真实 ZeroGPU 图片 + 音频 5 秒演示 提示词控制
开始生成数字人

OmniAvatar 官方效果展示

音频控制说话,提示词引导动作、情绪与场景。

立即生成说话数字人

优先使用推荐 Space,不可用时手动切换备用服务。ZeroGPU Space 会随时休眠、唤醒、排队或改变状态。

正在检查演示状态…

alexnasa · OmniAvatar

ZeroGPU 配置核验于 2026 年 8 月 26 日

ZeroGPU · 动态状态
正在唤醒或加载 OmniAvatar Space…

一张人像、一段声音、一个表演方向

公开演示把三个简单输入变成短数字人表演。清晰参考图与简洁提示词通常效果更好。

1

选择人物图片

上传清晰的角色图片,Space 会根据所选方向完成预处理与画面适配。

2

添加短语音

上传音频、使用麦克风录制或选择示例。当前免费流程只保留前 5 秒。

3

指导角色表演

使用自适应提示词,或描述表情、身体动作和背景,然后选择生成步数。

不只是口型同步

OmniAvatar 同时控制面部、身体与周围场景,适合虚拟主持、播客、演唱和角色表演。

音频同步说话

Wav2Vec 音频条件让嘴型与面部表情跟随输入语音。

自适应身体动画

角色可以做手势与身体动作,而不是只生成静止的说话头像。

文本导演表演

提示词可以指导动作、情绪、镜头构图与可选背景细节。

上传或录制音频

社区界面支持音频文件、浏览器麦克风录制和缓存语音示例。

ZeroGPU 免费,但并非无限

Hugging Face 按账户等级计算共享 GPU 时间,剩余额度还会影响排队优先级;xlarge 任务按 large 的两倍扣减。

账户每日包含 GPU 时间排队优先级
未登录2 min低
HF Free5 min中
HF PRO40 min最高

为什么公开演示只处理 5 秒

当前推理函数会在生成前把上传音频裁到前 5 秒,以便 14B 数字人任务更适合共享 ZeroGPU 容量。

alexnasa 当前代码申请 96 GB xlarge GPU。默认 4 步的预估预留时间叠加 2 倍额度系数后,可能超过匿名用户的每日额度。该结论基于实时代码估算,后续可能变化。

模型确实运行在 Hugging Face 共享 GPU 上

与转调商业 API 的演示不同,这些 Space 会加载开源 OmniAvatar 技术栈,并仅在推理函数运行时申请 ZeroGPU。

你的浏览器

公开 HF Space

ZeroGPU

数字人 MP4

公开 Gradio API

所有公开 Gradio Space 都会提供 API,但 OmniAvatar 包含多步预处理与状态。应先用 view_api() 读取实时定义,不要硬编码通用 /predict。

Client.connect("alexnasa/OmniAvatar")

当前生成事件基于 infer_scene,接收图片、音频、提示词、方向、步数和会话状态。应将其视为实验接口。

生产部署与自托管

官方 14B、1.3B 权重与推理代码采用 Apache-2.0,但当前没有 Hugging Face Inference Provider 托管 14B。稳定产品需要自建部署和容量方案。

14B 1.3B Apache-2.0 480p

OmniAvatar 演示常见问题

OmniAvatar 演示免费吗?

公开 ZeroGPU 界面可在 Hugging Face 额度内免费使用。14B 全新生成成本较高,匿名额度可能不足,排队也可能很长。

不登录可以生成吗?

无需登录即可打开 Space。能否生成取决于匿名剩余额度和任务申请时长;Hugging Face 可能要求登录以获得更多额度。

可以上传长音频吗?

可以选择较长文件,但当前公开推理链路会主动只处理前 5 秒。

能把它当作免费生产 API 吗?

公开 Gradio API 适合实验,但 Space 状态、队列、代码和每日额度均可能变化,不提供生产可用率承诺。

图片和声音在哪里处理?

内容会离开 Wan2.Video,由所选第三方 Hugging Face Space 处理。请只使用获得上传授权的素材。