选择人物图片
上传清晰的角色图片,Space 会根据所选方向完成预处理与画面适配。
免费音频驱动数字人视频
将一张角色图片与一段短语音组合,生成口型、表情和身体动作同步的说话数字人。实际推理由公开 Hugging Face ZeroGPU Space 完成。
OmniAvatar 官方效果展示
音频控制说话,提示词引导动作、情绪与场景。
优先使用推荐 Space,不可用时手动切换备用服务。ZeroGPU Space 会随时休眠、唤醒、排队或改变状态。
正在检查演示状态…
alexnasa · OmniAvatar
ZeroGPU 配置核验于 2026 年 8 月 26 日
公开演示把三个简单输入变成短数字人表演。清晰参考图与简洁提示词通常效果更好。
上传清晰的角色图片,Space 会根据所选方向完成预处理与画面适配。
上传音频、使用麦克风录制或选择示例。当前免费流程只保留前 5 秒。
使用自适应提示词,或描述表情、身体动作和背景,然后选择生成步数。
OmniAvatar 同时控制面部、身体与周围场景,适合虚拟主持、播客、演唱和角色表演。
Wav2Vec 音频条件让嘴型与面部表情跟随输入语音。
角色可以做手势与身体动作,而不是只生成静止的说话头像。
提示词可以指导动作、情绪、镜头构图与可选背景细节。
社区界面支持音频文件、浏览器麦克风录制和缓存语音示例。
Hugging Face 按账户等级计算共享 GPU 时间,剩余额度还会影响排队优先级;xlarge 任务按 large 的两倍扣减。
| 账户 | 每日包含 GPU 时间 | 排队优先级 |
|---|---|---|
| 未登录 | 2 min | 低 |
| HF Free | 5 min | 中 |
| HF PRO | 40 min | 最高 |
当前推理函数会在生成前把上传音频裁到前 5 秒,以便 14B 数字人任务更适合共享 ZeroGPU 容量。
alexnasa 当前代码申请 96 GB xlarge GPU。默认 4 步的预估预留时间叠加 2 倍额度系数后,可能超过匿名用户的每日额度。该结论基于实时代码估算,后续可能变化。
与转调商业 API 的演示不同,这些 Space 会加载开源 OmniAvatar 技术栈,并仅在推理函数运行时申请 ZeroGPU。
你的浏览器
公开 HF Space
ZeroGPU
数字人 MP4
所有公开 Gradio Space 都会提供 API,但 OmniAvatar 包含多步预处理与状态。应先用 view_api() 读取实时定义,不要硬编码通用 /predict。
Client.connect("alexnasa/OmniAvatar") 当前生成事件基于 infer_scene,接收图片、音频、提示词、方向、步数和会话状态。应将其视为实验接口。
官方 14B、1.3B 权重与推理代码采用 Apache-2.0,但当前没有 Hugging Face Inference Provider 托管 14B。稳定产品需要自建部署和容量方案。
公开 ZeroGPU 界面可在 Hugging Face 额度内免费使用。14B 全新生成成本较高,匿名额度可能不足,排队也可能很长。
无需登录即可打开 Space。能否生成取决于匿名剩余额度和任务申请时长;Hugging Face 可能要求登录以获得更多额度。
可以选择较长文件,但当前公开推理链路会主动只处理前 5 秒。
公开 Gradio API 适合实验,但 Space 状态、队列、代码和每日额度均可能变化,不提供生产可用率承诺。
内容会离开 Wan2.Video,由所选第三方 Hugging Face Space 处理。请只使用获得上传授权的素材。
探索动作迁移、声音生成及 Wan2.Video 上的其他角色视频工具。