免費音訊驅動數位人影片

OmniAvatar 免費線上演示

將一張角色圖片與一段短語音組合,生成嘴型、表情與身體動作同步的說話數位人,由公開 Hugging Face ZeroGPU Space 推理。

真實 ZeroGPU 圖片 + 音訊 5 秒演示 提示詞控制
開始生成數位人

OmniAvatar 官方效果展示

音訊控制說話,提示詞引導動作、情緒與場景。

立即生成說話數位人

先使用推薦 Space,無法使用時手動切換備用服務。ZeroGPU Space 會隨時休眠、喚醒、排隊或改變狀態。

正在檢查示範狀態…

alexnasa · OmniAvatar

ZeroGPU 設定核驗於 2026 年 8 月 26 日

ZeroGPU · 動態狀態
正在喚醒或載入 OmniAvatar Space…

一張人像、一段聲音、一個表演方向

公開演示把三個簡單輸入變成短數位人表演。清晰參考圖與簡潔提示詞通常效果較佳。

1

選擇人物圖片

上傳清晰角色圖片,Space 會依所選方向完成預處理與畫面適配。

2

加入短語音

上傳音訊、用麥克風錄製或選擇範例。目前免費流程只保留前 5 秒。

3

指導角色表演

使用自適應提示詞,或描述表情、身體動作和背景,再選擇生成步數。

不只是嘴型同步

OmniAvatar 同時控制臉部、身體與周圍場景,適合虛擬主持、播客、演唱和角色表演。

音訊同步說話

Wav2Vec 音訊條件讓嘴型與臉部表情跟隨輸入語音。

自適應身體動畫

角色可做手勢與身體動作,不只是靜止的說話頭像。

文字導演表演

提示詞可指導動作、情緒、鏡頭構圖與選用背景細節。

上傳或錄製音訊

社群介面支援音訊檔案、瀏覽器麥克風錄製與快取語音範例。

ZeroGPU 免費,但並非無限

Hugging Face 依帳戶等級計算共享 GPU 時間,剩餘額度也影響排隊優先級;xlarge 任務按 large 兩倍扣減。

帳戶每日包含 GPU 時間排隊優先級
未登入2 min低
HF Free5 min中
HF PRO40 min最高

為什麼公開演示只處理 5 秒

目前推理函數在生成前將音訊裁到前 5 秒,讓 14B 數位人任務較適合共享 ZeroGPU 容量。

alexnasa 目前程式碼申請 96 GB xlarge GPU。預設 4 步的估計預留時間加上 2 倍額度係數,可能超過匿名每日額度。這是依即時程式碼估算,可能改變。

模型確實運行於 Hugging Face 共享 GPU

與轉呼叫商業 API 的演示不同,這些 Space 會載入開源 OmniAvatar 技術棧,僅在推理時申請 ZeroGPU。

你的瀏覽器

公開 HF Space

ZeroGPU

數位人 MP4

公開 Gradio API

所有公開 Gradio Space 都提供 API,但 OmniAvatar 包含多步預處理與狀態。應先用 view_api() 讀取即時定義,不要硬編碼 /predict。

Client.connect("alexnasa/OmniAvatar")

目前生成事件基於 infer_scene,接收圖片、音訊、提示詞、方向、步數和工作階段狀態。請視為實驗介面。

生產部署與自行託管

官方 14B、1.3B 權重與推理程式碼採 Apache-2.0,但目前沒有 HF Inference Provider 託管 14B。穩定產品需自建部署與容量方案。

14B 1.3B Apache-2.0 480p

OmniAvatar 演示常見問題

OmniAvatar 演示免費嗎?

公開 ZeroGPU 介面可在 Hugging Face 額度內免費使用。14B 全新生成成本高,匿名額度可能不足,排隊也可能很長。

不登入可以生成嗎?

無需登入即可開啟 Space。能否生成取決於匿名剩餘額度與任務時長;Hugging Face 可能要求登入以取得更多額度。

可以上傳長音訊嗎?

可選擇較長檔案,但目前公開推理鏈路會主動只處理前 5 秒。

能把它當免費生產 API 嗎?

公開 Gradio API 適合實驗,但 Space 狀態、佇列、程式碼與每日額度都可能改變,不承諾生產可用率。

圖片和聲音在哪裡處理?

內容會離開 Wan2.Video,由所選第三方 Hugging Face Space 處理。請只使用獲得上傳授權的素材。