人物画像を選ぶ
明瞭なキャラクター画像をアップロードすると、Space が向きに合わせて前処理します。
無料の音声駆動アバター動画
1枚のキャラクター画像と短い音声から、口元・表情・身体動作が同期した会話アバターを公開 Hugging Face ZeroGPU Space で生成します。
OmniAvatar 公式ショーケース
音声が発話を、プロンプトが動作・感情・場面を制御します。
まず推奨 Space を使い、利用できない場合は手動で予備へ切り替えます。ZeroGPU は休止・起動・待機・状態変更があります。
デモの状態を確認中…
alexnasa · OmniAvatar
ZeroGPU 構成確認日:2026年8月26日
3つの簡単な入力から短いアバター演技を生成します。明瞭な画像と簡潔な指示が効果的です。
明瞭なキャラクター画像をアップロードすると、Space が向きに合わせて前処理します。
音声をアップロード、マイク録音、または例を選択します。現在の無料フローは先頭5秒を使います。
適応プロンプトを使うか、表情、身体動作、背景を記述し、ステップ数を選びます。
OmniAvatar は顔、身体、周囲の場面を同時に条件付けし、司会、ポッドキャスト、歌唱、演技に対応します。
Wav2Vec 条件で口の動きと表情を入力音声に合わせます。
静止した会話顔だけでなく、ジェスチャーや身体動作も生成できます。
動作、感情、カメラ構図、任意の背景詳細をプロンプトで指示できます。
コミュニティUIは音声ファイル、ブラウザのマイク録音、キャッシュ例に対応します。
Hugging Face はアカウント別に共有GPU時間を計測し、残量が待機優先度にも影響します。xlarge は large の2倍です。
| アカウント | 1日のGPU枠 | 待機優先度 |
|---|---|---|
| 未ログイン | 2 min | 低 |
| HF Free | 5 min | 中 |
| HF PRO | 40 min | 最高 |
現在の推論関数は音声を先頭5秒に切り詰め、14Bアバター処理を共有ZeroGPU容量に収めます。
alexnasa の現行コードは96GB xlarge GPUを要求します。既定4ステップの予約見積もりと2倍係数により、匿名1日枠を超える可能性があります。ライブコードに基づく推定です。
商用APIへ転送するデモと違い、これらのSpaceはオープンなOmniAvatarを読み込み、推論時だけZeroGPUを要求します。
ブラウザ
公開 HF Space
ZeroGPU
アバター MP4
公開 Gradio Space はAPIを提供しますが、OmniAvatarには前処理と状態があります。/predictを固定せず view_api() で現在の定義を取得してください。
Client.connect("alexnasa/OmniAvatar") 現在の生成イベントは infer_scene ベースで画像、音声、プロンプト、向き、ステップ、セッション状態を受け取ります。実験用です。
公式14B・1.3B重みと推論コードはApache-2.0ですが、14Bを提供するHF Inference Providerはありません。安定運用には自前の配備が必要です。
公開 ZeroGPU はHF枠内で無料です。14B新規生成は高コストで、匿名枠が不足したり待機が長くなる場合があります。
Spaceは未ログインで開けます。生成は匿名残量と要求時間次第で、追加枠のためログインを求められることがあります。
長いファイルを選べますが、現在の公開推論は新規生成で先頭5秒だけを処理します。
公開APIは実験向けです。Space状態、待機、コード、日次枠が変わるため、本番稼働を保証しません。
Wan2.Videoを離れ、選択した第三者のHF Spaceで処理されます。許可された素材だけを使ってください。
Wan2.Videoで動作転写、音声生成、その他のキャラクター動画ツールを試せます。