Vídeo de avatar guiado por audio

Demo online gratis de OmniAvatar

Combina una imagen y una voz corta para crear un avatar que habla con labios, expresiones y cuerpo sincronizados mediante ZeroGPU público.

ZeroGPU real Imagen + audio Demo de 5 s Control por prompt
Crear avatar

Muestra oficial de OmniAvatar

El audio controla el habla y el prompt guía conducta, emoción y escena.

Crea un avatar que habla

Usa primero el Space recomendado o cambia manualmente. ZeroGPU puede dormir, despertar, hacer cola o cambiar de estado.

Comprobando la disponibilidad…

alexnasa · OmniAvatar

Configuración ZeroGPU verificada el 26 de agosto de 2026

ZeroGPU · dinámico
Despertando o cargando el Space OmniAvatar…

Un retrato, una voz y una dirección

Tres entradas simples se convierten en una actuación corta. Funcionan mejor referencias claras y prompts breves.

1

Elige un retrato

Sube una imagen clara; el Space la procesa para la orientación elegida.

2

Añade una voz corta

Sube audio, graba con el micrófono o usa una muestra. El flujo actual conserva los primeros 5 segundos.

3

Dirige la actuación

Usa el prompt adaptativo o describe expresión, cuerpo y fondo; después elige los pasos.

Más que sincronización labial

OmniAvatar condiciona rostro, cuerpo y escena; sirve para presentadores, podcasts, canto y personajes.

Habla sincronizada

El condicionamiento Wav2Vec alinea boca y expresión con la voz.

Animación corporal adaptativa

El personaje puede gesticular y mover el cuerpo, no solo hablar con una cabeza estática.

Actuación dirigida por texto

El prompt guía acción, emoción, encuadre y detalles opcionales del fondo.

Sube o graba audio

La UI acepta archivos, grabación del navegador y ejemplos de voz en caché.

ZeroGPU es gratis, no ilimitado

HF mide tiempo por cuenta; la cuota restante afecta la cola y las tareas xlarge cuestan el doble que large.

CuentaGPU diario incluidoPrioridad
Anónimo2 minBaja
HF Free5 minMedia
HF PRO40 minMáxima

Por qué el demo usa cinco segundos

La función actual corta el audio a sus primeros 5 segundos para que el trabajo 14B sea viable en ZeroGPU compartido.

El código actual de alexnasa pide una GPU xlarge de 96 GB. Cuatro pasos y el multiplicador 2× pueden superar la cuota anónima. Es una estimación del código vivo.

El modelo sí funciona en GPUs compartidas de Hugging Face

En vez de reenviar a una API comercial, los Spaces cargan OmniAvatar abierto y solicitan ZeroGPU durante la inferencia.

Tu navegador

Space HF público

ZeroGPU

Avatar MP4

API Gradio pública

Los Spaces Gradio públicos exponen API, pero OmniAvatar tiene preprocesado y estado. Lee view_api() y no fijes /predict.

Client.connect("alexnasa/OmniAvatar")

El evento actual usa infer_scene y recibe imagen, audio, prompt, orientación, pasos y sesión. Trátalo como experimental.

Producción y alojamiento propio

Pesos 14B/1.3B y código usan Apache-2.0, pero ningún HF Inference Provider aloja 14B. Un producto estable necesita despliegue propio.

14B 1.3B Apache-2.0 480p

Preguntas sobre OmniAvatar

¿El demo de OmniAvatar es gratis?

ZeroGPU público es gratis dentro de la cuota HF. Una generación 14B cuesta mucho; la cuota anónima puede no bastar y la cola puede ser larga.

¿Puedo generar sin iniciar sesión?

El Space abre sin entrar. Generar depende de cuota y duración; HF puede pedir acceso para ofrecer más cuota.

¿Puedo subir audio largo?

Puedes seleccionar un archivo mayor, pero la inferencia pública actual procesa solo los primeros cinco segundos.

¿Puedo usarlo como API gratis de producción?

La API pública sirve para pruebas. Estado, cola, código y cuota cambian; no hay compromiso de disponibilidad.

¿Dónde se procesan imagen y voz?

Salen de Wan2.Video y las procesa el Space tercero elegido. Usa solo material autorizado.