Elige un retrato
Sube una imagen clara; el Space la procesa para la orientación elegida.
Vídeo de avatar guiado por audio
Combina una imagen y una voz corta para crear un avatar que habla con labios, expresiones y cuerpo sincronizados mediante ZeroGPU público.
Muestra oficial de OmniAvatar
El audio controla el habla y el prompt guía conducta, emoción y escena.
Usa primero el Space recomendado o cambia manualmente. ZeroGPU puede dormir, despertar, hacer cola o cambiar de estado.
Comprobando la disponibilidad…
alexnasa · OmniAvatar
Configuración ZeroGPU verificada el 26 de agosto de 2026
Tres entradas simples se convierten en una actuación corta. Funcionan mejor referencias claras y prompts breves.
Sube una imagen clara; el Space la procesa para la orientación elegida.
Sube audio, graba con el micrófono o usa una muestra. El flujo actual conserva los primeros 5 segundos.
Usa el prompt adaptativo o describe expresión, cuerpo y fondo; después elige los pasos.
OmniAvatar condiciona rostro, cuerpo y escena; sirve para presentadores, podcasts, canto y personajes.
El condicionamiento Wav2Vec alinea boca y expresión con la voz.
El personaje puede gesticular y mover el cuerpo, no solo hablar con una cabeza estática.
El prompt guía acción, emoción, encuadre y detalles opcionales del fondo.
La UI acepta archivos, grabación del navegador y ejemplos de voz en caché.
HF mide tiempo por cuenta; la cuota restante afecta la cola y las tareas xlarge cuestan el doble que large.
| Cuenta | GPU diario incluido | Prioridad |
|---|---|---|
| Anónimo | 2 min | Baja |
| HF Free | 5 min | Media |
| HF PRO | 40 min | Máxima |
La función actual corta el audio a sus primeros 5 segundos para que el trabajo 14B sea viable en ZeroGPU compartido.
El código actual de alexnasa pide una GPU xlarge de 96 GB. Cuatro pasos y el multiplicador 2× pueden superar la cuota anónima. Es una estimación del código vivo.
En vez de reenviar a una API comercial, los Spaces cargan OmniAvatar abierto y solicitan ZeroGPU durante la inferencia.
Tu navegador
Space HF público
ZeroGPU
Avatar MP4
Los Spaces Gradio públicos exponen API, pero OmniAvatar tiene preprocesado y estado. Lee view_api() y no fijes /predict.
Client.connect("alexnasa/OmniAvatar") El evento actual usa infer_scene y recibe imagen, audio, prompt, orientación, pasos y sesión. Trátalo como experimental.
Pesos 14B/1.3B y código usan Apache-2.0, pero ningún HF Inference Provider aloja 14B. Un producto estable necesita despliegue propio.
ZeroGPU público es gratis dentro de la cuota HF. Una generación 14B cuesta mucho; la cuota anónima puede no bastar y la cola puede ser larga.
El Space abre sin entrar. Generar depende de cuota y duración; HF puede pedir acceso para ofrecer más cuota.
Puedes seleccionar un archivo mayor, pero la inferencia pública actual procesa solo los primeros cinco segundos.
La API pública sirve para pruebas. Estado, cola, código y cuota cambian; no hay compromiso de disponibilidad.
Salen de Wan2.Video y las procesa el Space tercero elegido. Usa solo material autorizado.
Explora transferencia de movimiento, generación de sonido y otras herramientas de Wan2.Video.