Avatar em vídeo guiado por áudio

Demo online grátis do OmniAvatar

Combine uma imagem e uma voz curta para criar um avatar falante com lábios, expressões e corpo sincronizados em Spaces públicos ZeroGPU.

ZeroGPU real Imagem + áudio Demo de 5 s Controle por prompt
Criar avatar

Exibição oficial do OmniAvatar

O áudio controla a fala; o prompt orienta comportamento, emoção e cena.

Crie um avatar falante agora

Use primeiro o Space recomendado ou troque manualmente. Spaces ZeroGPU podem dormir, despertar, enfileirar ou mudar de estado.

alexnasa · OmniAvatar

Configuração ZeroGPU verificada em 26 de agosto de 2026

ZeroGPU · dinâmico
Despertando ou carregando o Space OmniAvatar…

Um retrato, uma voz e uma direção

Três entradas simples viram uma curta atuação. Referências claras e prompts concisos funcionam melhor.

1

Escolha um retrato

Envie uma imagem clara; o Space a processa para a orientação selecionada.

2

Adicione uma voz curta

Envie áudio, grave pelo microfone ou use uma amostra. O fluxo atual guarda os primeiros 5 segundos.

3

Dirija a atuação

Use o prompt adaptativo ou descreva expressão, corpo e fundo; depois escolha os passos.

Mais que sincronização labial

OmniAvatar condiciona rosto, corpo e cena, servindo para apresentadores, podcasts, canto e personagens.

Fala sincronizada

O condicionamento Wav2Vec alinha boca e expressão à voz fornecida.

Animação corporal adaptativa

O personagem pode gesticular e mover o corpo, não apenas falar com a cabeça estática.

Atuação dirigida por texto

O prompt orienta ação, emoção, enquadramento e detalhes opcionais do fundo.

Envie ou grave áudio

A UI aceita arquivos, gravação no navegador e exemplos de voz em cache.

ZeroGPU é grátis, não ilimitado

O HF mede tempo compartilhado por plano; a cota restante afeta a fila e tarefas xlarge custam 2× as large.

ContaGPU diário incluídoPrioridade
Anônimo2 minBaixa
HF Free5 minMédia
HF PRO40 minMáxima

Por que o demo usa cinco segundos

A função atual corta o áudio nos primeiros 5 segundos para manter o trabalho 14B viável no ZeroGPU compartilhado.

O código atual do alexnasa pede GPU xlarge de 96 GB. Quatro passos padrão e multiplicador 2× podem superar a cota anônima diária. É uma estimativa do código ao vivo.

O modelo roda de verdade nas GPUs compartilhadas

Em vez de repassar a uma API comercial, os Spaces carregam a pilha aberta OmniAvatar e pedem ZeroGPU na inferência.

Seu navegador

Space HF público

ZeroGPU

Avatar MP4

API Gradio pública

Spaces Gradio públicos expõem API, mas OmniAvatar tem pré-processamento e estado. Leia view_api() em vez de fixar /predict.

Client.connect("alexnasa/OmniAvatar")

O evento atual usa infer_scene e recebe imagem, áudio, prompt, orientação, passos e sessão. Considere-o experimental.

Produção e hospedagem própria

Pesos 14B/1.3B e código usam Apache-2.0, mas nenhum HF Inference Provider hospeda o 14B. Produtos estáveis precisam de implantação própria.

14B 1.3B Apache-2.0 480p

Perguntas sobre o OmniAvatar

O demo do OmniAvatar é grátis?

ZeroGPU público é grátis dentro da cota HF. Uma geração 14B custa muito; a cota anônima pode não bastar e a fila pode ser longa.

Posso gerar sem entrar?

O Space abre sem login. Gerar depende da cota anônima e da duração; o HF pode pedir login para oferecer mais cota.

Posso enviar áudio longo?

É possível selecionar um arquivo maior, mas a inferência pública atual processa só os primeiros cinco segundos.

Posso usar como API grátis de produção?

A API pública serve para testes. Estado, fila, código e cota mudam; não há compromisso de uptime.

Onde imagem e voz são processadas?

Saem do Wan2.Video e são processadas pelo Space terceiro selecionado. Use só material autorizado.