Escolha um retrato
Envie uma imagem clara; o Space a processa para a orientação selecionada.
Avatar em vídeo guiado por áudio
Combine uma imagem e uma voz curta para criar um avatar falante com lábios, expressões e corpo sincronizados em Spaces públicos ZeroGPU.
Exibição oficial do OmniAvatar
O áudio controla a fala; o prompt orienta comportamento, emoção e cena.
Use primeiro o Space recomendado ou troque manualmente. Spaces ZeroGPU podem dormir, despertar, enfileirar ou mudar de estado.
alexnasa · OmniAvatar
Configuração ZeroGPU verificada em 26 de agosto de 2026
Três entradas simples viram uma curta atuação. Referências claras e prompts concisos funcionam melhor.
Envie uma imagem clara; o Space a processa para a orientação selecionada.
Envie áudio, grave pelo microfone ou use uma amostra. O fluxo atual guarda os primeiros 5 segundos.
Use o prompt adaptativo ou descreva expressão, corpo e fundo; depois escolha os passos.
OmniAvatar condiciona rosto, corpo e cena, servindo para apresentadores, podcasts, canto e personagens.
O condicionamento Wav2Vec alinha boca e expressão à voz fornecida.
O personagem pode gesticular e mover o corpo, não apenas falar com a cabeça estática.
O prompt orienta ação, emoção, enquadramento e detalhes opcionais do fundo.
A UI aceita arquivos, gravação no navegador e exemplos de voz em cache.
O HF mede tempo compartilhado por plano; a cota restante afeta a fila e tarefas xlarge custam 2× as large.
| Conta | GPU diário incluído | Prioridade |
|---|---|---|
| Anônimo | 2 min | Baixa |
| HF Free | 5 min | Média |
| HF PRO | 40 min | Máxima |
A função atual corta o áudio nos primeiros 5 segundos para manter o trabalho 14B viável no ZeroGPU compartilhado.
O código atual do alexnasa pede GPU xlarge de 96 GB. Quatro passos padrão e multiplicador 2× podem superar a cota anônima diária. É uma estimativa do código ao vivo.
Em vez de repassar a uma API comercial, os Spaces carregam a pilha aberta OmniAvatar e pedem ZeroGPU na inferência.
Seu navegador
Space HF público
ZeroGPU
Avatar MP4
Spaces Gradio públicos expõem API, mas OmniAvatar tem pré-processamento e estado. Leia view_api() em vez de fixar /predict.
Client.connect("alexnasa/OmniAvatar") O evento atual usa infer_scene e recebe imagem, áudio, prompt, orientação, passos e sessão. Considere-o experimental.
Pesos 14B/1.3B e código usam Apache-2.0, mas nenhum HF Inference Provider hospeda o 14B. Produtos estáveis precisam de implantação própria.
ZeroGPU público é grátis dentro da cota HF. Uma geração 14B custa muito; a cota anônima pode não bastar e a fila pode ser longa.
O Space abre sem login. Gerar depende da cota anônima e da duração; o HF pode pedir login para oferecer mais cota.
É possível selecionar um arquivo maior, mas a inferência pública atual processa só os primeiros cinco segundos.
A API pública serve para testes. Estado, fila, código e cota mudam; não há compromisso de uptime.
Saem do Wan2.Video e são processadas pelo Space terceiro selecionado. Use só material autorizado.
Explore transferência de movimento, geração de som e outras ferramentas no Wan2.Video.