Avatar vidéo gratuit piloté par audio

Démo gratuite OmniAvatar

Combinez une image et une voix courte pour créer un avatar parlant aux lèvres, expressions et mouvements synchronisés sur ZeroGPU public.

Vrai ZeroGPU Image + audio Démo 5 s Contrôle par prompt
Créer un avatar

Présentation officielle OmniAvatar

L'audio contrôle la parole ; le prompt guide comportement, émotion et scène.

Créez un avatar parlant

Utilisez d'abord le Space recommandé ou changez manuellement. ZeroGPU peut dormir, redémarrer, mettre en file ou changer d'état.

Vérification de la disponibilité…

alexnasa · OmniAvatar

Configuration ZeroGPU vérifiée le 26 août 2026

ZeroGPU · dynamique
Réveil ou chargement du Space OmniAvatar…

Un portrait, une voix, une direction

Trois entrées simples deviennent une courte performance. Références claires et prompts concis fonctionnent mieux.

1

Choisissez un portrait

Importez une image nette ; le Space la prépare pour l'orientation choisie.

2

Ajoutez une voix courte

Importez, enregistrez au micro ou utilisez un exemple. Le flux actuel conserve les 5 premières secondes.

3

Dirigez la performance

Gardez le prompt adaptatif ou décrivez expression, corps et fond, puis choisissez les étapes.

Plus que de la synchronisation labiale

OmniAvatar conditionne visage, corps et scène pour présentateurs, podcasts, chant et personnages.

Parole synchronisée

Le conditionnement Wav2Vec aligne bouche et expression sur la voix.

Animation corporelle adaptative

Le personnage peut gesticuler et bouger, au-delà d'une tête parlante statique.

Performance dirigée par texte

Le prompt guide action, émotion, cadrage et détails de fond.

Importez ou enregistrez l'audio

L'UI accepte fichiers, micro du navigateur et exemples vocaux en cache.

ZeroGPU est gratuit, pas illimité

HF mesure le temps par compte ; le solde influence la file et xlarge coûte deux fois large.

CompteGPU quotidienPriorité
Anonyme2 minBasse
HF Free5 minMoyenne
HF PRO40 minMaximale

Pourquoi la démo utilise cinq secondes

La fonction actuelle coupe l'audio à 5 secondes pour adapter le travail 14B à la capacité ZeroGPU partagée.

Le code alexnasa actuel demande un GPU xlarge de 96 Go. Quatre étapes et le facteur 2× peuvent dépasser le quota anonyme. Estimation du code en ligne.

Le modèle tourne réellement sur les GPU partagés

Au lieu d'appeler une API commerciale, les Spaces chargent OmniAvatar ouvert et demandent ZeroGPU pendant l'inférence.

Votre navigateur

Space HF public

ZeroGPU

Avatar MP4

API Gradio publique

Les Spaces publics exposent une API, mais OmniAvatar a prétraitement et état. Lisez view_api() au lieu de fixer /predict.

Client.connect("alexnasa/OmniAvatar")

L'événement actuel repose sur infer_scene et reçoit image, audio, prompt, orientation, étapes et session. Considérez-le expérimental.

Production et auto-hébergement

Poids 14B/1.3B et code sont Apache-2.0, mais aucun HF Inference Provider n'héberge 14B. Un produit stable requiert son propre déploiement.

14B 1.3B Apache-2.0 480p

FAQ de la démo OmniAvatar

La démo OmniAvatar est-elle gratuite ?

ZeroGPU public est gratuit dans le quota HF. Une génération 14B coûte cher ; le quota anonyme peut manquer et la file être longue.

Puis-je générer sans connexion ?

Le Space s'ouvre sans compte. Générer dépend du quota et de la durée ; HF peut demander une connexion pour plus de quota.

Puis-je importer un audio long ?

Un fichier plus long peut être choisi, mais l'inférence publique actuelle ne traite que les cinq premières secondes.

Puis-je l'utiliser comme API gratuite de production ?

L'API publique sert aux essais. État, file, code et quota changent ; aucun engagement de disponibilité.

Où sont traitées image et voix ?

Elles quittent Wan2.Video et sont traitées par le Space tiers choisi. Utilisez uniquement du contenu autorisé.