01
Choisir une image fixe
Un visage ou un personnage net fonctionne le mieux. Photos, illustrations, anime et animaux conviennent.
Démo publique gratuite
Envoyez une photo et une piste vocale. Wan 2.2 S2V en fait une vidéo parlante, chantée ou interprétée — lèvres, expression et corps.
Outil en direct
Image + audio en entrée, MP4 en sortie. Le studio parle au Hugging Face Space officiel Wan-AI, sans votre clé DashScope.
Chargement du Space officiel. Une démo endormie peut mettre une minute à se réveiller.
Définition
Wan 2.2 Speech to Video prend une image fixe et un audio, puis génère une vidéo où le sujet parle, chante ou joue. C’est la variante S2V de la famille Wan 2.2, pour photos parlantes, personnages chantants et avatars guidés par l’audio.
Contrairement à un outil qui ne bouge que la bouche, S2V utilise l’audio pour une performance plus complète : lèvres, expression, tête et souvent le buste. Les recherches talking photo, photo chantante, audio vers vidéo, AI lip sync ou talking avatar décrivent généralement ce besoin.
Cette démo n’a besoin que d’une image, d’un audio et d’une résolution.
01
Un visage ou un personnage net fonctionne le mieux. Photos, illustrations, anime et animaux conviennent.
02
La durée de la vidéo suit l’audio. Une voix claire donne des lèvres plus lisibles qu’une piste bruitée.
03
Le 480P est plus rapide pour tester. Le 720P est plus net, mais la file publique est plus longue.
Le même pipeline image + audio couvre photos parlantes, performances chantées, covers anime et animaux qui parlent.
Donnez une réplique à un portrait. Utile pour explications, salutations et avatars.
Associez un visage à un chant. Le modèle traite le chant comme une performance, pas une bouche collée.
Un personnage illustré ou anime peut synchroniser et bouger avec une chanson si le dessin est clair.
Photo d’animal + courte voix est un usage ludique courant — gardez l’animal grand dans le cadre.
S’il suffit que la bouche suive un texte sur une vidéo existante, un éditeur de lip sync peut suffire. S2V crée la vidéo à partir d’une image fixe et d’un audio.
| Fonction | Wan 2.2 S2V | Lip sync typique |
|---|---|---|
| Mouvement | Performance visage, expression et corps guidée par l’audio | Surtout des formes de bouche sur un clip existant |
| Entrées | Image fixe + audio | Vidéo existante + audio |
| Styles | Parole, chant et performance | Souvent la parole seulement |
| Idéal pour | Photos parlantes, personnages chantants, audio vers vidéo | Remplacer un dialogue sur un rush déjà filmé |
Cette démo publique n’accepte pas de prompt texte. L’image et l’audio mettent en scène. Les API officielles pourront ajouter style ou prompt ; ces associations aident déjà.
Cette page utilise le Hugging Face Space public officiel Wan-AI, donc les visiteurs peuvent tester image + audio sans clé API. C’est un backend de démo, pas un quota de production garanti.
Non. Les tarifs actuels de la région Pékin pour wan2.2-s2v n’indiquent pas de quota gratuit. Ne planifiez pas avec l’ancienne note « 100 secondes gratuites ».
Pas pour cette démo. L’opérateur du Space fournit le backend. Héberger soi-même les poids 14B Apache 2.0 est un autre chemin et demande officiellement un très gros GPU.
Les Spaces publics peuvent dormir, limiter ou se mettre en pause. Essayez le 480P, un audio plus court, l’onglet Space officiel ou le studio ModelScope.
Lié, mais plus large. Le lip sync édite souvent la bouche d’une vidéo existante. S2V génère une nouvelle vidéo parlante ou chantée à partir d’une image fixe et d’un audio.
Pas comme API de production stable. Avec du vrai trafic, utilisez un fournisseur payant après avoir confirmé la demande. Cette page sert à tester la fonction.