Démo publique gratuite

Wan 2.2 Speech to Video

Envoyez une photo et une piste vocale. Wan 2.2 S2V en fait une vidéo parlante, chantée ou interprétée — lèvres, expression et corps.

Gratuit pour les visiteurs Pas de clé API 480P / 720P

Outil en direct

Générer une vidéo parlante

Image + audio en entrée, MP4 en sortie. Le studio parle au Hugging Face Space officiel Wan-AI, sans votre clé DashScope.

Résolution Résolution

Définition

Wan 2.2 S2V est du speech-to-video, pas seulement du lip sync

Wan 2.2 Speech to Video prend une image fixe et un audio, puis génère une vidéo où le sujet parle, chante ou joue. C’est la variante S2V de la famille Wan 2.2, pour photos parlantes, personnages chantants et avatars guidés par l’audio.

Contrairement à un outil qui ne bouge que la bouche, S2V utilise l’audio pour une performance plus complète : lèvres, expression, tête et souvent le buste. Les recherches talking photo, photo chantante, audio vers vidéo, AI lip sync ou talking avatar décrivent généralement ce besoin.

Comment fonctionne Wan 2.2 S2V

Cette démo n’a besoin que d’une image, d’un audio et d’une résolution.

01

Choisir une image fixe

Un visage ou un personnage net fonctionne le mieux. Photos, illustrations, anime et animaux conviennent.

02

Ajouter parole ou chant

La durée de la vidéo suit l’audio. Une voix claire donne des lèvres plus lisibles qu’une piste bruitée.

03

Choisir 480P ou 720P

Le 480P est plus rapide pour tester. Le 720P est plus net, mais la file publique est plus longue.

Exigences image

  • Gardez le sujet grand et dégagé.
  • Face ou trois-quarts plutôt qu’un profil extrême.
  • Un personnage principal est plus fiable qu’un groupe dense.
  • Photos, dessins et personnages stylisés sont acceptés.

Exigences audio

  • Parole, chant et performance sont dans le périmètre.
  • La clarté de la voix compte plus qu’un mix sophistiqué.
  • Les clips courts sont plus gentils avec la file publique gratuite.
  • Cette démo attend du MP3, WAV et M4A.

Ce que les gens génèrent vraiment

Le même pipeline image + audio couvre photos parlantes, performances chantées, covers anime et animaux qui parlent.

Photo parlante

Donnez une réplique à un portrait. Utile pour explications, salutations et avatars.

Photo chantante

Associez un visage à un chant. Le modèle traite le chant comme une performance, pas une bouche collée.

Anime chantant

Un personnage illustré ou anime peut synchroniser et bouger avec une chanson si le dessin est clair.

Animal qui parle

Photo d’animal + courte voix est un usage ludique courant — gardez l’animal grand dans le cadre.

S2V vs lip sync

S’il suffit que la bouche suive un texte sur une vidéo existante, un éditeur de lip sync peut suffire. S2V crée la vidéo à partir d’une image fixe et d’un audio.

FonctionWan 2.2 S2VLip sync typique
MouvementPerformance visage, expression et corps guidée par l’audioSurtout des formes de bouche sur un clip existant
EntréesImage fixe + audioVidéo existante + audio
StylesParole, chant et performanceSouvent la parole seulement
Idéal pourPhotos parlantes, personnages chantants, audio vers vidéoRemplacer un dialogue sur un rush déjà filmé

Conseils d’association S2V

Cette démo publique n’accepte pas de prompt texte. L’image et l’audio mettent en scène. Les API officielles pourront ajouter style ou prompt ; ces associations aident déjà.

  1. 01. Alignez l’énergie : voix calme avec portrait calme, chant puissant avec pose de scène.
  2. 02. Laissez de l’air autour du visage pour que le mouvement de tête ne coupe pas le sujet.
  3. 03. Évitez les fonds chargés si vous voulez une performance lisible.
  4. 04. Un seul locuteur dans l’audio est plus propre que des voix superposées.

FAQ Wan 2.2 S2V

Wan 2.2 S2V est-il gratuit ici ?

Cette page utilise le Hugging Face Space public officiel Wan-AI, donc les visiteurs peuvent tester image + audio sans clé API. C’est un backend de démo, pas un quota de production garanti.

DashScope a-t-il encore un quota S2V gratuit ?

Non. Les tarifs actuels de la région Pékin pour wan2.2-s2v n’indiquent pas de quota gratuit. Ne planifiez pas avec l’ancienne note « 100 secondes gratuites ».

Faut-il un GPU ou ma propre clé ?

Pas pour cette démo. L’opérateur du Space fournit le backend. Héberger soi-même les poids 14B Apache 2.0 est un autre chemin et demande officiellement un très gros GPU.

Pourquoi le job attend ou échoue ?

Les Spaces publics peuvent dormir, limiter ou se mettre en pause. Essayez le 480P, un audio plus court, l’onglet Space officiel ou le studio ModelScope.

Est-ce la même chose que l’AI lip sync ?

Lié, mais plus large. Le lip sync édite souvent la bouche d’une vidéo existante. S2V génère une nouvelle vidéo parlante ou chantée à partir d’une image fixe et d’un audio.

Puis-je l’utiliser comme backend d’un produit payant ?

Pas comme API de production stable. Avec du vrai trafic, utilisez un fournisseur payant après avoir confirmé la demande. Cette page sert à tester la fonction.

© 2026 wan2.video