Demo pública gratis

Wan 2.2 Speech to Video

Sube una foto y una pista de voz. Wan 2.2 S2V las convierte en un vídeo hablando, cantando o actuando — labios, expresión y cuerpo.

Gratis para visitantes Sin clave API 480P / 720P

Herramienta en vivo

Generar un vídeo parlante

Entra imagen + audio y sale un MP4. El estudio habla con el Hugging Face Space oficial de Wan-AI, sin tu clave DashScope.

Resolución Resolución

Qué es

Wan 2.2 S2V es speech-to-video, no solo lip sync

Wan 2.2 Speech to Video toma una imagen fija y un audio y genera un vídeo donde el sujeto habla, canta o actúa. Es la variante S2V de la familia Wan 2.2, para fotos parlantes, personajes que cantan y avatares guiados por audio.

A diferencia de una herramienta que solo mueve la boca, S2V usa el audio para una interpretación más completa: labios, expresión, cabeza y a menudo el torso. Quien busca talking photo, foto cantando, audio a vídeo, AI lip sync o talking avatar suele describir este trabajo.

Cómo funciona Wan 2.2 S2V

En esta demo bastan imagen, audio y resolución.

01

Elige una imagen fija

Un rostro o personaje nítido funciona mejor. Fotos, ilustraciones, anime y mascotas valen.

02

Añade habla o canto

La duración del vídeo sigue al audio. Una voz limpia da labios más legibles que un fondo ruidoso.

03

Elige 480P o 720P

480P es más rápido para probar. 720P se ve más nítido, pero la cola pública tarda más.

Requisitos de imagen

  • Mantén al sujeto grande y sin tapar.
  • Frente o tres cuartos van mejor que un perfil extremo.
  • Un protagonista es más fiable que un grupo abarrotado.
  • Se aceptan fotos, arte y personajes estilizados.

Requisitos de audio

  • Habla, canto e interpretación entran en el alcance.
  • Una voz clara importa más que una mezcla sofisticada.
  • Los clips cortos son más amables con la cola pública gratis.
  • Esta demo espera MP3, WAV y M4A.

Lo que la gente realmente genera

El mismo flujo de imagen + audio cubre fotos parlantes, actuaciones cantadas, covers de anime y mascotas hablando.

Foto parlante

Dale una frase a un retrato. Útil para explicaciones, saludos y avatares.

Foto cantando

Empareja un rostro con un vocal. El modelo trata el canto como interpretación, no como una boca superpuesta.

Anime cantando

Personajes ilustrados o de anime pueden sincronizar y moverse con una canción si el dibujo es claro.

Mascota hablando

Foto de mascota más un clip corto de voz es un uso lúdico habitual: deja al animal grande en el encuadre.

S2V vs lip sync

Si solo necesitas que la boca siga un texto en un vídeo existente, un editor de lip sync puede bastar. S2V crea el vídeo desde una imagen fija y un audio.

FunciónWan 2.2 S2VLip sync típico
MovimientoInterpretación de rostro, expresión y cuerpo guiada por audioSobre todo formas de boca en un clip existente
EntradasImagen fija + audioVídeo existente + audio
EstilosHabla, canto e interpretaciónSuele ser solo habla
Mejor paraFotos parlantes, personajes que cantan, audio a vídeoSustituir diálogo en material que ya tienes

Consejos de emparejamiento S2V

Esta demo pública no acepta un prompt de texto. La imagen y el audio dirigen. Las APIs oficiales pueden añadir style o prompt; estos emparejamientos ya ayudan.

  1. 01. Alinea la energía: voz calmada con retrato calmado, vocal potente con pose de escenario.
  2. 02. Deja espacio alrededor de la cara para que el movimiento de cabeza no recorte al sujeto.
  3. 03. Evita fondos recargados si quieres que la interpretación se lea bien.
  4. 04. Un hablante en el audio queda más limpio que voces superpuestas.

FAQ de Wan 2.2 S2V

¿Wan 2.2 S2V es gratis aquí?

Esta página usa el Hugging Face Space público oficial de Wan-AI, así que los visitantes pueden probar imagen + audio sin clave API. Es un backend de demo, no una cuota de producción garantizada.

¿DashScope sigue teniendo cuota gratis de S2V?

No. Los precios actuales de la región de Pekín para wan2.2-s2v no listan cuota gratis. No planifiques con la nota antigua de «100 segundos gratis».

¿Necesito GPU o mi propia clave?

No en esta demo. El operador del Space aporta el backend. Alojar los pesos 14B Apache 2.0 es otro camino y pide una GPU muy grande.

¿Por qué entra en cola o falla?

Los Spaces públicos pueden dormir, limitar o pausarse. Prueba 480P, audio más corto, la pestaña Space oficial o el estudio ModelScope.

¿Es lo mismo que AI lip sync?

Relacionado, pero más amplio. El lip sync suele editar la boca en un vídeo existente. S2V genera un vídeo nuevo hablando o cantando desde una imagen fija y un audio.

¿Puedo usarlo como backend de un producto de pago?

No como API de producción estable. Con tráfico real, usa un proveedor de pago cuando confirmes demanda. Esta página sirve para probar la función.

© 2026 wan2.video