01
Elige una imagen fija
Un rostro o personaje nítido funciona mejor. Fotos, ilustraciones, anime y mascotas valen.
Demo pública gratis
Sube una foto y una pista de voz. Wan 2.2 S2V las convierte en un vídeo hablando, cantando o actuando — labios, expresión y cuerpo.
Herramienta en vivo
Entra imagen + audio y sale un MP4. El estudio habla con el Hugging Face Space oficial de Wan-AI, sin tu clave DashScope.
Cargando el Space oficial. Las demos en reposo pueden tardar un minuto en despertar.
Qué es
Wan 2.2 Speech to Video toma una imagen fija y un audio y genera un vídeo donde el sujeto habla, canta o actúa. Es la variante S2V de la familia Wan 2.2, para fotos parlantes, personajes que cantan y avatares guiados por audio.
A diferencia de una herramienta que solo mueve la boca, S2V usa el audio para una interpretación más completa: labios, expresión, cabeza y a menudo el torso. Quien busca talking photo, foto cantando, audio a vídeo, AI lip sync o talking avatar suele describir este trabajo.
En esta demo bastan imagen, audio y resolución.
01
Un rostro o personaje nítido funciona mejor. Fotos, ilustraciones, anime y mascotas valen.
02
La duración del vídeo sigue al audio. Una voz limpia da labios más legibles que un fondo ruidoso.
03
480P es más rápido para probar. 720P se ve más nítido, pero la cola pública tarda más.
El mismo flujo de imagen + audio cubre fotos parlantes, actuaciones cantadas, covers de anime y mascotas hablando.
Dale una frase a un retrato. Útil para explicaciones, saludos y avatares.
Empareja un rostro con un vocal. El modelo trata el canto como interpretación, no como una boca superpuesta.
Personajes ilustrados o de anime pueden sincronizar y moverse con una canción si el dibujo es claro.
Foto de mascota más un clip corto de voz es un uso lúdico habitual: deja al animal grande en el encuadre.
Si solo necesitas que la boca siga un texto en un vídeo existente, un editor de lip sync puede bastar. S2V crea el vídeo desde una imagen fija y un audio.
| Función | Wan 2.2 S2V | Lip sync típico |
|---|---|---|
| Movimiento | Interpretación de rostro, expresión y cuerpo guiada por audio | Sobre todo formas de boca en un clip existente |
| Entradas | Imagen fija + audio | Vídeo existente + audio |
| Estilos | Habla, canto e interpretación | Suele ser solo habla |
| Mejor para | Fotos parlantes, personajes que cantan, audio a vídeo | Sustituir diálogo en material que ya tienes |
Esta demo pública no acepta un prompt de texto. La imagen y el audio dirigen. Las APIs oficiales pueden añadir style o prompt; estos emparejamientos ya ayudan.
Esta página usa el Hugging Face Space público oficial de Wan-AI, así que los visitantes pueden probar imagen + audio sin clave API. Es un backend de demo, no una cuota de producción garantizada.
No. Los precios actuales de la región de Pekín para wan2.2-s2v no listan cuota gratis. No planifiques con la nota antigua de «100 segundos gratis».
No en esta demo. El operador del Space aporta el backend. Alojar los pesos 14B Apache 2.0 es otro camino y pide una GPU muy grande.
Los Spaces públicos pueden dormir, limitar o pausarse. Prueba 480P, audio más corto, la pestaña Space oficial o el estudio ModelScope.
Relacionado, pero más amplio. El lip sync suele editar la boca en un vídeo existente. S2V genera un vídeo nuevo hablando o cantando desde una imagen fija y un audio.
No como API de producción estable. Con tráfico real, usa un proveedor de pago cuando confirmes demanda. Esta página sirve para probar la función.