01
Escolha uma imagem parada
Um rosto ou personagem nítido funciona melhor. Fotos, ilustrações, anime e animais servem.
Demo pública grátis
Envie uma foto e uma faixa de voz. O Wan 2.2 S2V vira um vídeo falando, cantando ou atuando — lábios, expressão e corpo.
Ferramenta ao vivo
Imagem + áudio entram, MP4 sai. O estúdio fala com o Hugging Face Space oficial da Wan-AI, sem a sua chave DashScope.
A carregar o Space oficial. Demos em sleep podem demorar um minuto a acordar.
O que é
O Wan 2.2 Speech to Video recebe uma imagem parada e um áudio e gera um vídeo em que o sujeito fala, canta ou atua. É a variante S2V da família Wan 2.2, para fotos falantes, personagens que cantam e avatares guiados por áudio.
Ao contrário de uma ferramenta que só move a boca, o S2V usa o áudio para uma performance mais completa: lábios, expressão, cabeça e muitas vezes o tronco. Quem procura talking photo, foto a cantar, áudio para vídeo, AI lip sync ou talking avatar descreve este trabalho.
Nesta demo bastam imagem, áudio e resolução.
01
Um rosto ou personagem nítido funciona melhor. Fotos, ilustrações, anime e animais servem.
02
A duração do vídeo segue o áudio. Voz limpa dá lábios mais legíveis do que faixas ruidosas.
03
480P é mais rápido para testar. 720P é mais nítido, mas a fila pública demora mais.
O mesmo pipeline de imagem + áudio cobre fotos falantes, atuações cantadas, covers de anime e animais a falar.
Dê uma fala a um retrato. Útil para explicações, cumprimentos e avatares.
Junte um rosto a um vocal. O modelo trata o canto como performance, não como boca colada.
Personagens ilustrados ou de anime podem sincronizar e mover-se com uma música se o desenho for claro.
Foto de um animal + um clipe curto de voz é um uso divertido — deixe o animal grande no enquadramento.
Se só precisa que a boca siga um texto num vídeo existente, um editor de lip sync pode chegar. O S2V cria o vídeo a partir de uma imagem parada e áudio.
| Função | Wan 2.2 S2V | Lip sync típico |
|---|---|---|
| Movimento | Performance de rosto, expressão e corpo guiada pelo áudio | Sobretudo formas da boca num clipe existente |
| Entradas | Imagem parada + áudio | Vídeo existente + áudio |
| Estilos | Fala, canto e performance | Normalmente só fala |
| Melhor para | Fotos falantes, personagens a cantar, áudio para vídeo | Trocar diálogo em material que já tem |
Esta demo pública não aceita prompt de texto. A imagem e o áudio dirigem. APIs oficiais podem acrescentar style ou prompt; estes emparelhamentos já ajudam.
Esta página usa o Hugging Face Space público oficial da Wan-AI, por isso visitantes podem tentar imagem + áudio sem chave de API. É um backend de demo, não uma quota de produção garantida.
Não. O preço atual da região de Pequim para wan2.2-s2v não lista quota grátis. Não planeie com a nota antiga de “100 segundos grátis”.
Não nesta demo. O operador do Space fornece o backend. Alojamento próprio dos pesos 14B Apache 2.0 é outro caminho e pede uma GPU muito grande.
Spaces públicos podem dormir, limitar ou pausar. Tente 480P, áudio mais curto, o separador Space oficial ou o estúdio ModelScope.
Relacionado, mas mais amplo. Lip sync costuma editar a boca num vídeo existente. S2V gera um vídeo novo a falar ou cantar a partir de uma imagem parada e áudio.
Não como API de produção estável. Com tráfego real, use um fornecedor pago depois de confirmar procura. Esta página serve para testar a função.