Demo pública grátis

Wan 2.2 Speech to Video

Envie uma foto e uma faixa de voz. O Wan 2.2 S2V vira um vídeo falando, cantando ou atuando — lábios, expressão e corpo.

Grátis para visitantes Sem chave de API 480P / 720P

Ferramenta ao vivo

Gerar um vídeo falante

Imagem + áudio entram, MP4 sai. O estúdio fala com o Hugging Face Space oficial da Wan-AI, sem a sua chave DashScope.

Resolução Resolução

O que é

Wan 2.2 S2V é speech-to-video, não só lip sync

O Wan 2.2 Speech to Video recebe uma imagem parada e um áudio e gera um vídeo em que o sujeito fala, canta ou atua. É a variante S2V da família Wan 2.2, para fotos falantes, personagens que cantam e avatares guiados por áudio.

Ao contrário de uma ferramenta que só move a boca, o S2V usa o áudio para uma performance mais completa: lábios, expressão, cabeça e muitas vezes o tronco. Quem procura talking photo, foto a cantar, áudio para vídeo, AI lip sync ou talking avatar descreve este trabalho.

Como funciona o Wan 2.2 S2V

Nesta demo bastam imagem, áudio e resolução.

01

Escolha uma imagem parada

Um rosto ou personagem nítido funciona melhor. Fotos, ilustrações, anime e animais servem.

02

Adicione fala ou canto

A duração do vídeo segue o áudio. Voz limpa dá lábios mais legíveis do que faixas ruidosas.

03

Escolha 480P ou 720P

480P é mais rápido para testar. 720P é mais nítido, mas a fila pública demora mais.

Requisitos da imagem

  • Mantenha o sujeito grande e visível.
  • Frente ou três quartos funcionam melhor do que perfil extremo.
  • Um protagonista é mais fiável do que um grupo cheio.
  • Fotos, arte e personagens estilizados são aceites.

Requisitos do áudio

  • Fala, canto e performance estão no âmbito.
  • Voz clara importa mais do que uma mistura elaborada.
  • Clipe curto é mais amigável para a fila pública grátis.
  • Esta demo espera MP3, WAV e M4A.

O que as pessoas realmente geram

O mesmo pipeline de imagem + áudio cobre fotos falantes, atuações cantadas, covers de anime e animais a falar.

Foto falante

Dê uma fala a um retrato. Útil para explicações, cumprimentos e avatares.

Foto a cantar

Junte um rosto a um vocal. O modelo trata o canto como performance, não como boca colada.

Anime a cantar

Personagens ilustrados ou de anime podem sincronizar e mover-se com uma música se o desenho for claro.

Animal a falar

Foto de um animal + um clipe curto de voz é um uso divertido — deixe o animal grande no enquadramento.

S2V vs lip sync

Se só precisa que a boca siga um texto num vídeo existente, um editor de lip sync pode chegar. O S2V cria o vídeo a partir de uma imagem parada e áudio.

FunçãoWan 2.2 S2VLip sync típico
MovimentoPerformance de rosto, expressão e corpo guiada pelo áudioSobretudo formas da boca num clipe existente
EntradasImagem parada + áudioVídeo existente + áudio
EstilosFala, canto e performanceNormalmente só fala
Melhor paraFotos falantes, personagens a cantar, áudio para vídeoTrocar diálogo em material que já tem

Dicas de emparelhamento S2V

Esta demo pública não aceita prompt de texto. A imagem e o áudio dirigem. APIs oficiais podem acrescentar style ou prompt; estes emparelhamentos já ajudam.

  1. 01. Combine a energia: voz calma com retrato calmo, vocal forte com pose de palco.
  2. 02. Deixe espaço à volta do rosto para o movimento da cabeça não cortar o sujeito.
  3. 03. Evite fundos ocupados se quiser a performance legível.
  4. 04. Um falante no áudio fica mais limpo do que vozes sobrepostas.

FAQ Wan 2.2 S2V

O Wan 2.2 S2V é grátis aqui?

Esta página usa o Hugging Face Space público oficial da Wan-AI, por isso visitantes podem tentar imagem + áudio sem chave de API. É um backend de demo, não uma quota de produção garantida.

A DashScope ainda tem quota grátis de S2V?

Não. O preço atual da região de Pequim para wan2.2-s2v não lista quota grátis. Não planeie com a nota antiga de “100 segundos grátis”.

Preciso de GPU ou da minha chave?

Não nesta demo. O operador do Space fornece o backend. Alojamento próprio dos pesos 14B Apache 2.0 é outro caminho e pede uma GPU muito grande.

Porque é que o trabalho entra em fila ou falha?

Spaces públicos podem dormir, limitar ou pausar. Tente 480P, áudio mais curto, o separador Space oficial ou o estúdio ModelScope.

Isto é o mesmo que AI lip sync?

Relacionado, mas mais amplo. Lip sync costuma editar a boca num vídeo existente. S2V gera um vídeo novo a falar ou cantar a partir de uma imagem parada e áudio.

Posso usar isto como backend de um produto pago?

Não como API de produção estável. Com tráfego real, use um fornecedor pago depois de confirmar procura. Esta página serve para testar a função.

© 2026 wan2.video