Vídeo para áudio

Video-a-áudio (V2A) é o inverso de S2V: imagem silenciosa (ou com pontuação inferior), banda sonora. Wan2.2 T2V/I2V O companheiro aberto neste site é o ThinkSound (FunAudioLLM), um modelo de fluxo compatível com a co-guida do Any2Audio.

ThinkSoundV2Afoley
Nesta página 5
Um vídeo silencioso para a ThinkSound e depois uma trilha sonora
Fluxo de trabalho típico 2.2: gerar quadros silenciosos Wan, em seguida, executar um modelo V2A e mux.

Por que é um modelo diferente

T2V/I2V Os DiTs são treinados para denotar o RGB (ou VAE) latentes. V2A O modelo denota latentes de áudio condicionadas a recursos de vídeo (CLIPA mistura dessas cabeças em um ckpt aberto 2.2 não fazia parte do lançamento de julho de 2025.

ThinkSound nesta família de ferramentas

  • Artigo: Raciocínio em cadeia de pensamento em MLLM para geração e edição de áudio (arXiv:2506.21448, NeurIPS 2025).
  • Três etapas: folha de vídeo, refinação centrada em objeto (clique/região), edição guiada por linguagem.
  • Espécie vertebral: MM-DiT com VideoLLaMA 2 CoT; pesos em Hugging Face FunAudioLLM/ThinkSound.

Muxo prático

Manter a frequência de quadros e duração de Wan clip. Gerar áudio em um comprimento correspondente, em seguida, ffmpeg -c:v copy -c:a aac. Se você precisar de fala sincronizada de lábios, ir para S2V em vez de V2A V2A não reconstruirá uma boca específica de um ator a partir de uma onda que você já tem.

Perguntas frequentes

Pode TI2V-5B emitir AAC?
Não. Decode é quadros de vídeo. Qualquer trilha sonora é um segundo modelo ou um Wan API fechado posteriormente.
O PrismAudio é o mesmo?
PrismAudio é uma linha de acompanhamento V2A (CoT-RL) dos autores do ThinkSound.

Fontes primárias

Verificado com o README do Wan-Video/Wan2.2 · 28 de agosto de 2026

© 2026 wan2.video