Por que é um modelo diferente
T2V/I2V Os DiTs são treinados para denotar o RGB (ou VAE) latentes. V2A O modelo denota latentes de áudio condicionadas a recursos de vídeo (CLIPA mistura dessas cabeças em um ckpt aberto 2.2 não fazia parte do lançamento de julho de 2025.
ThinkSound nesta família de ferramentas
- Artigo: Raciocínio em cadeia de pensamento em MLLM para geração e edição de áudio (arXiv:2506.21448, NeurIPS 2025).
- Três etapas: folha de vídeo, refinação centrada em objeto (clique/região), edição guiada por linguagem.
- Espécie vertebral: MM-DiT com VideoLLaMA 2 CoT; pesos em Hugging Face FunAudioLLM/ThinkSound.
Muxo prático
Manter a frequência de quadros e duração de Wan clip. Gerar áudio em um comprimento correspondente, em seguida, ffmpeg -c:v copy -c:a aac. Se você precisar de fala sincronizada de lábios, ir para S2V em vez de V2A V2A não reconstruirá uma boca específica de um ator a partir de uma onda que você já tem.
Perguntas frequentes
- Pode TI2V-5B emitir AAC?
- Não. Decode é quadros de vídeo. Qualquer trilha sonora é um segundo modelo ou um Wan API fechado posteriormente.
- O PrismAudio é o mesmo?
- PrismAudio é uma linha de acompanhamento V2A (CoT-RL) dos autores do ThinkSound.
Fontes primárias
Verificado com o README do Wan-Video/Wan2.2 · 28 de agosto de 2026