비디오 투 오디오

비디오-오디오 (V2A) 는 S2V의 반대의 경우: 침묵 (또는 점수가 미치지 않은) 그림, 사운드트랙. Wan2.2 T2V/I2V는 이것을하지 않습니다. 이 사이트의 오픈 동반자는 CoT 가이드 스트로밍 일치하는 Any2Audio 모델인 ThinkSound (FunAudioLLM) 이다.

ThinkSoundV2Afoley
이 페이지의 목차 5
스 사운드에 비명 비디오, 그리고 스 사운드 트랙
전형적인 2.2 작업 흐름: 침묵 Wan 프레임을 생성하고 V2A 모델을 실행하고 mux.

왜 이 모델이 다른가?

T2V/I2V DTs는 RGB (또는 VAE) 잠자리를 말함에 훈련받습니다. V2A 모델은 비디오 기능 (CLIP/시크) 과 캡션, 그리고 종종 사상의 연쇄에 조건화된 오디오 잠자리를 말함. 이러한 헤드를 하나의 2.2 오픈 ckpt로 혼합하는 것은 2025년 7월 출시의 일부였습니다.

이 도구 가족에서 ThinkSound

  • 논문: 오디오 생성 및 편집을 위한 MLLM에서 사상의 연쇄 추론 (arXiv:2506.21448, NeurIPS 2025).
  • 세 단계: 비디오에서 필리, 객체 중심의 정제 (클릭/지역), 언어 가이드 편집.
  • 척추: VideoLLaMA 2 CoT와 MM-DiT; FunAudioLLM/ThinkSound에서 무게 Hugging Face

실용적인

Wan clips 프레임 속도와 기간을 유지하십시오. 오디오를 일치하는 길이로 생성하고 ffmpeg -c:v 복사 -c:a aac. 입술 동기화 음성이 필요한 경우 S2V로 이동하면 V2A V2A 대신 이미 가지고있는 파동에서 특정 배우의 입을 재구성하지 않습니다.

자주 묻는 질문

TI2V-5B AAC를 출력할 수 있나요?
음색은 두 번째 모델 또는 나중에 닫힌 Wan API입니다.
프리스마오디오도 똑같아?
프리즘아디오는 틴크사운드 저자들의 V2A 라인 (CoT-RL) 을 추적합니다. 동일한 문제 가족, 다른 체크포인트입니다.

1차 출처

Wan-Video/Wan2.2 README 기준 확인 · 2026년 8월 28일

© 2026 wan2.video