왜 이 모델이 다른가?
T2V/I2V DTs는 RGB (또는 VAE) 잠자리를 말함에 훈련받습니다. V2A 모델은 비디오 기능 (CLIP/시크) 과 캡션, 그리고 종종 사상의 연쇄에 조건화된 오디오 잠자리를 말함. 이러한 헤드를 하나의 2.2 오픈 ckpt로 혼합하는 것은 2025년 7월 출시의 일부였습니다.
이 도구 가족에서 ThinkSound
- 논문: 오디오 생성 및 편집을 위한 MLLM에서 사상의 연쇄 추론 (arXiv:2506.21448, NeurIPS 2025).
- 세 단계: 비디오에서 필리, 객체 중심의 정제 (클릭/지역), 언어 가이드 편집.
- 척추: VideoLLaMA 2 CoT와 MM-DiT; FunAudioLLM/ThinkSound에서 무게 Hugging Face
실용적인
Wan clips 프레임 속도와 기간을 유지하십시오. 오디오를 일치하는 길이로 생성하고 ffmpeg -c:v 복사 -c:a aac. 입술 동기화 음성이 필요한 경우 S2V로 이동하면 V2A V2A 대신 이미 가지고있는 파동에서 특정 배우의 입을 재구성하지 않습니다.
자주 묻는 질문
- TI2V-5B AAC를 출력할 수 있나요?
- 음색은 두 번째 모델 또는 나중에 닫힌 Wan API입니다.
- 프리스마오디오도 똑같아?
- 프리즘아디오는 틴크사운드 저자들의 V2A 라인 (CoT-RL) 을 추적합니다. 동일한 문제 가족, 다른 체크포인트입니다.
1차 출처
Wan-Video/Wan2.2 README 기준 확인 · 2026년 8월 28일