네이티브 오디오·비디오

네이티브 오디오 비디오는 샘플러 한 명이 이미지 및 동기화된 사운드트랙 (말, 효과, 음악) 을 발송한다는 것을 의미합니다. 이 기능은 Wan 2.5 및 후기의 제품 APIs에서 광고됩니다. 그것은 Wan2.2-T2V/I2V 오픈 웨이트의 속성 아닙니다.

Wan 2.5API-onlysync
이 페이지의 목차 5
Wan2.2 오픈 비어린 비디오와 Wan 2.5+ 네이티브 오디오 비디오 APIs
제품 라인 및 체크포인트가 열려 있는 경우 별도의 상자에 보관하십시오.

2.2 개방형 모델이 어떤 것을 배출하는지

  • T2V-A14B / I2V-A14B / TI2V-5B 침묵 비디오
  • S2V-14B 당신은 오디오를 가져오며 모델은 애니메이션을 만들어냅니다.
  • Animate-14B 운동 전송; 오디오 생성되지 않습니다.

2.5+ 제품들이 추가하는 것

퍼블릭 2.5 글쓰기 (fal, DashScope 스타일 APIs, 집합자) 는 대화, 분위기, 음악, 1080P의 공동 생성과 2.2 ~ 5s 레시피보다 긴 클립을 설명합니다. 나중에 2.6/2.7/3.0는 네이티브 AV를 유지하고 멀티샷 또는 참조 컨트롤을 추가합니다. 그 중 어느 것도 Wan2.2-style GitHub 체크포인트로 출판되지 않습니다.

개방형 대용품

Apache 2.0 / 퍼블릭 웨이트에서 유지하려면: 조용한 Wan2.2 비디오를 생성하고, 후 폴리용 ThinkSound (또는 다른 V2A) 를 사용하거나, 말하기 헤드용 CosyVoice를 사용하는 S2V를 드라이브하십시오. 이것은 네이티브 AV가 아닌 두 (또는 세) 모델입니다.

자주 묻는 질문

2.2 GGUF는 마법으로 오디오를 추가할 수 있을까요?
양자화로 무게의 d형이 변하고 출력 방식이 변하지 않습니다.
S2V가 AV가 원산으로 계산되는가?
네이티브 AV는 소리를 합성합니다. S2V는 소리를 소비합니다.

1차 출처

Wan-Video/Wan2.2 README 기준 확인 · 2026년 8월 28일

© 2026 wan2.video