왜 U-Net 대신 DiT
클래식 이미지 전파는 convolutional U-Nets를 사용하였다. DiT (Peebles & Xie) 는 패치된 잠복판에 있는 트랜스포머 블록으로 척추를 대체한다. 비디오는 시간으로 패치 그리드를 확장한다. Wan는 그 선을 따르고 있다 (많은 20242025 비디오 모델과 공유된다) 따라서 주의는 장거리 동작과 카메라 동작을 모델링할 수 있다.
플로우 매칭, 에프실론 예측만 하는 것이 아닙니다.
공식 코드는 흐름 일치 / 수정된 흐름 스타일 솔루터를 사용합니다. 네트워크는 단지 ε보다는 소음에서 데이터로 속도 필드를 예측합니다. README (그리고 ComfyUI 템플릿) 에서 샘플링 단계의 계산은 스케줄러 가족이라고 가정합니다.
기질
- 텍스트: UMT5-XXL 임베디션, 각 블록에서 가로 주의
- 이미지 (I2V/FLF2V): CLIP-비전 + VAE 토큰, 추가 MLP 프로젝트 (FLF2V는 Wan2.1에 257×2 토큰의 첫 번째 / 마지막 위치 임베디션을 추가합니다).
- 오디오 (S2V): 특화된 주입 경로를 (공식 S2V 음향상)
- 시간 단계 / SNR: AdaLN; A14B에서는 어떤 전문가가 실시간으로 활동하는지 또한 선택합니다.
자주 묻는 질문
- Wan는 자기퇴진 비디오 LLM입니까?
- 아니, 그것은 잠잠한 그리드에서 반복적인 지명입니다. 토큰 시간은 왼쪽에서 오른쪽으로 단어가 아닌 전파 시간입니다.
- U-Net은 어디 있어요?
- 안 들어 Wan2.2만약 ComfyUI 그래프는 UNetLoader를 보여줍니다, 그것은 로더의 이름입니다 DiT 블록
1차 출처
Wan-Video/Wan2.2 README 기준 확인 · 2026년 8월 28일

