Diffusion Transformer

Wans 생성기는 압축된 비디오 잠자리에 대한 디프루전 트랜스포머이며, U-넷이 아닌 흐름 일치에 훈련되어 있습니다. 토큰은 공간 시간 패치입니다. 텍스트는 UMT5 간접주의를 통해 도착합니다. 시간 단계는 AdaLN를 모듈화합니다.

DiTflow matchingUMT5
이 페이지의 목차 5
DiT 비디오 스택: 소음성 잠복, 패치화, 트랜스포머 블록, 패치 해제, 속도
Wan2.2 DiT 루프. 염기 길이는 프레임 × 공간 패치, 그래서 VAE 압축이 VRAM를 지배합니다.

왜 U-Net 대신 DiT

클래식 이미지 전파는 convolutional U-Nets를 사용하였다. DiT (Peebles & Xie) 는 패치된 잠복판에 있는 트랜스포머 블록으로 척추를 대체한다. 비디오는 시간으로 패치 그리드를 확장한다. Wan는 그 선을 따르고 있다 (많은 20242025 비디오 모델과 공유된다) 따라서 주의는 장거리 동작과 카메라 동작을 모델링할 수 있다.

플로우 매칭, 에프실론 예측만 하는 것이 아닙니다.

공식 코드는 흐름 일치 / 수정된 흐름 스타일 솔루터를 사용합니다. 네트워크는 단지 ε보다는 소음에서 데이터로 속도 필드를 예측합니다. README (그리고 ComfyUI 템플릿) 에서 샘플링 단계의 계산은 스케줄러 가족이라고 가정합니다.

기질

  • 텍스트: UMT5-XXL 임베디션, 각 블록에서 가로 주의
  • 이미지 (I2V/FLF2V): CLIP-비전 + VAE 토큰, 추가 MLP 프로젝트 (FLF2V는 Wan2.1에 257×2 토큰의 첫 번째 / 마지막 위치 임베디션을 추가합니다).
  • 오디오 (S2V): 특화된 주입 경로를 (공식 S2V 음향상)
  • 시간 단계 / SNR: AdaLN; A14B에서는 어떤 전문가가 실시간으로 활동하는지 또한 선택합니다.

자주 묻는 질문

Wan는 자기퇴진 비디오 LLM입니까?
아니, 그것은 잠잠한 그리드에서 반복적인 지명입니다. 토큰 시간은 왼쪽에서 오른쪽으로 단어가 아닌 전파 시간입니다.
U-Net은 어디 있어요?
안 들어 Wan2.2만약 ComfyUI 그래프는 UNetLoader를 보여줍니다, 그것은 로더의 이름입니다 DiT 블록

1차 출처

Wan-Video/Wan2.2 README 기준 확인 · 2026년 8월 28일

© 2026 wan2.video