Diffusion Transformer

إن مولد Wans هو محول انتشار على أشرطة فيديو مضغوطة ، مدربة بتطابق التدفق وليس شبكة U. الوهم هي مساحات وقت؛ يصل النص عبر UMT5 الانتباه المتقاطع. يقوم خطوة الوقت بتحكم AdaLN.

DiTflow matchingUMT5
محتويات الصفحة 5
DiT كومة فيديو: ضجيج متخفي، صبغ، كتلة محول، إزالة الصبغ، سرعة
Wan2.2 DiT حلقة. طول التسلسل هي الإطارات × المزققات الفضائية، وهذا هو السبب في VAE الضغط يهيمن على VRAM.

لماذا DiT بدلا من U-Net

تمتلك التوزيع الكلاسيكي للصورة شبكات U-Nets الملتوية. DiT (بيبلز و Xie) يستبدل العمود الفقري بكتلات محولة على اللاتنتات المصغرة. يمتد الفيديو شبكة اللاتنت في الوقت. Wan يتبع هذا الخط (مشترك مع العديد من نماذج الفيديو 20242025) حتى يتمكن الاهتمام من نموذج الحركة على المدى الطويل وحركات الكاميرا.

مطابقة التدفق، ليس فقط التنبؤ بالإيبسيلون

يستخدم الرمز الرسمي حلول نمط التدفق المماثل / المصلح (UniPC ، Flow DPM). تتوقع الشبكة حقل السرعة من الضوضاء إلى البيانات بدلاً من ε فقط. تعتبر خطوة العينة في قالب README (و ComfyUI) أن عائلة المخططين.

التكييف

  • النص: UMT5-XXL التوابل، الاهتمام المتقاطع في كل كتلة.
  • الصورة (I2V/FLF2V): CLIP-vision + VAE tokens، مشروع MLP إضافي (FLF2V يضيف أول / آخر إدراج موضعي من رموز 257×2 في Wan2.1).
  • الصوت (S2V): مسار حقن مخصص (انظر المادة الرسمية S2V رقم الصوت)
  • خطوة زمنية / SNR: AdaLN؛ في A14B هذا أيضا يختار أي خبير على الهواء.

أسئلة شائعة

هل Wan ماجستير فيديو autoregressive LLM؟
لا، إنه مؤشر متكرر على شبكة متخفية. وقت الوهم هو وقت الانتشار، وليس كلمات من اليسار إلى اليمين.
أين شبكة "أو-نيت"؟
لا يوجد واحد في Wan2.2. إذا كان الرسم البياني ComfyUI يظهر UNetLoader، وهذا هو اسم محمول الوزن لا يزال DiT كتلة.

المصادر الأولية

تمت المراجعة وفق README لمشروع Wan-Video/Wan2.2 · 28 أغسطس 2026

© 2026 wan2.video