ما الذي تنتج عنه النماذج المفتوحة 2.2
- T2V-A14B / I2V-A14B / TI2V-5B الفيديو الصامت.
- S2V-14B أنت تحضر الصوت؛ النموذج تحريك.
- Animate-14B نقل الحركة؛ لا يتم إنتاج الصوت.
ما يضيفه منتجات 2.5+
تصف المشاريع العامة 2.5 (fal، DashScope-style APIs، aggregators) التوليد المشترك للحوار والجو والموسيقى، 1080P، والقطات أطول من وصفات 2.2 ~ 5 ثانية. لاحقا 2.6/2.7/3.0 الحفاظ على AV الأصلية وإضافة متعددة الصور أو التحكم المرجعي. لا يتم نشر أي من هذه كـ Wan2.2-style GitHub نقاط التفتيش.
البديلات المفتوحة الوزن
للبقاء على أباتشي 2.0 / الوزن العام: إنتاج صوت صامت Wan2.2 فيديو، ثم ThinkSound (أو V2A آخر) للفوليو؛ أو تشغيل S2V مع CosyVoice للقبضات الحديثة. وهذا هو اثنين (أو ثلاثة) من النماذج، وليس AV الأصلية.
أسئلة شائعة
- هل إضافة الصوت إلى 2.2 GGUF سحرية؟
- لا، تغير الكمية الوزن dtype، وليس طريقة الخروج.
- هل تعتبر S2V AV الأصلية؟
- لا، الفيديو الأصلي يجمع الصوت S2V يستهلك الصوت.
المصادر الأولية
تمت المراجعة وفق README لمشروع Wan-Video/Wan2.2 · 28 أغسطس 2026