توليد الصوت والفيديو معًا

الفيديو الصوتي الأصلي يعني أن جهاز عينات واحد ينبعث صورة وموسيقى صوتية متزامنة (الحديث والأثر والموسيقى). يتم الإعلان عن هذه القدرة على Wan 2.5 ومرجعية المنتج APIs. ليست خاصية للوزن المفتوح Wan2.2-T2V / I2V.

Wan 2.5API-onlysync
محتويات الصفحة 5
Wan2.2 الفيديو الصامت المفتوح مقابل Wan 2.5+ صوتي فيديو محلي APIs
حافظ على خط المنتجات ومواقع التفتيش مفتوحة في صناديق منفصلة.

ما الذي تنتج عنه النماذج المفتوحة 2.2

  • T2V-A14B / I2V-A14B / TI2V-5B الفيديو الصامت.
  • S2V-14B أنت تحضر الصوت؛ النموذج تحريك.
  • Animate-14B نقل الحركة؛ لا يتم إنتاج الصوت.

ما يضيفه منتجات 2.5+

تصف المشاريع العامة 2.5 (fal، DashScope-style APIs، aggregators) التوليد المشترك للحوار والجو والموسيقى، 1080P، والقطات أطول من وصفات 2.2 ~ 5 ثانية. لاحقا 2.6/2.7/3.0 الحفاظ على AV الأصلية وإضافة متعددة الصور أو التحكم المرجعي. لا يتم نشر أي من هذه كـ Wan2.2-style GitHub نقاط التفتيش.

البديلات المفتوحة الوزن

للبقاء على أباتشي 2.0 / الوزن العام: إنتاج صوت صامت Wan2.2 فيديو، ثم ThinkSound (أو V2A آخر) للفوليو؛ أو تشغيل S2V مع CosyVoice للقبضات الحديثة. وهذا هو اثنين (أو ثلاثة) من النماذج، وليس AV الأصلية.

أسئلة شائعة

هل إضافة الصوت إلى 2.2 GGUF سحرية؟
لا، تغير الكمية الوزن dtype، وليس طريقة الخروج.
هل تعتبر S2V AV الأصلية؟
لا، الفيديو الأصلي يجمع الصوت S2V يستهلك الصوت.

المصادر الأولية

تمت المراجعة وفق README لمشروع Wan-Video/Wan2.2 · 28 أغسطس 2026

© 2026 wan2.video