01
اختر صورة ثابتة
الوجه أو الشخصية الواضحة أفضل. الصور والرسوم والأنمي والحيوانات كلها صالحة.
تجربة عامة مجانية
ارفع صورة ومسار صوت. يحوّلهما Wan 2.2 S2V إلى فيديو كلام أو غناء أو أداء — الشفتان والتعبير والجسد.
أداة مباشرة
صورة + صوت داخلًا، وMP4 خارجًا. الاستوديو يخاطب مساحة Hugging Face الرسمية من Wan-AI دون مفتاح DashScope الخاص بك.
جارٍ تحميل المساحة الرسمية. قد تحتاج التجارب النائمة دقيقة للاستيقاظ.
ما هو
يأخذ Wan 2.2 Speech to Video صورة ثابتة ومقطع صوت ثم يولد فيديو يتكلم فيه الشخص أو يغني أو يؤدي. إنه متغير S2V في عائلة Wan 2.2 للصور الناطقة والشخصيات المغنية والشخصيات الرقمية المدفوعة بالصوت.
بخلاف أداة تحرك الفم فقط، يستخدم S2V الصوت لأداء أوسع: الشفتان والتعبير والرأس وكثيرًا الجزء العلوي من الجسد. من يبحث عن صورة ناطقة أو صورة تغني أو صوت إلى فيديو أو مزامنة شفاه بالذكاء الاصطناعي يصف عادة هذه المهمة.
تكفي لهذه التجربة صورة وصوت ودقة.
01
الوجه أو الشخصية الواضحة أفضل. الصور والرسوم والأنمي والحيوانات كلها صالحة.
02
طول الفيديو يتبع الصوت. الصوت النظيف يعطي حركة شفاه أوضح من المقاطع الضاجة.
03
480P أسرع للتجربة. 720P أحدّ لكن الطابور العام أبطأ.
يغطي مسار الصورة + الصوت نفسه الصور الناطقة والغناء وأغاني الأنمي والحيوانات المتكلمة.
أعطِ البورتريه جملة. مفيد للشروح والتحيات والشخصيات الناطقة.
اربط وجهًا بغناء. يعامل النموذج الغناء كأداء لا كفم ملصق.
يمكن لشخصيات مرسومة أو أنمي أن تزامن وتتحرك مع أغنية إذا كان الرسم واضحًا.
صورة حيوان أليف مع مقطع صوتي قصير استخدام مرح شائع — اجعل الحيوان كبيرًا في الإطار.
إذا كنت تحتاج فقط أن يتبع الفم نصًا على فيديو موجود، فقد يكفي محرر مزامنة شفاه. ينشئ S2V الفيديو من صورة ثابتة وصوت.
| الميزة | Wan 2.2 S2V | مزامنة شفاه تقليدية |
|---|---|---|
| الحركة | أداء الوجه والتعبير والجسد مدفوع بالصوت | أشكال الفم غالبًا على مقطع موجود |
| المدخلات | صورة ثابتة + صوت | فيديو موجود + صوت |
| الأساليب | كلام وغناء وأداء | كلام في العادة فقط |
| الأنسب لـ | صور ناطقة وشخصيات مغنية وصوت إلى فيديو | استبدال الحوار في لقطات لديك أصلًا |
لا تقبل هذه التجربة العامة موجه نص. الصورة والصوت يخرجان المشهد. قد تضيف واجهات رسمية لاحقًا أسلوبًا أو موجهًا؛ هذه الاقترانات مفيدة الآن.
تستخدم هذه الصفحة مساحة Hugging Face العامة الرسمية من Wan-AI، فيمكن للزوار تجربة صورة + صوت دون مفتاح API. إنها خلفية تجربة مجانية وليست حصة إنتاج مضمونة.
لا. تسعيرة منطقة بكين الحالية لـ wan2.2-s2v لا تدرج حصة مجانية. لا تخطط وفق ملاحظة «100 ثانية مجانية» القديمة.
ليس لهذه التجربة. يوفّر مشغّل المساحة الخلفية. الاستضافة الذاتية لأوزان 14B برخصة Apache 2.0 مسار آخر ويحتاج رسميًا وحدة رسوميات كبيرة جدًا.
قد تنام المساحات العامة أو تُحدّ أو تتوقف. جرّب 480P أو صوتًا أقصر أو تبويب المساحة الرسمية أو استوديو ModelScope.
مرتبط لكن أوسع. مزامنة الشفاه تعدّل الفم غالبًا على فيديو موجود. يولد S2V فيديو كلام أو غناء جديدًا من صورة ثابتة وصوت.
ليس كواجهة إنتاج مستقرة. بعد تأكيد الطلب استخدم مزودًا مدفوعًا. هذه الصفحة لتجربة الميزة.