رسمية generate.py
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wavpython generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"طابق رسمي واحد GPU هو 80 GB. إضافيات إضافية: --pose_video للغناء / التمثيل القائم على الوضع ؛ --num_clip لمشاهدة مسبقة قصيرة. قم بتثبيت requirements_s2v.txt إذا كنت تستخدم CosyVoice. الحجم هو ميزانية مساحة ؛ يتبع الجانب الصورة.
المقارنات المنشورة (صفحة المشروع)
تقرير الصفحة Wan-S2V FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 أفضل من بين خطوط أساسية المحادثة المدرجة على تلك المقاييس مع التنافسية Sync-C / EFID. تعامل الجدول باعتباره قياس المؤلفين، وليس قائمة قياسية عالمية.
أسئلة شائعة
- هل S2V صوتي فيديو محلي؟
- لا. تقوم بتزويد (أو CosyVoice-التخليص) الصوت. النموذج يحفز الصورة إلى ذلك المسار. AV المشترك الأصلي هو Wan 2.5+ APIs.
- Diffusers?
- S2V يتم سردها كمتكاملة في Wan2.2 todo (التأثير، ComfyUI، Diffusers). تفضل العلامات الرسمية README إذا كانت مغلفة تتأخر.
المصادر الأولية
تمت المراجعة وفق README لمشروع Wan-Video/Wan2.2 · 28 أغسطس 2026