आधिकारिक generate.py
python generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --prompt "Summer beach vacation style, a white cat wearing sunglasses sits on a surfboard." --image examples/i2v_input.JPG --audio examples/talk.wavpython generate.py --task s2v-14B --size 1024*704 --ckpt_dir ./Wan2.2-S2V-14B/ --offload_model True --convert_model_dtype --image examples/i2v_input.JPG --enable_tts --tts_prompt_audio examples/zero_shot_prompt.wav --tts_prompt_text "…" --tts_text "…"एकल-GPU आधिकारिक मंजिल 80 GB है। अतिरिक्त अतिरिक्तः --pose_video मुद्रा-चालित गायन / अभिनय के लिए; --num_clip एक छोटे से पूर्वावलोकन के लिए। requirements_s2v.txt स्थापित करें यदि आप CosyVoice का उपयोग करते हैं। आकार एक क्षेत्र बजट है; पहलू छवि का अनुसरण करता है।
प्रकाशित तुलनाएँ (परियोजना पृष्ठ)
Wan-S2V पृष्ठ में FID 15.66, SSIM 0.734, PSNR 20.49, CSIM 0.677 सबसे अच्छा है, जो उन मेट्रिक्स पर सूचीबद्ध बोलने वाले आधार रेखाओं में से एक है प्रतिस्पर्धी Sync-C / EFID के साथ। तालिका को लेखक के रूप में मानें माप, एक सार्वभौमिक रैंकिंग बोर्ड नहीं।
अक्सर पूछे जाने वाले प्रश्न
- S2V मूल ऑडियो-वीडियो है?
- नहीं. आप ऑडियो की आपूर्ति (या CosyVoice-संश्लेषण) करते हैं। मॉडल उस ट्रैक में छवि को एनीमेट करता है। मूल संयुक्त AV Wan 2.5+ APIs है।
- Diffusers?
- S2V को Wan2.2 todo (निर्णय, ComfyUI, Diffusers) में एकीकृत के रूप में सूचीबद्ध किया गया है। यदि एक रैपर लेग हो तो आधिकारिक README ध्वज पसंद करें।
प्राथमिक स्रोत
Wan-Video/Wan2.2 README से सत्यापित · 28 अगस्त 2026