01
एक स्थिर इमेज चुनें
साफ़ चेहरा या किरदार सबसे अच्छा चलता है। फ़ोटो, इलस्ट्रेशन, एनीमे और पालतू सब चल सकते हैं।
मुफ़्त सार्वजनिक डेमो
एक फ़ोटो और आवाज़ अपलोड करें। Wan 2.2 S2V उन्हें बोलते, गाते या परफ़ॉर्म करते वीडियो में बदलता है — होंठ, भाव और शरीर सहित।
लाइव टूल
इमेज + ऑडियो अंदर, MP4 बाहर। स्टूडियो आधिकारिक Wan-AI Hugging Face Space से बात करता है, आपकी DashScope Key के बिना।
आधिकारिक Space लोड हो रहा है। सोए हुए डेमो को जगने में एक मिनट लग सकता है।
यह क्या है
Wan 2.2 Speech to Video एक स्थिर इमेज और ऑडियो लेता है, फिर एक वीडियो बनाता है जिसमें विषय बोलता, गाता या परफ़ॉर्म करता है। यह Wan 2.2 परिवार का S2V वैरिएंट है — टॉकिंग फ़ोटो, गाने वाले किरदार और ऑडियो-चालित अवतार के लिए।
केवल मुँह चलाने वाले टूल के विपरीत, S2V ऑडियो से पूरा परफ़ॉर्मेंस चलाता है: होंठ, भाव, सिर और अक्सर ऊपरी शरीर। टॉकिंग फ़ोटो, सिंगिंग फ़ोटो, ऑडियो टू वीडियो, AI लिप सिंक या टॉकिंग अवतार खोजने वाले आमतौर पर यही काम चाहते हैं।
इस डेमो के लिए इमेज, ऑडियो और रिज़ॉल्यूशन काफ़ी हैं।
01
साफ़ चेहरा या किरदार सबसे अच्छा चलता है। फ़ोटो, इलस्ट्रेशन, एनीमे और पालतू सब चल सकते हैं।
02
वीडियो की लंबाई ऑडियो के साथ चलती है। साफ़ आवाज़ शोरभरे ट्रैक से बेहतर होंठ गति देती है।
03
फ़ीचर आज़माने के लिए 480P तेज़ है। 720P तेज़ दिखता है, लेकिन पब्लिक कतार धीमी होती है।
इसी इमेज + ऑडियो पाइपलाइन से टॉकिंग फ़ोटो, गायकी, एनीमे कवर और बोलते पालतू बनते हैं।
पोर्ट्रेट को एक लाइन बोलने दें। समझाने, अभिवादन और अवतार के लिए उपयोगी।
चेहरे के साथ वोकल जोड़ें। मॉडल गाने को परफ़ॉर्मेंस मानता है, चिपकाया मुँह नहीं।
अगर ड्रॉइंग साफ़ हो, तो इलस्ट्रेटेड या एनीमे किरदार गाने के साथ चल और लिप-सिंक कर सकते हैं।
पालतू फ़ोटो और छोटा वॉइस क्लिप एक आम मज़ेदार उपयोग है — जानवर को फ़्रेम में बड़ा रखें।
अगर मौजूदा वीडियो पर मुँह को स्क्रिप्ट के साथ चलाना भर है, तो लिप-सिंक एडिटर काफ़ी हो सकता है। S2V स्थिर इमेज और ऑडियो से नया वीडियो बनाता है।
| फ़ीचर | Wan 2.2 S2V | आम लिप सिंक |
|---|---|---|
| गति | ऑडियो से चेहरा, भाव और शरीर का परफ़ॉर्मेंस | मौजूदा क्लिप पर ज़्यादातर मुँह के आकार |
| इनपुट | स्थिर इमेज + ऑडियो | मौजूदा वीडियो + ऑडियो |
| स्टाइल | बोलचाल, गाना और परफ़ॉर्मेंस | आमतौर पर केवल भाषण |
| सबसे अच्छा | टॉकिंग फ़ोटो, गाने वाले किरदार, ऑडियो टू वीडियो | पहले से मौजूद फ़ुटेज पर डायलॉग बदलना |
इस पब्लिक डेमो में टेक्स्ट प्रॉम्प्ट नहीं है। इमेज और ऑडियो निर्देशन करते हैं। आधिकारिक API बाद में style या prompt जोड़ सकते हैं; ये जोड़ियाँ अभी मदद करती हैं।
यह पेज आधिकारिक Wan-AI पब्लिक Hugging Face Space का उपयोग करता है, इसलिए विज़िटर बिना API Key के इमेज + ऑडियो आज़मा सकते हैं। यह मुफ़्त डेमो बैकएंड है, गारंटीड प्रोडक्शन कोटा नहीं।
नहीं। बीजिंग रीजन के मौजूदा wan2.2-s2v मूल्य में मुफ़्त कोटा नहीं है। पुरानी «100 सेकंड मुफ़्त» नोट से योजना न बनाएँ।
इस डेमो के लिए नहीं। बैकएंड Space संचालक देता है। 14B Apache 2.0 वेट स्वयं होस्ट करना दूसरा रास्ता है और आधिकारिक रूप से बहुत बड़ी GPU माँगता है।
पब्लिक Space सो सकते हैं, रेट-लिमिट या रुक सकते हैं। 480P, छोटा ऑडियो, आधिकारिक Space टैब या ModelScope स्टूडियो आज़माएँ।
संबंधित, लेकिन व्यापक। लिप सिंक अक्सर मौजूदा वीडियो पर मुँह संपादित करता है। S2V स्थिर इमेज और ऑडियो से नया बोलता/गाता वीडियो बनाता है।
स्थिर प्रोडक्शन API के रूप में नहीं। असली ट्रैफ़िक के बाद माँग पुष्टि करके पेड प्रोवाइडर इस्तेमाल करें। यह पेज फ़ीचर आज़माने के लिए है।