OmniVoice · k2-fsa

मुफ़्त OmniVoice टेक्स्ट-टू-स्पीच और वॉइस क्लोनिंग

k2-fsa के OmniVoice से टेक्स्ट को आवाज़ में बदलें। 646 भाषाओं में ज़ीरो-शॉट वॉइस क्लोनिंग और वॉइस डिज़ाइन के लिए आधिकारिक डेमो आज़माएँ।

टूल इस्तेमाल करें

OmniVoice
k2-fsa/OmniVoice

डेमो लोड हो रहा है…

सार्वजनिक ZeroGPU डेमो में साझा GPU कोटा और कतार होती है। Hugging Face लॉगिन या बाद में प्रयास करने को कह सकता है। Wan2.Video इस पेज तक पहुँचने का शुल्क नहीं लेता।

कैसे इस्तेमाल करें

Voice Clone

Voice Clone में टेक्स्ट डालें और 3–10 सेकंड की साफ़ संदर्भ रिकॉर्डिंग अपलोड या रिकॉर्ड करें। उपलब्ध हो तो उसका प्रतिलेख जोड़ें, फिर 24 kHz ऑडियो बनाएँ और डाउनलोड करें।

Voice Design

Voice Design में संदर्भ रिकॉर्डिंग के बिना आवाज़ बनाएँ। लिंग, उम्र, सुर, लहजा या बोली और फुसफुसाहट जैसे गुण मिलाएँ। चीनी और अंग्रेज़ी में परिणाम अधिक स्थिर हैं।

परिणाम सेट करें

गैर-भाषिक ध्वनियों के लिए [laughter] या [sigh] जोड़ें। चीनी उच्चारण को स्वर-संख्या वाले पिनयिन और अंग्रेज़ी को वर्ग कोष्ठकों में CMU ध्वनिमों से सुधारें।

मॉडल में लगभग 0.6B पैरामीटर हैं। टीम न्यूनतम RTF 0.025 (रीयल टाइम से लगभग 40 गुना तेज़) बताती है; सार्वजनिक डेमो की गति कतार और हार्डवेयर पर भी निर्भर है।

आम सवाल

क्या डेमो मुफ़्त है?

सार्वजनिक ZeroGPU डेमो में साझा GPU कोटा और कतार होती है। Hugging Face लॉगिन या बाद में प्रयास करने को कह सकता है। Wan2.Video इस पेज तक पहुँचने का शुल्क नहीं लेता।

मेरी फ़ाइलें कहाँ प्रोसेस होती हैं?

चुना गया Space आपके इनपुट लेता है; उसका संचालक प्रोसेसिंग और फ़ाइलों को रखने की व्यवस्था तय करता है। गाइड अनुवादित है, लेकिन डेमो की भाषाएँ उसके संचालक पर निर्भर हैं।

डेमो लोड न हो तो क्या करें?

वर्कस्पेस फिर लोड करें या उपलब्ध वैकल्पिक सर्वर चुनें। GPU कोटा ख़त्म हो गया हो तो बहाल होने का इंतज़ार करें या संबंधित टूल आज़माएँ।

आधिकारिक संसाधन