X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
X-Voice एक हल्का 0.4B बहुभाषी ज़ीरो-शॉट वॉयस क्लोनिंग मॉडल है जिसे एक नवीन दो-चरणीय प्रतिमान और वास्तुशिल्प संवर्द्धनों का उपयोग करके 420K-घंटे के कॉर्पस पर प्रशिक्षित किया गया है ताकि ऑडियो प्रॉम्प्ट के लिए ट्रांसक्रिप्ट की आवश्यकता के बिना 30 भाषाओं में उच्च-गुणवत्ता वाले स्पीच सिंथेसिस को सक्षम बनाया जा सके, जो बिलियन-स्केल मॉडलों के तुलनीय प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप 30 अलग-अलग भाषाएं बोलना सीखना चाहते हैं, लेकिन आपके पास न तो कोई शिक्षक है, न कोई पाठ्यपुस्तक, और न ही कोई स्क्रिप्ट। आपके पास बस अपने एक दोस्त की आवाज़ की एक छोटी सी रिकॉर्डिंग है। X-Voice एक नया AI मॉडल है जो इसे संभव बनाता है। यह एक "वॉयस कैमेलियन" (आवाज़ बदलने वाला जीव) है जो आपकी दोस्त की आवाज़ ले सकता है और उसे 30 अलग-अलग भाषाएं बोलने के लिए तैयार कर सकता है, भले ही आपके दोस्त ने पहले कभी वे भाषाएं न बोली हों।
यहाँ बताया गया है कि यह शोध पत्र X-Voice को सरल अवधारणाओं में कैसे समझाता है:
1. समस्या: "स्क्रिप्ट" की बाधा
आज के अधिकांश वॉयस-क्लोनिंग AI एक सख्त अभिनेता की तरह हैं जिसे एक स्क्रिप्ट की आवश्यकता होती है। किसी आवाज़ को क्लोन करने के लिए, आपको आमतौर पर दो चीजों की आवश्यकता होती है:
- उस व्यक्ति की एक छोटी ऑडियो क्लिप।
- एक ट्रांसक्रिप्ट (एक लिखित पाठ) कि उन्होंने उस क्लिप में वास्तव में क्या कहा था।
यह अंग्रेजी या चीनी जैसी भाषाओं के लिए बहुत अच्छा काम करता है, जहाँ लिखित ट्रांसक्रिप्ट प्राप्त करना आसान है। लेकिन कई अन्य भाषाओं (विशेष रूप से दुर्लभ या बोलियों) के लिए, सटीक ट्रांसक्रिप्ट प्राप्त करना कठिन या असंभव है। यदि आपके पास स्क्रिप्ट नहीं है, तो AI भ्रमित हो जाता है और आवाज़ को ठीक से क्लोन नहीं कर पाता है।
2. समाधान: दो-चरणीय प्रशिक्षण शिविर
शोधकर्ताओं ने एक चतुर "दो-चरणीय" प्रशिक्षण पद्धति का उपयोग करके X-Voice बनाया है, जैसे एक मास्टर शेफ अपने प्रशिक्षु को प्रशिक्षित करता है।
चरण 1: मास्टर शेफ (X-Voice1)
सबसे पहले, उन्होंने 30 अलग-अलग भाषाओं की 420,000 घंटों की स्पीच पर एक विशाल मॉडल को प्रशिक्षित किया। इसे एक "मास्टर शेफ" के रूप में सोचें जो दुनिया की हर रेसिपी और स्वाद को जानता है। यह मॉडल बोलने में बहुत अच्छा है, लेकिन इसे यह जानने के लिए कि क्या बोलना है, अभी भी एक स्क्रिप्ट की आवश्यकता होती है।चरण 2: प्रशिक्षु (X-Voice2)
यहाँ असली जादू है। शोधकर्ताओं ने "मास्टर शेफ" का उपयोग करके 10,000 घंटों की नई ऑडियो जनरेट की। उन्होंने एक वास्तविक वॉयस क्लिप ली, उसे मास्टर शेफ को दिया, और उससे एक अलग टेक्स्ट बोलने के लिए कहा।
अब, उन्होंने इन नई ऑडियो क्लिप्स को लिया और मॉडल को एक नया सबक सिखाया: "स्क्रिप्ट को अनदेखा करो। बस आवाज़ को सुनो।" उन्होंने मॉडल को केवल ऑडियो का उपयोग करके मूल आवाज़ को फिर से बनाने के लिए प्रशिक्षित किया, जिसमें टेक्स्ट को पूरी तरह से छिपा दिया गया था। इससे X-Voice2 बना, जो अंतिम मॉडल है जो बिना कभी ट्रांसक्रिप्ट पढ़े आवाज़ को क्लोन कर सकता है।
3. गुप्त नुस्खा: "डुअल-लेवल" लैंग्वेज इंजेक्शन
जब आप किसी AI से किसी नई भाषा में किसी पुरानी आवाज़ का उपयोग करने के लिए कहते हैं, तो एक आम समस्या "एक्सेंट लीकेज" (लहजे का रिसाव) की होती है। उदाहरण के लिए, यदि आप एक फ्रांसीसी वक्ता को जापानी में "Hello" कहने के लिए कहते हैं, तो AI गलती से उसमें फ्रांसीसी लहजा दे सकता है।
इसे ठीक करने के लिए, शोधकर्ताओं ने एक Dual-Level Language Injection सिस्टम का आविष्कार किया। कल्पना कीजिए कि AI के पास भाषा को नियंत्रित करने के लिए दो अलग-अलग "डायल" (नॉब) हैं:
- द टेक्स्ट डायल (Text Dial): यह AI को बताता है कि कौन से शब्द बोलने हैं।
- द टाइम डायल (Time Dial): यह AI को बताता है कि उन्हें कब बोलना है और उनकी लय (रिदम) क्या होनी चाहिए।
इन दोनों डायल को एक साथ घुमाकर, AI आवाज़ (व्यक्ति की अनूठी ध्वनि) और लहजे (भाषा की लय) को पूरी तरह से अलग कर सकता है। यह सुनिश्चित करता है कि व्यक्ति अपनी आवाज़ में ही रहे, लेकिन नई भाषा को सही ढंग से बोले।
4. परिणाम: तेज़, मुफ्त और प्रवाहपूर्ण
पेपर का दावा है कि X-Voice एक "0.4B" मॉडल है, जिसका अर्थ है कि यह उन विशाल मॉडलों की तुलना में अपेक्षाकृत छोटा और हल्का है जिन्हें पूरे सर्वर रूम की आवश्यकता होती है।
- गति: क्योंकि यह धीमे, चरण-दर-चरण "ऑटोरिग्रेसिव" तरीके (जैसे एक बार में एक शब्द लिखना) का उपयोग नहीं करता है, इसलिए यह बहुत तेज़ी से स्पीच जनरेट कर सकता है।
- गुणवत्ता: परीक्षणों में, इसने बड़े वाणिज्यिक मॉडलों (जैसे Qwen3-TTS) के समान प्रदर्शन किया, जो इससे बहुत बड़े हैं, लेकिन बिना ट्रांसक्रिप्ट की आवश्यकता के।
- ओपन सोर्स: टीम ने अपना सारा डेटा (420k घंटों की ऑडियो) और कोड मुफ्त में जारी कर दिया है, ताकि कोई भी इसका उपयोग कर सके।
सारांश उपमा
X-Voice को आवाजों के लिए एक यूनिवर्सल ट्रांसलेटर के रूप में सोचें।
- पुराना AI: "मैं आपकी आवाज़ को तभी क्लोन कर सकता हूँ जब आप मुझे यह विशिष्ट वाक्य पढ़ें, और मेरे पास उस वाक्य का लिखित पाठ भी होना चाहिए।"
- X-Voice: "मैं आपकी आवाज़ को आपके गुनगुनाने की केवल 5 सेकंड की क्लिप से क्लोन कर सकता हूँ, और मैं आपको तुरंत 30 अलग-अलग भाषाएं बोलने के लिए तैयार कर सकता हूँ, बिना यह जाने कि आप क्या गुनगुना रहे थे।"
यह पेपर निष्कर्ष निकालता है कि यह तकनीक मल्टीलिंगुअल वॉयस क्लोनिंग की सबसे बड़ी बाधा को दूर करती है: लिखित ट्रांसक्रिप्ट की आवश्यकता। यह किसी भी व्यक्ति को किसी भी आवाज़ में कोई भी भाषा बोलने की अनुमति देता है, बशर्ते उनके पास एक छोटा ऑडियो सैंपल हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।