OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models
OmniVoice एक अत्याधुनिक, विशाल बहुभाषी ज़ीरो-शॉट टेक्स्ट-टू-स्पीच मॉडल है जो एक नवीन डिफ्यूजन लैंग्वेज मॉडल-शैली के डिस्क्रीट नॉन-ऑटोरिग्रेसिव आर्किटेक्चर का उपयोग करके 60 टेक्स्ट से अधिक भाषाओं तक स्केल करता है ताकि सीधे टेक्स्ट को ध्वनिक टोकन (acoustic tokens) में मैप किया जा सके, जिससे एक पूर्ण-कोडबुक रैंडम मास्किंग रणनीति और प्री-ट्रेन्ड एलएलएम (LLM) इनिशियलाइज़ेशन के माध्यम से उत्कृष्ट स्पष्टता और व्यापक भाषा कवरेज प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक ऐसा सार्वभौमिक अनुवादक बनाना चाहते हैं जो न केवल टेक्स्ट का अनुवाद करे, बल्कि किसी भी स्थान के किसी भी व्यक्ति की आवाज़ में उसे बोल भी सके, और वह भी 600 से अधिक विभिन्न भाषाओं में। यही OmniVoice का लक्ष्य है, जो Xiaomi के शोधकर्ताओं द्वारा बनाया गया एक नया आर्टिफिशियल इंटेलिजेंस मॉडल है।
यहाँ इसकी कहानी दी गई है कि उन्होंने इसे कैसे बनाया, जिसे बिना किसी तकनीकी शब्दावली के समझाया गया है।
1. समस्या: "दो-चरणीय नृत्य" बहुत ही अव्यवस्थित था
OmniVoice से पहले, अधिकांश AI वॉयस जनरेटर दो धावकों वाली रिले रेस की तरह काम करते थे।
- धावक 1 (अनुवादक): टेक्स्ट लेता है और उसे एक रफ "सिमेंटिक" स्केच (जैसे कि वाक्य का अर्थ क्या है, उसका एक नक्शा) में बदल देता है।
- धावक 2 (गायक): उस स्केच को लेता है और उसे वास्तविक ध्वनि तरंगों (sound waves) में बदलने की कोशिश करता है।
दोष: यदि धावक 1 स्केच बनाने में एक छोटी सी भी गलती करता है, तो धावक 2 को खराब निर्देशों के साथ काम करना पड़ता है। अंतिम आवाज़ रोबोटिक लगती है, या लहजा अजीब हो जाता है। यह एक धुंधली फोटो के आधार पर मास्टरपीस पेंट करने की कोशिश करने जैसा है; बीच में ही विवरण खो जाते हैं।
2. समाधान: "डायरेक्ट आर्टिस्ट"
OmniVoice पूरी रिले रेस को ही छोड़ देता है। यह एक सिंगल-स्टेज आर्टिस्ट है।
एक गायक को स्केच पास करने के बजाय, OmniVoice टेक्स्ट और संदर्भ आवाज़ (reference voice) को देखता है, और सीधे ध्वनि तरंगों को पेंट करता है। यह "टेक्स्ट" "परफेक्ट वॉयस" की ओर एक ही सहज गति में जाता है।
3. इसने 600 भाषाएँ बोलना कैसे सीखा
AI को 600 भाषाएँ (जिनमें बहुत कम डेटा वाली कई दुर्लभ भाषाएँ भी शामिल हैं) सिखाने के लिए, शोधकर्ताओं को चतुर होना पड़ा।
- लाइब्रेरी: उन्होंने केवल एक लाइब्रेरी का उपयोग नहीं किया; उन्होंने 581,000 घंटों के ओपन-सोर्स ऑडियो का उपयोग करके एक विशाल लाइब्रेरी बनाई। यह सुनने में ऐसा है जैसे आप लगातार 66 वर्षों तक 24/7 ऑडियो सुन रहे हों!
- "फुल-कोडबुक" ट्रिक: कल्पना कीजिए कि आप 88 कुंजियों (keys) वाले पियानो को बजाना सीख रहे हैं। अधिकांश AI मॉडल एक समय में एक कुंजी को बार-बार दबाकर अभ्यास करते हैं। OmniVoice एक ऐसे पियानो वादक की तरह है जो अभ्यास के दौरान यादृच्छिक रूप से (randomly) एक साथ सभी 88 कुंजियों को दबाता है। यह अराजक, फुल-स्पीड अभ्यास इसे भाषा के "संगीत" को बहुत तेज़ी से और अधिक कुशलता से सीखने में मदद करता है।
- "स्मार्ट ब्रेन" की शुरुआत: आमतौर पर, एक नए AI को सिखाना एक बच्चे को शून्य से बोलना सिखाने जैसा होता है। OmniVoice ने एक प्री-ट्रेन्ड "ब्रेन" (एक लार्ज लैंग्वेज मॉडल, या LLM) के साथ शुरुआत की जो पहले से ही जानता था कि मानव भाषा कैसे काम करती है। यह एक अनुभवी अभिनेता को एक नया किरदार निभाने के लिए काम पर रखने जैसा है, न कि एक छोटे बच्चे को प्रशिक्षित करने जैसा। यह सुनिश्चित करता है कि आवाज़ स्वाभाविक लगे और शब्दों का उच्चारण सही हो, भले ही वह उन भाषाओं में हो जिन्हें AI ने पहले बहुत कम देखा हो।
4. इसकी महाशक्तियाँ
OmniVoice केवल एक वॉयस बॉक्स नहीं है; यह एक बहुमुखी उपकरण है:
- नॉइज़ कैंसिलिंग (शोर हटाना): यदि आप इसे एक ऐसी रिकॉर्डिंग देते हैं जो ऐसी लग रही है जैसे किसी हवादार पार्क में बनाई गई थी, तो OmniVoice उस आवाज़ को "साफ" कर सकता है और उसे ऐसा बना सकता है जैसे उसे किसी शांत स्टूडियो में रिकॉर्ड किया गया हो। यह व्यक्ति को शोर से अलग कर देता है।
- वॉयस डिज़ाइनर: यदि आपके पास किसी व्यक्ति की रिकॉर्डिंग नहीं है, तो आप बस टाइप कर सकते हैं: "60 वर्षीय पुरुष के लिए एक गहरी, गुस्सैल आवाज़।" OmniVoice उस आवाज़ को शून्य से उत्पन्न कर सकता है।
- "एक्सेंट" फिक्स: यदि AI किसी कठिन शब्द (जैसे कि कई उच्चारणों वाला चीनी अक्षर) पर अटक जाता है, तो आप इसे एक ध्वन्यात्मक (phonetic) चीट शीट दे सकते हैं, और यह हर बार इसे सही करेगा।
5. परिणाम
जब उन्होंने OmniVoice का परीक्षण सर्वश्रेष्ठ व्यावसायिक वॉयस टूल्स (जैसे ElevenLabs) और अन्य शीर्ष AI मॉडलों के खिलाफ किया:
- स्पष्टता (Intelligibility): इसने लगभग हर टेस्ट की गई भाषा में स्पष्ट रूप से बात की।
- समानता (Similarity): यह उस व्यक्ति की नकल करने में अविश्वसनीय रूप से सटीक था जिसकी यह नकल कर रहा था।
- कवरेज: यह एक ही सिस्टम में 600+ भाषाओं को सफलतापूर्वक संभालने वाला पहला मॉडल है, जो उन सैकड़ों भाषाओं के अंतर को पाटता है जिन्हें पहले तकनीक द्वारा अनदेखा किया गया था।
निष्कर्ष
OmniVoice दुनिया को आवाज़ देने जैसा है। पुराने, अव्यवस्थित दो-चरणीय प्रक्रिया को छोड़कर और "डायरेक्ट-टू-साउंड" दृष्टिकोण का उपयोग करके, जिसे एक विशाल, विविध लाइब्रेरी पर प्रशिक्षित किया गया है, इसने एक ऐसा सिस्टम बनाया है जो लगभग किसी भी भाषा में, लगभग किसी भी आवाज़ में, उच्च गुणवत्ता के साथ बोल सकता है। यह स्पीच टेक्नोलॉजी को वास्तव में सार्वभौमिक बनाने की दिशा में एक बड़ी छलांग है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।