← नवीनतम पेपर
⚡ electrical engineering

OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models

OmniVoice एक अत्याधुनिक, विशाल बहुभाषी ज़ीरो-शॉट टेक्स्ट-टू-स्पीच मॉडल है जो एक नवीन डिफ्यूजन लैंग्वेज मॉडल-शैली के डिस्क्रीट नॉन-ऑटोरिग्रेसिव आर्किटेक्चर का उपयोग करके 60 टेक्स्ट से अधिक भाषाओं तक स्केल करता है ताकि सीधे टेक्स्ट को ध्वनिक टोकन (acoustic tokens) में मैप किया जा सके, जिससे एक पूर्ण-कोडबुक रैंडम मास्किंग रणनीति और प्री-ट्रेन्ड एलएलएम (LLM) इनिशियलाइज़ेशन के माध्यम से उत्कृष्ट स्पष्टता और व्यापक भाषा कवरेज प्राप्त होता है।

मूल लेखक: Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Povey

प्रकाशित 2026-04-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Povey

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसा सार्वभौमिक अनुवादक बनाना चाहते हैं जो न केवल टेक्स्ट का अनुवाद करे, बल्कि किसी भी स्थान के किसी भी व्यक्ति की आवाज़ में उसे बोल भी सके, और वह भी 600 से अधिक विभिन्न भाषाओं में। यही OmniVoice का लक्ष्य है, जो Xiaomi के शोधकर्ताओं द्वारा बनाया गया एक नया आर्टिफिशियल इंटेलिजेंस मॉडल है।

यहाँ इसकी कहानी दी गई है कि उन्होंने इसे कैसे बनाया, जिसे बिना किसी तकनीकी शब्दावली के समझाया गया है।

1. समस्या: "दो-चरणीय नृत्य" बहुत ही अव्यवस्थित था

OmniVoice से पहले, अधिकांश AI वॉयस जनरेटर दो धावकों वाली रिले रेस की तरह काम करते थे।

  • धावक 1 (अनुवादक): टेक्स्ट लेता है और उसे एक रफ "सिमेंटिक" स्केच (जैसे कि वाक्य का अर्थ क्या है, उसका एक नक्शा) में बदल देता है।
  • धावक 2 (गायक): उस स्केच को लेता है और उसे वास्तविक ध्वनि तरंगों (sound waves) में बदलने की कोशिश करता है।

दोष: यदि धावक 1 स्केच बनाने में एक छोटी सी भी गलती करता है, तो धावक 2 को खराब निर्देशों के साथ काम करना पड़ता है। अंतिम आवाज़ रोबोटिक लगती है, या लहजा अजीब हो जाता है। यह एक धुंधली फोटो के आधार पर मास्टरपीस पेंट करने की कोशिश करने जैसा है; बीच में ही विवरण खो जाते हैं।

2. समाधान: "डायरेक्ट आर्टिस्ट"

OmniVoice पूरी रिले रेस को ही छोड़ देता है। यह एक सिंगल-स्टेज आर्टिस्ट है।
एक गायक को स्केच पास करने के बजाय, OmniVoice टेक्स्ट और संदर्भ आवाज़ (reference voice) को देखता है, और सीधे ध्वनि तरंगों को पेंट करता है। यह "टेक्स्ट" \rightarrow "परफेक्ट वॉयस" की ओर एक ही सहज गति में जाता है।

3. इसने 600 भाषाएँ बोलना कैसे सीखा

AI को 600 भाषाएँ (जिनमें बहुत कम डेटा वाली कई दुर्लभ भाषाएँ भी शामिल हैं) सिखाने के लिए, शोधकर्ताओं को चतुर होना पड़ा।

  • लाइब्रेरी: उन्होंने केवल एक लाइब्रेरी का उपयोग नहीं किया; उन्होंने 581,000 घंटों के ओपन-सोर्स ऑडियो का उपयोग करके एक विशाल लाइब्रेरी बनाई। यह सुनने में ऐसा है जैसे आप लगातार 66 वर्षों तक 24/7 ऑडियो सुन रहे हों!
  • "फुल-कोडबुक" ट्रिक: कल्पना कीजिए कि आप 88 कुंजियों (keys) वाले पियानो को बजाना सीख रहे हैं। अधिकांश AI मॉडल एक समय में एक कुंजी को बार-बार दबाकर अभ्यास करते हैं। OmniVoice एक ऐसे पियानो वादक की तरह है जो अभ्यास के दौरान यादृच्छिक रूप से (randomly) एक साथ सभी 88 कुंजियों को दबाता है। यह अराजक, फुल-स्पीड अभ्यास इसे भाषा के "संगीत" को बहुत तेज़ी से और अधिक कुशलता से सीखने में मदद करता है।
  • "स्मार्ट ब्रेन" की शुरुआत: आमतौर पर, एक नए AI को सिखाना एक बच्चे को शून्य से बोलना सिखाने जैसा होता है। OmniVoice ने एक प्री-ट्रेन्ड "ब्रेन" (एक लार्ज लैंग्वेज मॉडल, या LLM) के साथ शुरुआत की जो पहले से ही जानता था कि मानव भाषा कैसे काम करती है। यह एक अनुभवी अभिनेता को एक नया किरदार निभाने के लिए काम पर रखने जैसा है, न कि एक छोटे बच्चे को प्रशिक्षित करने जैसा। यह सुनिश्चित करता है कि आवाज़ स्वाभाविक लगे और शब्दों का उच्चारण सही हो, भले ही वह उन भाषाओं में हो जिन्हें AI ने पहले बहुत कम देखा हो।

4. इसकी महाशक्तियाँ

OmniVoice केवल एक वॉयस बॉक्स नहीं है; यह एक बहुमुखी उपकरण है:

  • नॉइज़ कैंसिलिंग (शोर हटाना): यदि आप इसे एक ऐसी रिकॉर्डिंग देते हैं जो ऐसी लग रही है जैसे किसी हवादार पार्क में बनाई गई थी, तो OmniVoice उस आवाज़ को "साफ" कर सकता है और उसे ऐसा बना सकता है जैसे उसे किसी शांत स्टूडियो में रिकॉर्ड किया गया हो। यह व्यक्ति को शोर से अलग कर देता है।
  • वॉयस डिज़ाइनर: यदि आपके पास किसी व्यक्ति की रिकॉर्डिंग नहीं है, तो आप बस टाइप कर सकते हैं: "60 वर्षीय पुरुष के लिए एक गहरी, गुस्सैल आवाज़।" OmniVoice उस आवाज़ को शून्य से उत्पन्न कर सकता है।
  • "एक्सेंट" फिक्स: यदि AI किसी कठिन शब्द (जैसे कि कई उच्चारणों वाला चीनी अक्षर) पर अटक जाता है, तो आप इसे एक ध्वन्यात्मक (phonetic) चीट शीट दे सकते हैं, और यह हर बार इसे सही करेगा।

5. परिणाम

जब उन्होंने OmniVoice का परीक्षण सर्वश्रेष्ठ व्यावसायिक वॉयस टूल्स (जैसे ElevenLabs) और अन्य शीर्ष AI मॉडलों के खिलाफ किया:

  • स्पष्टता (Intelligibility): इसने लगभग हर टेस्ट की गई भाषा में स्पष्ट रूप से बात की।
  • समानता (Similarity): यह उस व्यक्ति की नकल करने में अविश्वसनीय रूप से सटीक था जिसकी यह नकल कर रहा था।
  • कवरेज: यह एक ही सिस्टम में 600+ भाषाओं को सफलतापूर्वक संभालने वाला पहला मॉडल है, जो उन सैकड़ों भाषाओं के अंतर को पाटता है जिन्हें पहले तकनीक द्वारा अनदेखा किया गया था।

निष्कर्ष

OmniVoice दुनिया को आवाज़ देने जैसा है। पुराने, अव्यवस्थित दो-चरणीय प्रक्रिया को छोड़कर और "डायरेक्ट-टू-साउंड" दृष्टिकोण का उपयोग करके, जिसे एक विशाल, विविध लाइब्रेरी पर प्रशिक्षित किया गया है, इसने एक ऐसा सिस्टम बनाया है जो लगभग किसी भी भाषा में, लगभग किसी भी आवाज़ में, उच्च गुणवत्ता के साथ बोल सकता है। यह स्पीच टेक्नोलॉजी को वास्तव में सार्वभौमिक बनाने की दिशा में एक बड़ी छलांग है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →