← नवीनतम पेपर
🤖 AI

MERaLiON-GR: Speech Gender Recognition Model for English and SEA Languages

यह शोध पत्र MERaLiON-GR प्रस्तुत करता है, जो एक स्पीच जेंडर रिकग्निशन मॉडल है जो अंग्रेजी और कई दक्षिण-पूर्व एशियाई भाषाओं में पुरुष और महिला वक्ताओं की पहचान करने में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए MERaLiON-SpeechEncoder-2 के LoRA फाइन-ट्यूनिंग और एक मल्टी-स्केल ECAPA-TDNN क्लासिफायर का लाभ उठाता है।

मूल लेखक: Qiongqiong Wang, Ai Ti Aw, Nancy F. Chen, Ying Lay Chiu, Yang Ding, Yingxu He, Ridong Jiang, Zhuohan Liu, Yanfeng Lu, Yi Ma, Muhammad Huzaifah, Nabilah Binte Md Johan, Nattadaporn Lertcheva, Pham Minh
प्रकाशित 2026-08-06
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qiongqiong Wang, Ai Ti Aw, Nancy F. Chen, Ying Lay Chiu, Yang Ding, Yingxu He, Ridong Jiang, Zhuohan Liu, Yanfeng Lu, Yi Ma, Muhammad Huzaifah, Nabilah Binte Md Johan, Nattadaporn Lertcheva, Pham Minh Duc, Sailor Hardik Bhupendra, Siti Umairah Binte Mohammad Salleh, Shuo Sun, Tarun Kumar Vangani, Jeremy H. M. Wong, Jinyang Wu, Longyin Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हलचल भरी, शोर-शराबे वाली पार्टी में हैं जहाँ लोग अलग-अलग भाषाएँ बोल रहे हैं, हँस रहे, चिल्ला रहे हैं और फुसफुसा रहे हैं। यदि आप अपनी आँखें बंद कर लेते हैं, तो आप अक्सर केवल आवाज़ के माध्यम से यह बता सकते हैं कि कौन पुरुष है और कौन महिला। आपका मस्तिष्क यह काम स्वचालित रूप से करता है, जिसमें पिच (pitch), बनावट (texture) और लय (rhythm) जैसे सुरागों को एक साथ मिला दिया जाता है। लेकिन कंप्यूटर को ऐसा करने के लिए सिखाना एक रोबोट को तूफान के बीच अपने दोस्त की आवाज़ पहचानने के लिए सिखाने जैसा है। विज्ञान के इस क्षेत्र को स्पीच जेंडर रिकग्निशन (speech gender recognition) कहा जाता है। यह आर्टिफिशियल इंटेलिजेंस की एक शाखा है जो यह पता लगाने की कोशिश करती है कि बोलने वाला व्यक्ति पुरुष है या महिला, बिना उन्हें देखे, केवल उनकी आवाज़ सुनकर।

कंप्यूटर यह कैसे सीखता है, इसे समझने के लिए, दो अलग-अलग उपकरणों के बारे में सोचें। पहला उपकरण एक विशेषज्ञ जासूस (specialized detective) की तरह है। इस उपकरण को आवाज़ के सुरागों को सुनने के लिए विशेष रूप से प्रशिक्षित किया गया है। यह इस बात पर ध्यान नहीं देता कि व्यक्ति क्या कह रहा है, बल्कि इस पर ध्यान केंद्रित करता है कि वे इसे कैसे कह रहे हैं। दूसरा उपकरण एक सामान्य ज्ञान के विश्वकोश (general knowledge encyclopedia) की तरह है। यह एक विशाल AI है जिसने लगभग सब कुछ पढ़ा है और दुनिया के बारे में सवालों के जवाब दे सकता है, लेकिन इसे विशेष रूप से वॉयस डिटेक्टिव के रूप में प्रशिक्षित नहीं किया गया है। लंबे समय तक वैज्ञानिकों ने सोचा: "क्या हमें एक विशेषज्ञ जासूस की आवश्यकता है, या क्या विश्वकोश खुद ही इसे समझने के लिए पर्याप्त स्मार्ट है?" यही वह बड़ा सवाल था जिसका उत्तर शोधकर्ताओं ने इस शोध पत्र में देने का प्रयास किया। वे एक ऐसा वॉयस डिटेक्टिव बनाना चाहते थे जो न केवल अंग्रेजी में, बल्कि दक्षिण-पूर्व एशिया में बोली जाने वाली कई भाषाओं में भी काम करे, और वे देखना चाहते थे कि क्या यह वर्तमान में उपलब्ध सर्वोत्तम उपकरणों को मात दे सकता है।

नया वॉयस डिटेक्टिव: MERaLiON-GR

इस शोध पत्र के पीछे की टीम, जिसे MERaLiON टीम के रूप में जाना जाता है, ने MERaLiON-GR नामक एक नया वॉयस डिटेक्टिव बनाया है। इस मॉडल को एक सुपर-स्मार्ट रोबोटिक कान के रूप में समझें जिसे अंग्रेजी और आठ अलग-अलग दक्षिण-पूर्वी एशियाई भाषाओं (जिनमें चीनी, मलय, तमिल, थाई, वियतनामी, इंडोनेशियाई और खमेर शामिल हैं) की आवाज़ों के एक विशाल पुस्तकालय पर प्रशिक्षित किया गया है।

यह कैसे काम करता है (नुस्खा/रेसिपी)
कल्पना कीजिए कि रोबोट का मस्तिष्क तीन परतों में बना है:

  1. बड़ा मस्तिष्क (द बैकबोन): इसके केंद्र में MERaLiON-SpeechEncoder-2 नामक एक विशाल, प्री-ट्रेंड मस्तिष्क है। इस मस्तिष्क ने पहले ही लाखों घंटों की स्पीच सुनी है और जानता है कि ध्वनियाँ कैसे काम करती हैं। हालाँकि, टीम पूरे मस्तिष्क को फिर से प्रशिक्षित नहीं करना चाहती थी क्योंकि वह एक पूरी विश्वकोश को फिर से लिखने जैसा होगा, सिर्फ "वॉयस जेंडर" पर एक नया अध्याय जोड़ने के लिए। इसमें बहुत अधिक ऊर्जा और समय लगता है।
  2. स्मार्ट अडैप्टर (LoRA): पूरे मस्तिष्क को फिर से लिखने के बजाय, उन्होंने LoRA (लो-रैंक अडैप्टेशन) नामक एक चतुर तकनीक का उपयोग किया। कल्पना कीजिए कि बड़ा मस्तिष्क एक विशाल, भारी पुस्तकालय है। LoRA उन अलमारियों पर चिपकाए गए छोटे, हल्के 'स्टिकी नोट्स' की तरह है। ये नोट्स लाइब्रेरी को यह बताते हैं कि उसे पुरुष बनाम महिला आवाजों को पहचानने के विशेष कार्य के लिए अपने मौजूदा ज्ञान को कैसे पुनर्व्यवस्थित करना है। यह कुशल, तेज़ है और लाइब्रेरी के अन्य ज्ञान के साथ छेड़छाड़ नहीं करता है।
  3. अंतिम निर्णायक (ECAPA-TDNN): मस्तिष्क फिर अपने निष्कर्षों को एक विशेष न्यायाधीश को भेजता है जिसे ECAPA-TDNN कहा जाता है। यह न्यायाधीश मस्तिष्क की विभिन्न परतों से मिले सुरागों को देखता है, उन्हें जोड़ता है, और अंतिम निर्णय लेता है: "पुरुष" या "महिला"।

बड़ी परीक्षा
टीम ने अपने नए डिटेक्टिव को दो अन्य प्रतियोगियों के खिलाफ परखने के लिए रखा:

  • Vox-Profile: वॉयस जेंडर रिकग्निशन का वर्तमान चैंपियन।
  • MERaLiON-v2: एक सामान्य-उद्देश्य वाला "विश्वकोश" AI (एक ऑडियो-एलएलएम) जो बात कर सकता है और सुन सकता है लेकिन वह एक विशेष वॉयस डिटेक्टिव नहीं है।

उन्होंने सभी पर एक विशाल विविधता में परीक्षण किया: स्पष्ट स्टूडियो रिकॉर्डिंग, शोर-शराबे वाली सड़कों की रिकॉर्डिंग, 2 सेकंड के छोटे क्लिप और लंबी बातचीत। भाषाएँ मानक अंग्रेजी से लेकर सिंग्लिश (Singlish) और विभिन्न दक्षिण-पूर्वी एशियाई बोलियों के अनूठे मिश्रण तक फैली हुई थीं।

परिणाम: विशेषज्ञ की जीत
परिणाम स्पष्ट थे। विशेषज्ञ जासूस, MERaLiON-GR, ने लगभग हर श्रेणी में प्रतियोगिता को पछाड़ दिया।

  • चैंपियन को हराना: 15 अलग-अलग टेस्ट सेटों में से 12 पर, MERaLiON-GR, वर्तमान चैंपियन Vox-Profile की तुलना में अधिक सटीक था। कुछ मामलों में, जैसे तमिल और थाई बुजुर्गों की आवाजों के साथ, इसने 100.00% का सटीक स्कोर प्राप्त किया।
  • "वाइल्ड" टेस्ट: असली चुनौती "इन-द-वाइल्ड" (वास्तविक जीवन की) रिकॉर्डिंग थी—वास्तविक जीवन से लिए गए छोटे, शोर वाले क्लिप (10 से 30 सेकंड लंबे)। यहाँ भी, MERa-LION-GR विजेता रहा, जिसने Vox-Profile को 4.32 प्रतिशत अंक तक पीछे छोड़ दिया। यह एक बड़ी बात है क्योंकि वास्तविक दुनिया का ऑडियो बैकग्राउंड शोर और छोटे अंशों से भरा होता है जो अन्य मॉडलों को भ्रमित कर देते हैं।
  • विश्वकोश का संघर्ष: सामान्य-उद्देश्य वाला AI (वह "विश्वकोश") ठीक-ठाक प्रदर्शन कर रहा था, लेकिन वह लगातार विशेषज्ञ जासूस से हार गया। विशिष्ट प्रशिक्षण के बिना, उसे बारीक विवरणों को समझने में संघर्ष करना पड़ा। उदाहरण के लिए, इंग्लिश FLEURS टेस्ट पर, विश्वकोश केवल 49.61% सही था, जबकि विशेषज्ञ जासूस ने 100.00% प्राप्त किया।

जादुई ट्रिक: विश्वकोशक की मदद करना
यहाँ सबसे दिलचस्प हिस्सा है। टीम ने पाया कि भले ही सामान्य-उद्देश्य वाला AI (विश्वकोश) अपने आप में एक महान वॉयस डिटेक्टिव नहीं है, लेकिन यदि आप उसे पहले उत्तर बता दें, तो वह बहुत अधिक स्मार्ट हो जाता है।
जब उन्होंने अपने विशेषज्ञ जासूस (MERaLION-GR) से लिंग का अनुमान लिया और उसे विश्वकोश को एक "संकेत" (मेटाडेटा) के रूप में दिया, तो विश्वकोशक का प्रदर्शन आसमान छू गया।

  • वियतनामी Common Voice पर, विश्वकोशक की सटीकता केवल लिंग बताने के बाद 36.08% से बढ़कर 96.08% हो गई।
  • इंग्लिश FLEURS पर, यह 49.61% से उछलकर 97.31% हो गया।

यह सुझाव देता है कि हालांकि सामान्य AI मॉडल शक्तिशाली हैं, फिर भी उन्हें लिंग की पहचान करने जैसे विशिष्ट कार्यों के लिए एक विशेष "सहायक" की आवश्यकता होती है। एक बार जब उनके पास वह सुराग आ जाता है, तो वे बातचीत को बेहतर ढंग से समझने के लिए अपने विशाल ज्ञान का उपयोग कर सकते हैं।

यह क्यों महत्वपूर्ण है
शोध पत्र यह निष्कर्ष निकालता है कि भाषाओं के मिश्रण और शोर भरे वातावरण में लिंग को पहचानने जैसे कार्यों के लिए, आपको वास्तव में एक समर्पित, विशेष उपकरण की आवश्यकता होती है। आप केवल एक सामान्य AI पर निर्भर होकर इसे हल नहीं कर सकते। MERaLION-GR मॉडल दिखाता है कि एक बड़े मस्तिष्क को एक विशिष्ट कार्य के लिए अनुकूलित करने हेतु एक स्मार्ट, कुशल विधि (LoRA) का उपयोग करके, हम दक्षिण-पूर्व एशिया की विविध आवाजों को पहले से कहीं बेहतर समझ सकते हैं। यह एक याद दिलाता है कि कभी-कभी, एक विशिष्ट समस्या को हल करने का सबसे अच्छा तरीका एक विशेषज्ञ बनाना होता है, न कि केवल एक सामान्य विशेषज्ञ पर निर्भर रहना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →