Ramsa: A Large Sociolinguistically Rich Emirati Arabic Speech Corpus for ASR and TTS
यह शोध पत्र रामसा (Ramsa) को प्रस्तुत करता है, जो विभिन्न उप-बोलियों और विषयों के 157 वक्ताओं का एक 41-घंटे का समाजशास्त्रीय रूप से विविध अमीराती अरबी भाषण संग्रह है, जो निम्न-संसाधन एएसआर (ASR) और टीटीएस (TTS) प्रौद्योगिकियों को विकसित करने के लिए एक आधारभूत संसाधन के रूप में कार्य करता है और मौजूदा मॉडलों के लिए प्रारंभिक प्रदर्शन बेसलाइन स्थापित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक विशिष्ट स्थानीय अरबी बोली बोलना और समझना सिखाने की कोशिश कर रहे हैं—वह बोली जो संयुक्त अरब अमीरात (UAE) में बोली जाती है। अब तक, इस रोबोट को सिखाना एक बहुत पुरानी किताब के केवल एक धूल भरे पन्ने को पढ़कर भाषा सीखने जैसा था। आप मूल भाव तो समझ सकते हैं, लेकिन आप बोलचाल की भाषा (slang), विभिन्न लहजों और इस बात को चूक जाएंगे कि वास्तविक लोग वास्तव में एक-दूसरे से कैसे बात करते हैं।
यह शोध पत्र Ramsa पेश करता है, जो эмиराती अरबी (Emirati Arabic) का एक विशाल नया "पुस्तकालय" है जिसे इसी समस्या को ठीक करने के लिए डिज़ाइन किया गया है। यहाँ शोधकर्ताओं द्वारा किए गए कार्यों का सरल विवरण दिया गया है, जिसमें कुछ रोजमर्रा के उपमाओं का उपयोग किया गया है।
1. समस्या: "खाली बुकशेल्फ़" (The Empty Bookshelf)
लंबे समय से, AI शोधकर्ताओं के पास अंग्रेजी या मानक अरबी के लिए पर्याप्त डेटा था, लेकिन खाड़ी क्षेत्र की विशिष्ट, रंगीन बोलियों के लिए बहुत कम था।
- पुराना डेटा: पिछले संग्रह एक छोटे, एक कमरे वाले पुस्तकालय की तरह थे। कुछ में केवल एक वक्ता (आमतौर पर एक पुरुष) था, कुछ बहुत छोटे थे, और उन्होंने अधिकांशतः यूएई (UAE) के भीतर विभिन्न "लहजों" (accents) की अनदेखी की (जैसे शहर की आवाज़ बनाम रेगिस्तान/बदू आवाज़ बनाम पहाड़ी आवाज़)।
- लैंगिक अंतर (The Gender Gap): कई पुराने पुस्तकालय लगभग पूरी तरह से पुरुषों के थे। यदि आप केवल पुरुषों को सुनते हैं, तो आप यह नहीं सीख पाते कि महिलाएँ कैसे बोलती हैं, जो कि पहेली का एक बहुत बड़ा गायब हिस्सा है।
2. समाधान: "Ramsa" बनाना (नया पुस्तकालय)
शोधकर्ताओं ने 41 घंटे के ऑडियो रिकॉर्डिंग का एक संग्रह बनाया जिसे Ramsa कहा जाता है। इसे ध्वनि के एक विशाल, आधुनिक संग्रहालय के निर्माण के रूप में सोचें।
- संग्रहालय में कौन है? उन्होंने 157 अलग-अलग लोगों (59 महिलाएं और 98 पुरुष) को रिकॉर्ड किया। यह पिछले संग्रहों की तुलना में एक बड़ा सुधार है जिनमें शायद केवल एक या दो महिलाएं होती थीं।
- वे किस बारे में बात कर रहे हैं? उन्होंने लोगों को केवल एक स्क्रिप्ट पढ़ने के लिए नहीं कहा। उन्होंने रिकॉर्ड किया:
- संरचित साक्षात्कार (Structured Interviews): जैसे दैनिक जीवन, भोजन और परिवार के बारे में कॉफी पर की जाने वाली एक मैत्रीपूर्ण बातचीत।
- टीवी शो: वास्तविक эмиराती टेलीविजन के क्लिप, जिनमें कुकिंग शो और इतिहास संबंधी वृत्तचित्रों (documentaries) से लेकर व्यापार और संस्कृति पर टॉक शो तक सब कुछ शामिल है।
- विविधता: यह पुस्तकालय यूएई के पूरे स्पेक्ट्रम को कैप्चर करता है। आप "शहरी" (Urban) शहर का लहजा, "बदू" (Bedouin) रेगिस्तानी लहजा और "पहाड़ी" (Mountain) लहजा सुन सकते हैं। यह महत्वपूर्ण है क्योंकि AI को यह समझने की आवश्यकता है कि वक्ता कहाँ पला-बढ़ा है, इसके आधार पर एक शब्द थोड़ा अलग सुनाई दे सकता है।
3. "अनुवाद" की चुनौती (Annotation)
एक बार जब उनके पास ऑडियो आ गया, तो उन्हें इसे लिखना (ट्रांसक्राइब करना) था। यह पेचीदा है क्योंकि эмиराती अरबी बोली जाती है, केवल लिखी नहीं जाती।
- नियम: उन्होंने तय किया कि वे शब्दों को ठीक वैसे ही लिखेंगे जैसे वे सुनाई देते हैं, न कि वैसे जैसे उन्हें औपचारिक शब्दकोश में लिखा जाता है।
- उदाहरण: यदि कोई "shayʾ" के बजाय "shay" कहता है, तो उन्होंने "shay" लिखा। यदि लोग तेज़ बोलते समय शब्द आपस में मिल जाते हैं, तो उन्होंने उन्हें मिला हुआ ही लिखा।
- टीम: भाषाविदों की एक टीम ने "अनुवादकों" के रूप में कार्य किया, जिन्होंने हर सेकंड को ध्यान से सुना ताकि लिखित पाठ ध्वनि के साथ पूरी तरह मेल खा सके, जिसमें हँसी, व्यवधान और ठहराव भी शामिल थे।
4. टेस्ट ड्राइव: क्या AI इसे समझ सकता है?
शोधकर्ताओं ने इस नए पुस्तकालय के एक छोटे से हिस्से (10%) को दुनिया के बेहतरीन AI स्पीच टूल्स (मुफ्त और सशुल्क दोनों) के विरुद्ध परखा, यह देखने के लिए कि वे बिना किसी विशेष प्रशिक्षण के (जिसे "जीरो-शॉट" परीक्षण कहा जाता है) эмиराती अरबी को कितनी अच्छी तरह समझते हैं।
- परिणाम:
- विजेता: ओपन-सोर्स मॉडल Whisper-large-v3-turbo ने भाषण (ASR) को समझने में सबसे अच्छा काम किया। टेक्स्ट को स्पीच में बदलने (TTS) के लिए, MMS-TTS-Ara चैंपियन रहा।
- संघर्ष: AI सबसे अधिक तेज़, ओवरलैपिंग बातचीत (जैसे एक अराजक कुकिंग शो जहाँ लोग एक-दूसरे के ऊपर बोलते हैं) के साथ संघर्ष करता है। यह एक अकेले व्यक्ति द्वारा कहानी सुनाने (जैसे एक डॉक्यूमेंट्री) को सुनने में बहुत बेहतर था।
- निर्णय: AI सही दिशा में बढ़ रहा है, लेकिन यह अभी भी पूर्ण नहीं है। यह एक ऐसे छात्र की तरह है जिसने परीक्षा पास तो कर ली है लेकिन उसे 'A+' पाने के लिए अभी और अध्ययन करने की आवश्यकता है।
5. यह क्यों मायने रखता है (बड़ा परिप्रेक्ष्य)
यह शोध पत्र केवल संख्याओं के बारे में नहीं है; यह प्रतिनिधित्व के बारे में है।
- तकनीक के लिए: यह AI डेवलपर्स को उन "ट्रेनिंग व्हील्स" (सहायता) को देता है जिनकी उन्हें विशेष रूप से अमीरातियों के लिए बेहतर वॉयस असिस्टेंट, डिक्टेशन टूल्स और अनुवाद ऐप बनाने के लिए आवश्यकता है।
- संस्कृति के लिए: यह इस बात को संरक्षित करता है कि эмиराती आज वास्तव में कैसे बोलते हैं, जिसमें शहर और रेगिस्तान के लहजों का मिश्रण शामिल है जो आपस में मिल रहे हैं।
- भविष्य के लिए: शोधकर्ता स्वीकार करते हैं कि यह तो बस शुरुआत है। उन्हें पहाड़ी क्षेत्रों से अधिक डेटा और भाषा कैसे बदलती है इसे पकड़ने के लिए अधिक वृद्ध वक्ताओं की आवश्यकता है।
संक्षेप में: लेखकों ने эмиराती अरबी का एक विशाल, विविध साउंड लाइब्रेरी बनाया है ताकि AI को वास्तव में एक स्थानीय की तरह सुनना और बोलना सिखाया जा सके। उन्होंने शीर्ष AI मॉडलों का परीक्षण किया, पाया कि वे अच्छे हैं लेकिन उन्हें अभी भी अभ्यास की आवश्यकता है, और भविष्य के शोधकर्ताओं के लिए और भी स्मार्ट टूल्स बनाने के लिए द्वार खोल दिए हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।