Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs
यह शोध पत्र अलेक्जेंड्रिया (Alexandria) को प्रस्तुत करता है, जो एक बड़े पैमाने का, समुदाय-संचालित डेटासेट है जिसमें 13 देशों और 11 डोमेन के माध्यम से 107K समानांतर अंग्रेजी-क्षेत्रीय अरबी संवादात्मक टर्न शामिल हैं, जिसमें सूक्ष्म शहर-स्तरीय मेटाडेटा और लिंग संबंधी एनोटेशन दिए गए हैं, जिसे विविध अरबी बोलियों के लिए मशीन अनुवाद और एलएलएम (LLM) प्रदर्शन में सुधार करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
अरबी भाषा की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें जिसमें 13 अलग-अलग मोहल्ले (देश) हैं, जिनमें से प्रत्येक की अपनी अनूठी बोलचाल, अंदरूनी चुटकुले और स्थानीय रीति-रिवाज हैं। दशकों से, इस शहर की "आधिकारिक" भाषा—मॉडर्न स्टैंडर्ड अरबी (MSA)—शहर के औपचारिक सरकारी प्रसारण की तरह रही है। यह स्पष्ट, विनम्र है और समाचारों और स्कूलों में उपयोग की जाती है।
लेकिन समस्या यह है: वास्तव में कोई भी अपनी दैनिक ज़िंदगी में इस तरह बात नहीं करता।
यदि आप काहिरा, कैसाब्लांका या रियाद की सड़क पर चलते हैं, तो लोग अपनी स्थानीय बोलियों में बात कर रहे होते हैं। वे स्लैंग (बोलचाल के शब्द) का उपयोग करते हैं, इसमें फ्रेंच या अंग्रेजी के शब्दों को मिलाते हैं, और इस आधार पर अलग तरह से बात करते हैं कि वे किससे बात कर रहे हैं (एक दोस्त, एक बॉस, या एक पड़ोसी)।
समस्या: "एक-आकार-सभी-के-लिए-उपयुक्त-नहीं" वाला अनुवादक
वर्तमान AI अनुवादक उन पर्यटकों की तरह हैं जिन्होंने केवल सरकारी प्रसारण का अध्ययन किया है। जब आप उनसे किसी स्थानीय बाज़ार की अनौपचारिक बातचीत का अनुवाद करने के लिए कहते हैं, तो वे अक्सर गलत हो जाते हैं। वे एक रोबोट की तरह लग सकते हैं जो डिक्शनरी पढ़ रहा हो, या वे सांस्कृतिक बारीकियों को पूरी तरह से मिस कर सकते हैं। यह 1950 की एक शब्दकोश पुस्तिका (phrasebook) का उपयोग करके स्थानीय कैफे में कॉफी ऑर्डर करने जैसा है; आपको समझा तो जाएगा, लेकिन आप घुल-मिल नहीं पाएंगे, और आप किसी को नाराज भी कर सकते हैं।
समाधान: "अलेक्जेंड्रिया" प्रोजेक्ट
यह शोध पत्र अलेक्जेंड्रिया को पेश करता है, जो एक विशाल नया प्रोजेक्ट है जिसे AI को वास्तविक अरबी बोलना सिखाने के लिए डिज़ाइन किया गया है। अलेक्जेंड्रिया को एक डिक्शनरी के रूप में नहीं, बल्कि एक विशाल, समुदाय द्वारा संचालित "भाषा विसर्जन शिविर" (Language Immersion Camp) के रूप में सोचें।
यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया, सरल उपमाओं का उपयोग करते हुए:
1. पात्रों की टोली (समुदाय)
प्रयोगशाला में कुछ विशेषज्ञों को काम पर रखने के बजाय, शोधकर्ताओं ने 13 विभिन्न अरब देशों से 55 वास्तविक लोगों को नियुक्त किया।
- उपमा: कल्पना करें कि आप सबसे अच्छे स्थानीय व्यंजन सीखना चाहते हैं। आप किसी खाद्य समीक्षक से नहीं पूछते; आप हर मोहल्ले के दादी-नानी और स्ट्रीट शेफ से पूछते हैं। अलेक्जेंड्रिया ने बिल्कुल यही किया। उन्होंने विशिष्ट शहरों (न कि केवल देशों) के स्थानीय लोगों को इकट्ठा किया ताकि यह सुनिश्चित किया जा सके कि वे शहर के स्तर तक सटीक बोली का 'फ्लेवर' पकड़ सकें।
2. पटकथा (डेटा)
उन्होंने केवल यादृच्छिक (random) वाक्य नहीं लिखे। उन्होंने जीवन के 11 महत्वपूर्ण क्षेत्रों को कवर करने वाली 34,000+ बातचीत बनाई, जैसे खेती, स्वास्थ्य सेवा, व्यवसाय और दैनिक सामाजिक बातचीत।
- उपमा: AI को शब्दावली की सूची ("सेब," "कार," "दौड़ना") देने के बजाय, उन्होंने उसे एक टीवी शो के स्क्रिप्ट दिए। ये स्क्रिप्ट वास्तविक परिदृश्यों को कवर करती हैं: एक किसान पानी की कीमत पर मोलभाव कर रहा है, एक डॉक्टर निदान (diagnosis) समझा रहा है, या दोस्त यात्रा की योजना बना रहे हैं।
- ट्विस्ट: प्रत्येक बातचीत में एक "कास्ट लिस्ट" शामिल है जो बोलने वाले और सुनने वाले के लिंग (gender) को निर्दिष्ट करती है। अरबी में, आपके द्वारा उपयोग किए जाने वाले शब्द बदल जाते हैं, चाहे आप एक पुरुष से बात कर रहे हों या महिला से। अलेक्जेंड्रिया ने AI को इस सामाजिक नृत्य को सिखाया।
3. गुणवत्ता नियंत्रण (पीयर रिव्यू)
स्थानीय लोगों द्वारा स्क्रिप्ट का अनुवाद करने के बाद, उसी देश के अन्य स्थानीय लोगों के एक समूह ने उनकी समीक्षा की।
- उपमा: इसे एक स्थानीय फिल्म महोत्सव की तरह समझें। यदि मोरक्को के किसी विशेष गाँव के अनुवादक ने एक पंक्ति लिखी, तो उसी गाँव के एक अन्य व्यक्ति ने इसकी जाँच की। उन्होंने पूछा: "क्या यह वैसा ही लगता है जैसा हम वास्तव में कहेंगे? या यह किसी पाठ्यपुस्तक जैसा लगता है?" यदि यह बनावटी लगा, तो उन्होंने इसे ठीक किया।
4. स्ट्रेस टेस्ट (मूल्यांकन)
एक बार जब डेटासेट तैयार हो गया, तो उन्होंने दुनिया के सबसे स्मार्ट AI मॉडल (जैसे जेमिनी, क्वेन और अन्य) पर इसे आजमाया यह देखने के लिए कि वे कैसा प्रदर्शन करते हैं।
- परिणाम: AI मॉडल उन छात्रों की तरह थे जिन्होंने केवल पाठ्यपुस्तक का अध्ययन किया था।
- अच्छी खबर: वे औपचारिक चीजों का अनुवाद करने में ठीक थे।
- बुरी खबर: जब स्थानीय बोली में बोलने के लिए कहा गया, तो वे अक्सर या तो बहुत औपचारिक (stiff) लगे, या गलत लिंग रूपों का उपयोग किया, या वापस औपचारिक अरबी पर लौट आए।
- सबसे बड़ी चुनौती: मॉडल मगरेबी बोलियों (मोरक्को, अल्जीरिया, ट्यूनीशिया, मॉरिटानिया) के साथ सबसे अधिक संघर्ष करते हैं, जो औपचारिक भाषा से बहुत अलग हैं, जो "आधिकारिक" प्रसारण की तुलना में लगभग एक पूरी तरह से अलग भाषा की तरह हैं।
यह क्यों महत्वपूर्ण है
अलेक्जेंड्रिया एक सेतु (bridge) है।
अभी, यदि आप यमन के ग्रामीण इलाके के किसान हैं या सूडान के एक छोटे क्लिनिक के डॉक्टर हैं, तो आपके पास उपलब्ध तकनीक आपके वास्तविक जीवन के लिए नहीं, बल्कि "आधिकारिक" भाषा के लिए बनी है। यह प्रोजेक्ट उस प्रशिक्षण डेटा को प्रदान करता है जिसकी आवश्यकता ऐसे AI को बनाने के लिए है जो आपको समझ सके।
यह सांस्कृतिक समावेश के बारे में है। यह सुनिश्चित करता है कि जब आप एक AI से बात करें, तो वह न केवल आपके शब्दों को समझे; बल्कि वह आपके संदर्भ, आपकी संस्कृति और आपकी आवाज़ को भी समझे।
संक्षेप में:
अलेक्जेंड्रिया वास्तविक जीवन की बातचीत का एक विशाल, समुदाय-निर्मित पुस्तकालय है जो AI को एक मैनुअल पढ़ने वाले रोबोट की तरह सुनाई देना बंद करने और एक पड़ोसी के साथ चैट करने वाले वास्तविक व्यक्ति की तरह सुनाई देने के लिए सिखाता है। यह ऐसी तकनीक बनाने की दिशा में एक महत्वपूर्ण कदम है जो वास्तव में पूरे अरब जगत के लिए काम करती है, न कि केवल अभिजात वर्ग या औपचारिक बोलने वालों के लिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।