← नवीनतम पेपर
💬 NLP

Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs

यह शोध पत्र अलेक्जेंड्रिया (Alexandria) को प्रस्तुत करता है, जो एक बड़े पैमाने का, समुदाय-संचालित डेटासेट है जिसमें 13 देशों और 11 डोमेन के माध्यम से 107K समानांतर अंग्रेजी-क्षेत्रीय अरबी संवादात्मक टर्न शामिल हैं, जिसमें सूक्ष्म शहर-स्तरीय मेटाडेटा और लिंग संबंधी एनोटेशन दिए गए हैं, जिसे विविध अरबी बोलियों के लिए मशीन अनुवाद और एलएलएम (LLM) प्रदर्शन में सुधार करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Abdellah El Mekki, Samar M. Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-hibiri, Razan Saadie, Hamzah Alsayadi, Nadia Ghezaiel Hammouda, Alshima Alkhazimi, Aya Hamod, A
प्रकाशित 2026-04-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abdellah El Mekki, Samar M. Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-hibiri, Razan Saadie, Hamzah Alsayadi, Nadia Ghezaiel Hammouda, Alshima Alkhazimi, Aya Hamod, Al-Yas Al-Ghafri, Wesam El-Sayed, Asila Al sharji, Mohamad Ballout, Anas Belfathi, Karim Ghaddar, Serry Sibaee, Alaa Aoun, Areej Asiri, Lina Abureesh, Ahlam Bashiti, Majdal Yousef, Abdulaziz Hafiz, Yehdih Mohamed, Emira Hamedtou, Brakehe Brahim, Rahaf Alhamouri, Youssef Nafea, Aya El Aatar, Walid Al-Dhabyani, Emhemed Hamed, Sara Shatnawi, Fakhraddin Alwajih, Khalid Elkhidir, Ashwag Alasmari, Abdurrahman Gerrio, Omar Alshahri, AbdelRahim A. Elmadany, Ismail Berrada, Amir Azad Adli Alkathiri, Fadi A Zaraket, Mustafa Jarrar, Yahya Mohamed El Hadj, Hassan Alhuzali, Muhammad Abdul-Mageed

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

अरबी भाषा की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें जिसमें 13 अलग-अलग मोहल्ले (देश) हैं, जिनमें से प्रत्येक की अपनी अनूठी बोलचाल, अंदरूनी चुटकुले और स्थानीय रीति-रिवाज हैं। दशकों से, इस शहर की "आधिकारिक" भाषा—मॉडर्न स्टैंडर्ड अरबी (MSA)—शहर के औपचारिक सरकारी प्रसारण की तरह रही है। यह स्पष्ट, विनम्र है और समाचारों और स्कूलों में उपयोग की जाती है।

लेकिन समस्या यह है: वास्तव में कोई भी अपनी दैनिक ज़िंदगी में इस तरह बात नहीं करता।

यदि आप काहिरा, कैसाब्लांका या रियाद की सड़क पर चलते हैं, तो लोग अपनी स्थानीय बोलियों में बात कर रहे होते हैं। वे स्लैंग (बोलचाल के शब्द) का उपयोग करते हैं, इसमें फ्रेंच या अंग्रेजी के शब्दों को मिलाते हैं, और इस आधार पर अलग तरह से बात करते हैं कि वे किससे बात कर रहे हैं (एक दोस्त, एक बॉस, या एक पड़ोसी)।

समस्या: "एक-आकार-सभी-के-लिए-उपयुक्त-नहीं" वाला अनुवादक
वर्तमान AI अनुवादक उन पर्यटकों की तरह हैं जिन्होंने केवल सरकारी प्रसारण का अध्ययन किया है। जब आप उनसे किसी स्थानीय बाज़ार की अनौपचारिक बातचीत का अनुवाद करने के लिए कहते हैं, तो वे अक्सर गलत हो जाते हैं। वे एक रोबोट की तरह लग सकते हैं जो डिक्शनरी पढ़ रहा हो, या वे सांस्कृतिक बारीकियों को पूरी तरह से मिस कर सकते हैं। यह 1950 की एक शब्दकोश पुस्तिका (phrasebook) का उपयोग करके स्थानीय कैफे में कॉफी ऑर्डर करने जैसा है; आपको समझा तो जाएगा, लेकिन आप घुल-मिल नहीं पाएंगे, और आप किसी को नाराज भी कर सकते हैं।

समाधान: "अलेक्जेंड्रिया" प्रोजेक्ट
यह शोध पत्र अलेक्जेंड्रिया को पेश करता है, जो एक विशाल नया प्रोजेक्ट है जिसे AI को वास्तविक अरबी बोलना सिखाने के लिए डिज़ाइन किया गया है। अलेक्जेंड्रिया को एक डिक्शनरी के रूप में नहीं, बल्कि एक विशाल, समुदाय द्वारा संचालित "भाषा विसर्जन शिविर" (Language Immersion Camp) के रूप में सोचें।

यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया, सरल उपमाओं का उपयोग करते हुए:

1. पात्रों की टोली (समुदाय)

प्रयोगशाला में कुछ विशेषज्ञों को काम पर रखने के बजाय, शोधकर्ताओं ने 13 विभिन्न अरब देशों से 55 वास्तविक लोगों को नियुक्त किया।

  • उपमा: कल्पना करें कि आप सबसे अच्छे स्थानीय व्यंजन सीखना चाहते हैं। आप किसी खाद्य समीक्षक से नहीं पूछते; आप हर मोहल्ले के दादी-नानी और स्ट्रीट शेफ से पूछते हैं। अलेक्जेंड्रिया ने बिल्कुल यही किया। उन्होंने विशिष्ट शहरों (न कि केवल देशों) के स्थानीय लोगों को इकट्ठा किया ताकि यह सुनिश्चित किया जा सके कि वे शहर के स्तर तक सटीक बोली का 'फ्लेवर' पकड़ सकें।

2. पटकथा (डेटा)

उन्होंने केवल यादृच्छिक (random) वाक्य नहीं लिखे। उन्होंने जीवन के 11 महत्वपूर्ण क्षेत्रों को कवर करने वाली 34,000+ बातचीत बनाई, जैसे खेती, स्वास्थ्य सेवा, व्यवसाय और दैनिक सामाजिक बातचीत।

  • उपमा: AI को शब्दावली की सूची ("सेब," "कार," "दौड़ना") देने के बजाय, उन्होंने उसे एक टीवी शो के स्क्रिप्ट दिए। ये स्क्रिप्ट वास्तविक परिदृश्यों को कवर करती हैं: एक किसान पानी की कीमत पर मोलभाव कर रहा है, एक डॉक्टर निदान (diagnosis) समझा रहा है, या दोस्त यात्रा की योजना बना रहे हैं।
  • ट्विस्ट: प्रत्येक बातचीत में एक "कास्ट लिस्ट" शामिल है जो बोलने वाले और सुनने वाले के लिंग (gender) को निर्दिष्ट करती है। अरबी में, आपके द्वारा उपयोग किए जाने वाले शब्द बदल जाते हैं, चाहे आप एक पुरुष से बात कर रहे हों या महिला से। अलेक्जेंड्रिया ने AI को इस सामाजिक नृत्य को सिखाया।

3. गुणवत्ता नियंत्रण (पीयर रिव्यू)

स्थानीय लोगों द्वारा स्क्रिप्ट का अनुवाद करने के बाद, उसी देश के अन्य स्थानीय लोगों के एक समूह ने उनकी समीक्षा की।

  • उपमा: इसे एक स्थानीय फिल्म महोत्सव की तरह समझें। यदि मोरक्को के किसी विशेष गाँव के अनुवादक ने एक पंक्ति लिखी, तो उसी गाँव के एक अन्य व्यक्ति ने इसकी जाँच की। उन्होंने पूछा: "क्या यह वैसा ही लगता है जैसा हम वास्तव में कहेंगे? या यह किसी पाठ्यपुस्तक जैसा लगता है?" यदि यह बनावटी लगा, तो उन्होंने इसे ठीक किया।

4. स्ट्रेस टेस्ट (मूल्यांकन)

एक बार जब डेटासेट तैयार हो गया, तो उन्होंने दुनिया के सबसे स्मार्ट AI मॉडल (जैसे जेमिनी, क्वेन और अन्य) पर इसे आजमाया यह देखने के लिए कि वे कैसा प्रदर्शन करते हैं।

  • परिणाम: AI मॉडल उन छात्रों की तरह थे जिन्होंने केवल पाठ्यपुस्तक का अध्ययन किया था।
    • अच्छी खबर: वे औपचारिक चीजों का अनुवाद करने में ठीक थे।
    • बुरी खबर: जब स्थानीय बोली में बोलने के लिए कहा गया, तो वे अक्सर या तो बहुत औपचारिक (stiff) लगे, या गलत लिंग रूपों का उपयोग किया, या वापस औपचारिक अरबी पर लौट आए।
    • सबसे बड़ी चुनौती: मॉडल मगरेबी बोलियों (मोरक्को, अल्जीरिया, ट्यूनीशिया, मॉरिटानिया) के साथ सबसे अधिक संघर्ष करते हैं, जो औपचारिक भाषा से बहुत अलग हैं, जो "आधिकारिक" प्रसारण की तुलना में लगभग एक पूरी तरह से अलग भाषा की तरह हैं।

यह क्यों महत्वपूर्ण है

अलेक्जेंड्रिया एक सेतु (bridge) है।
अभी, यदि आप यमन के ग्रामीण इलाके के किसान हैं या सूडान के एक छोटे क्लिनिक के डॉक्टर हैं, तो आपके पास उपलब्ध तकनीक आपके वास्तविक जीवन के लिए नहीं, बल्कि "आधिकारिक" भाषा के लिए बनी है। यह प्रोजेक्ट उस प्रशिक्षण डेटा को प्रदान करता है जिसकी आवश्यकता ऐसे AI को बनाने के लिए है जो आपको समझ सके।

यह सांस्कृतिक समावेश के बारे में है। यह सुनिश्चित करता है कि जब आप एक AI से बात करें, तो वह न केवल आपके शब्दों को समझे; बल्कि वह आपके संदर्भ, आपकी संस्कृति और आपकी आवाज़ को भी समझे।

संक्षेप में:
अलेक्जेंड्रिया वास्तविक जीवन की बातचीत का एक विशाल, समुदाय-निर्मित पुस्तकालय है जो AI को एक मैनुअल पढ़ने वाले रोबोट की तरह सुनाई देना बंद करने और एक पड़ोसी के साथ चैट करने वाले वास्तविक व्यक्ति की तरह सुनाई देने के लिए सिखाता है। यह ऐसी तकनीक बनाने की दिशा में एक महत्वपूर्ण कदम है जो वास्तव में पूरे अरब जगत के लिए काम करती है, न कि केवल अभिजात वर्ग या औपचारिक बोलने वालों के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →