Language Models for Portuguese: A Systematic Mapping Study
यह शोध पत्र पुर्तगाली के लिए विकसित 46 भाषा मॉडलों का एक व्यवस्थित मैपिंग अध्ययन प्रस्तुत करता है, जो क्षेत्र में भविष्य की प्रगति का मार्गदर्शन करने के लिए उनकी तकनीकी विशेषताओं, विकासवादी संबंधों और वर्तमान अनुसंधान अंतराल का एक व्यापक अवलोकन प्रदान करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरी लाइब्रेरी है जहाँ हर किताब एक अलग भाषा में लिखी गई है। लंबे समय तक, इस लाइब्रेरी के सबसे स्मार्ट कंप्यूटर—जो इंसानों की तरह पढ़, लिख और बात कर सकते हैं—ज्यादातर अंग्रेजी किताबों पर प्रशिक्षित थे। वे अंग्रेजी में अविश्वसनीय रूप रूप से कुशल हो गए, लेकिन जब आपने उनसे अन्य देशों की कहानियों के बारे में पूछा, तो वे अक्सर लड़खड़ा गए, भ्रमित हो गए, या बस मनगढ़ंत बातें बनाने लगे। ऐसा इसलिए था क्योंकि इन कंप्यूटरों का "मस्तिष्क" उन शब्दों से बना है जो उन्होंने पढ़े हैं; यदि उन्होंने किसी विशिष्ट भाषा में पर्याप्त किताबें नहीं पढ़ी हैं, तो वे उन शब्दों के पीछे की संस्कृति, चुटकुलों या इतिहास को वास्तव में नहीं समझ सकते। हाल ही में, वैज्ञानिकों ने विशेष रूप से पुर्तगाली भाषा के लिए विशेष कंप्यूटर बनाना शुरू किया है, जो ब्राजील, पुर्तगाल और अफ्रीका तथा एशिया के कुछ हिस्सों में करोड़ों लोगों द्वारा बोली जाती है। लेकिन एक बिखरी हुई किताबों वाली लाइब्रेरी की तरह, इन नए पुर्तगाली कंप्यूटरों के बारे में जानकारी अव्यवस्थित, छिपी हुई और अलग-अलग जगहों पर है, जिसे एक साथ ढूंढना कठिन है।
यह पेपर एक सुपर-ऑर्गनाइज्ड लाइब्रेरियन की तरह है जो पुर्तगाली अनुभाग की पूरी सफाई करने का निर्णय लेता है। लेखक, जो ब्राजील के एक विश्वविद्यालय की एक टीम है, ने 2020 और 2025 के बीच प्रकाशित प्रत्येक पुर्तगाली भाषा मॉडल को खोजने के लिए एक व्यापक खोज की। उन्होंने केवल उन्हें गिना नहीं; उन्होंने बक्सों को खोला, मैनुअल की जांच की, और यह समझने की कोशिश की कि उन्हें कैसे बनाया गया था, उन्हें क्या सिखाया गया था, और क्या वास्तव में कोई उनका उपयोग कर सकता है। उन्हें 46 अलग-अलग मॉडल मिले, जो सामान्य चैटबॉट्स से लेकर उन विशेषज्ञों तक फैले हुए हैं जो केवल कानून, चिकित्सा, या तेल और गैस के बारे में बात करते हैं। उनकी बड़ी खोज? हालांकि बहुत अधिक रोमांचक प्रगति हो रही है, लेकिन "लाइब्रेरी" अभी भी थोड़ी अराजक है। कई मॉडल ऐसे हैं जैसे गुप्त रेसिपी जिन्हें केवल शेफ ही जानता है (कोड साझा नहीं किया गया है), कुछ को अनुवादित किताबों का उपयोग करके सिखाया गया था जो स्थानीय स्वाद को पूरी तरह से नहीं पकड़ पाते, और बहुत कम मॉडलों की यह जांच की गई है कि क्या वे निष्पक्ष या उपयोग के लिए सुरक्षित हैं। लेखक सुझाव देते हैं कि इन कंप्यूटरों को पुर्तगाली बोलने वाले हर किसी के लिए वास्तव में उपयोगी बनाने के लिए, हमें अनुवादों पर निर्भर करना बंद करना होगा, अपने ब्लूप्रिंट को अधिक खुले रूप से साझा करना होगा, और यह सुनिश्चित करना होगा कि कंप्यूटर भाषा की समृद्ध विविधता को समझे, न कि केवल उसके सबसे लोकप्रिय संस्करण को।
द ग्रेट पुर्तगाली मॉडल हंट (The Great Portuguese Model Hunt)
आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया को एक विशाल निर्माण स्थल के रूप में सोचें। वर्षों तक, सबसे बड़े, प्रभावशाली गगनचुंबी इमारतें अंग्रेजी ईंटों का उपयोग करके बनाई गई थीं। ये "लार्ज लैंग्वेज मॉडल्स" (LLMs) हैं, वे स्मार्ट कंप्यूटर जो निबंध लिख सकते हैं, सवालों के जवाब दे सकते हैं, और यहाँ तक कि कोड भी लिख सकते हैं। लेकिन इस साइट के श्रमिकों को एहसास हुआ कि यदि आप केवल अंग्रेजी ईंटों से निर्माण करते हैं, तो आप ऐसा घर नहीं बना सकते जो पुर्तगाली बोलने वाले व्यक्ति के लिए घर जैसा महसूस हो। इसलिए, 2020 और 2025 के बीच, निर्माताओं की एक नई लहर ने विशेष रूप से पुर्तगाली बोलने वालों के लिए घर बनाना शुरू किया।
समस्या यह थी कि ये नए घर पूरे मानचित्र पर बिखरे हुए थे। कुछ को शानदार वैज्ञानिक जर्नल्स में वर्णित किया गया था, कुछ केवल एक वेबसाइट पर नोट्स थे, और कुछ तकनीकी रिपोर्टों में छिपे हुए थे जिन्हें कोई पढ़ता नहीं था। यह एक ऐसे कमरे में एक विशिष्ट खिलौने को खोजने की कोशिश करने जैसा था जहाँ खिलौने अलग-अलग ढेरों में फेंके गए थे, जिनमें से कुछ लेबल किए गए थे और कुछ नहीं। इस पेपर के लेखकों ने कमरे को व्यवस्थित करने का निर्णय लिया। उन्होंने एक "सिस्टमैटिक मैपिंग स्टडी" की, जो एक फैंसी तरीका है यह कहने का कि उन्होंने प्रत्येक पुर्तगाली भाषा मॉडल की एक मास्टर सूची बनाई जिसे वे खोज सकते थे।
उन्हें कुल 46 मॉडल मिले। यह बहुत सारे अलग-अलग कंप्यूटर हैं! उन्होंने संग्रहकर्ताओं की तरह स्टैम्प छाँटने वाले की तरह उन्हें छाँटा। उन्होंने देखा कि प्रत्येक का "बेस मॉडल" क्या था (जैसे कि क्या इसे BERT, Llama, या T5 के आधार पर बनाया गया था), इसे क्या करने के लिए डिज़ाइन किया गया था (सामान्य चैटिंग, कानूनी सलाह, चिकित्सा निदान, या ट्वीट्स का विश्लेषण करना), और यह कितना बड़ा था (12 मिलियन पैरामीटर्स वाले छोटे मॉडलों से लेकर 72 बिलियन वाले विशाल मॉडलों तक)।
पुर्तगाली AI का "फैमिली ट्री" (The "Family Tree" of Portuguese AI)
लेखकों ने जो सबसे कूल काम किया, वह था एक "फाइलोजेनेटिक ट्री" (phylogenetic tree) बनाना। एक फैमिली ट्री की कल्पना करें। यह मनुष्यों के उनके दादा-दादा से संबंध दिखाने के बजाय, यह दिखाता है कि ये AI मॉडल अपने "माता-पिता" से कैसे संबंधित हैं।
उन्होंने पाया कि अधिकांश पुर्तगाली मॉडल कुछ प्रसिद्ध "पूर्वज" मॉडलों के वंशज हैं। सबसे बड़ा पारिवारिक शाखा BERT से आती है, जो इनमें से कई मॉडलों का परदादा है; उनके द्वारा पाए गए 46 में से 20 मॉडल सीधे BERT या उसके चचेरे भाइयों पर आधारित थे। दूसरा सबसे बड़ा परिवार Llama परिवार है, जो एक नया, ट्रेंडी पूर्वज है जिस पर 10 मॉडल आधारित हैं।
यह पेड़ यह भी दिखाता है कि ये मॉडल कैसे विकसित हुए। कुछ सामान्य उद्देश्यों के लिए शुरू हुए (सब कुछ करने में अच्छे) और फिर विशिष्ट क्षेत्रों में विशेषज्ञ बनने के लिए विशेष प्रशिक्षण प्राप्त किया। उदाहरण के लिए, एक शाखा है जहाँ एक मॉडल एक सामान्य पाठक के रूप में शुरू हुआ, फिर मेडिकल टेक्स्टबुक पढ़कर वह एक "CardioBERTpt" (एक हृदय डॉक्टर AI) बन गया, और फिर एक अन्य संस्करण ने कानूनी दस्तावेजों का अध्ययन किया और "JurisBERT" (एक वकील AI) बन गया। यह एक छात्र की तरह है जो सामान्य स्कूल में शुरू करता है और फिर डॉक्टर या वकील बनने के लिए विशेष कॉलेजों में जाता है।
"ओपन डोर" की समस्या (The "Open Door" Problem)
लेखकों ने इन 46 घरों के दरवाजों की भी जांच की कि क्या कोई अंदर जा सकता है। उन्होंने तीन चीजों की तलाश की:
- कोड: क्या आप ब्लूप्रिंट देख सकते हैं?
- मॉडल: क्या आप बने-बनाए कंप्यूटर मस्तिष्क को डाउनलोड कर सकते हैं?
- डेटा: क्या आप उन किताबों को देख सकते हैं जिन पर कंप्यूटर को प्रशिक्षित किया गया था?
यहाँ समाचार थोड़ा मिला-जुला है। 46 मॉडलों में से केवल 11 के सोर्स कोड (ब्लूप्रिंट) सभी के देखने के लिए उपलब्ध थे। लगभग 5 मॉडल पूरी तरह से बंद थे—आप उन्हें बिल्कुल भी उपयोग नहीं कर सकते थे। और ट्रेनिंग डेटा (किताबों) के लिए, केवल 17 मॉडलों ने ऐसे डेटा का उपयोग किया जो मुफ्त में डाउनलोड के लिए उपलब्ध था। बाकी ने ऐसे डेटा का उपयोग किया जो या तो पेवॉल (paywall) के पीछे छिपा हुआ था, जिसके लिए विशेष अनुमति मांगनी पड़ती थी, या जिसे बनाने वाली कंपनी ने गुप्त रखा था।
लेखकों ने यह भी जांचा कि क्या इन मॉडलों के साथ एक "मॉडल कार्ड" (Model Card) आया है, जो AI के लिए पोषण लेबल (nutrition label) की तरह है। यह आपको बताता है कि मॉडल किस काम में अच्छा है, किसमें बुरा है, और क्या इसमें कोई पूर्वाग्रह है। चौंकाने वाली बात यह है कि 46 में से केवल 3 मॉडलों के पास पूर्ण, सटीक पोषण लेबल था। अधिकांश के पास आधे-अधूरे लेबल थे, और 10 के पास कोई लेबल ही नहीं था। इसका मतलब है कि यदि आप इन मॉडलों का उपयोग करते हैं, तो आपको पता नहीं चलेगा कि आप वास्तव में किस चीज़ में उतर रहे हैं।
"ट्रांसलेशन ट्रैप" और गायब आवाजें (The "Translation Trap" and Missing Voices)
सबसे महत्वपूर्ण निष्कर्षों में से एक यह है कि इन मॉडलों ने कैसे बोलना सीखा। लेखकों ने देखा कि कई मॉडलों को अंग्रेजी से पुर्तगाली में अनुवादित किताबों का उपयोग करके सिखाया गया था। कल्पना कीजिए कि आप न्यूयॉर्क में लिखी गई किताब को शब्द-दर-शब्द अनुवाद करके ब्राजीलियाई संस्कृति के बारे में सीखने की कोशिश कर रहे हैं। आप व्याकरण सही कर लेंगे, लेकिन आप स्थानीय मुहावरों, चुटकुलों और स्थानीय भावनाओं को मिस कर देंगे।
पेपर सुझाव देता है कि अनुवादित डेटा पर निर्भर रहना एक समस्या है। इसका मतलब है कि ये मॉडल ब्राजील, पुर्त kerja या अफ्रीका के पुर्तगाली बोलने वालों की अनूठी सांस्कृतिक बारीकियों को नहीं समझ सकते। इसके अलावा, लेखक बताते हैं कि लगभग सभी मॉडल केवल दो संस्करणों पर ध्यान केंद्रित करते हैं: ब्राजीली पुर्तगाली और यूरोपीय पुर्तगाली। उन्होंने उन अन्य सात देशों की पूरी तरह से अनदेखी की जहाँ पुर्तगाली एक आधिकारिक भाषा है, जैसे अंगोला, मोजाम्बिक और केप वर्डे। लेखक तर्क देते हैं कि यह "भाषाई पूर्वाग्रह" का एक रूप है—यह मान लेना कि सिर्फ इसलिए कि एक मॉडल ब्राजीली और यूरोपीय पुर्तगाली बोलता है, वह सभी के लिए बोल सकता है जो उस भाषा को बोलते हैं। वे सुझाव देते हैं कि भविष्य के मॉडलों को ऐसे डेटा पर प्रशिक्षित करने की आवश्यकता है जो वास्तव में सभी पुर्तगाली भाषी राष्ट्रों की विविधता का प्रतिनिधित्व करता हो।
आगे क्या? (What's Next?)
लेखक निष्कर्ष निकालते हैं कि हालांकि हमने काफी प्रगति की है, लेकिन हमें अभी भी एक लंबा रास्ता तय करना है। वे सुझाव देते हैं कि पुर्तगाली AI की अगली पीढ़ी को:
- अनुवादित डेटा का उपयोग करना बंद करना चाहिए और दुनिया भर की वास्तविक, मूल पुर्तगाली किताबों और बातचीत का उपयोग करना चाहिए।
- अपने ब्लूप्रिंट (कोड) साझा करने चाहिए ताकि अन्य वैज्ञानिक उनके काम की जांच कर सकें और उसमें सुधार कर सकें।
- अधिक आवाजों को शामिल करना चाहिए जो अफ्रीकी और एशियाई पुर्तगाली वक्ताओं की हों, न कि केवल ब्राजील और पुर्तगाल की।
- अधिक इंद्रियां जोड़नी चाहिए। अभी, अधिकांश मॉडल केवल टेक्स्ट समझते हैं। लेखक विशेष रूप से पुर्तगाली के लिए मल्टीमॉडल मॉडल (multimodal models) बनाने के बड़े अवसर देखते हैं जो छवियों और ध्वनियों को भी समझ सकें (जैसे एक कंप्यूटर जो ब्राजीली सड़क की तस्वीर देख सके और स्थानीय भाषा में उसका वर्णन कर सके)।
संक्षेप में, पुर्तगाली AI की लाइब्रेरी तेजी से बढ़ रही है, लेकिन इसे वास्तव में भाषा बोलने वाले लाखों लोगों की सेवा करने के लिए बेहतर संगठन, अधिक खुले दरवाजे और आवाजों की अधिक विविधता की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।