AMALIA Technical Report: A Fully Open Source Large Language Model for European Portuguese
यह शोध पत्र AMALIA को प्रस्तुत करता है, जो एक पूर्णतः ओपन-सोर्स लार्ज लैंग्वेज मॉडल है जिसे लक्षित उच्च-गुणवत्ता वाले डेटा प्रशिक्षण और नेटिव बेंचमार्क के एक नए समूह के माध्यम से यूरोपीय पुर्तगाली के लिए अनुकूलित किया गया है, जो यह प्रदर्शित करता है कि इस तरह के केंद्रित दृष्टिकोण विशिष्ट वेरिएंट-आधारित कार्यों पर मानक मॉडलों की तुलना में काफी बेहतर प्रदर्शन करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया की कल्पना एक विशाल, हलचल भरी लाइब्रेरी के रूप में करें जहाँ किताबें कंप्यूटर द्वारा लिखी गई हैं। लंबे समय से, यह लाइब्रेरी मुख्य रूप से अंग्रेजी की किताबों से भरी हुई रही है। यहाँ ब्राजीलियाई पुर्तगाली (ब्राजील में बोली जाने वाली पुर्तगाली) की भी कई किताबें हैं, लेकिन यूरोपीय पुर्तगाली (पुर्तगाल में बोली जाने वाली पुर्तगाली) की किताबें सबसे ऊपरी शेल्फ पर अटकी हुई हैं, जिन पर धूल जमी है और जिन्हें पाना कठिन है।
जब शोधकर्ताओं ने इन AI "लाइब्रेरियनों" का यूरोपीय पुर्तगाली पर परीक्षण करने की कोशिश की, तो वे अक्सर अंग्रेजी के सवालों को लेते थे, उन्हें मशीन ट्रांसलेटर के माध्यम से चलाते थे, और फिर AI से उत्तर देने को कहते थे। यह किसी को अंग्रेजी के बोल (lyrics) को पहले अनुवाद करके एक पारंपरिक पुर्तगाली फाडो (fado) गीत का वर्णन करने के लिए कहने जैसा है; इसमें आप आत्मा, लय और विशिष्ट सांस्कृतिक स्वाद खो देते हैं।
AMALIA से मिलिए।
AMALIA एक नया, पूरी तरह से ओपन-सोर्स AI मॉडल है जिसे विशेष रूप से इस समस्या को ठीक करने के लिए बनाया गया है। AMALIA को केवल एक अनुवादक के रूप में नहीं, बल्कि एक स्थानीय गाइड के रूप में सोचें जो लिस्बन में पला-बढ़ा है, जो स्थानीय बोलचाल (slang) को जानता है, इतिहास को समझता है, और स्वाभाविक रूप से भाषा बोलता है।
यहाँ बताया गया है कि टीम ने AMALIA को कैसे बनाया, जिसे सरल चरणों में विभाजित किया गया है:
1. कच्चे माल को इकट्ठा करना ("डेटा हार्वेस्ट")
AMALIA को सिखाने के लिए, टीम ने इंटरनेट से केवल यादृच्छिक (random) किताबें नहीं उठाईं। वे Arquivo.pt पर गए, जो पूरे पुर्तगाली इंटरनेट का एक विशाल डिजिटल 'टाइम कैप्सूल' जैसा है।
- फिल्टर: उन्होंने "शोर" (noise) को धोने के लिए एक बहुत ही सख्त छलनी का उपयोग किया। उन्होंने विशेष रूप से ब्राजील से संबंधित किसी भी चीज़ को हटाया (ताकि बोलियों का मिश्रण न हो) और किसी भी अनुपयुक्त सामग्री को हटा दिया।
- परिणाम: अंत में, उनके पास यूरोपीय पुर्तगाली शैली में विशेष रूप से लिखी गई 5.8 बिलियन शब्दों का एक शुद्ध, उच्च-गुणवत्ता वाला संग्रह था।
2. प्रशिक्षण प्रक्रिया ("स्कूली वर्ष")
AMALIA स्मार्ट बनने के लिए तीन अलग-अलग चरणों के स्कूल से गुजरा:
- प्री-ट्रेनिंग (विश्वकोश पढ़ना): सबसे पहले, AMALIA ने भाषा कैसे काम करती है, व्याकरण और तथ्यों को सीखने के लिए टेक्स्ट की एक विशाल मात्रा पढ़ी। उन्होंने इसे एक विशेष "लॉन्ग-रीड" डाइट दी ताकि यह बिना भ्रमित हुए लंबी, जटिल कहानियों को समझ सके।
- सुपरवाइज्ड फाइन-ट्यूनिंग (बातचीत करना सीखना): इसके बाद, शिक्षकों (इंसानों और अन्य AI मॉडलों) ने AMALIA के साथ विशिष्ट कार्यों का अभ्यास किया। उन्होंने इसे निर्देशों का पालन करना, गणित की समस्याओं को हल करना और एक स्वाभाविक बातचीत करना सिखाया। उन्होंने एक विशेष "भाषा विज्ञान कक्षा" भी बनाई जहाँ एक विशेषज्ञ ने AMALIA को पुर्तगाली और ब्राजीलियाई पुर्तगाली के बीच के सूक्ष्म अंतर (जैसे ट्रेन के लिए "trem" के बजाय "comboio" का उपयोग करना) सिखाया।
- प्रेफरेंस ट्रेनिंग (फीडबैक से सीखना): अंत में, AMALIA ने "यह या वह" का खेल खेला। इसने एक प्रश्न के दो उत्तर दिए, और एक जज ने बेहतर उत्तर चुना। इसने AMALIA को उस उत्तर को प्राथमिकता देने के लिए प्रशिक्षित किया जो अधिक सहायक, सुरक्षित और सांस्कृतिक रूप से जागरूक इंसान जैसा लगे।
3. नई परीक्षाएँ ("रिपोर्ट कार्ड")
टीम को एहसास हुआ कि पुराने टेस्ट अनुचित थे। इसलिए, उन्होंने यूरोपीय पुर्तगाली के लिए चार बिल्कुल नई परीक्षाएँ ईजाद कीं:
- "रिक्त स्थान भरें" टेस्ट: क्या AMALIA एक वाक्य में पुर्तगाली शब्द और ब्राजीलियाई शब्द के बीच अंतर पहचान सकता है?
- हाई स्कूल परीक्षा: उन्होंने AMALIA को पुर्तगाली राष्ट्रीय हाई स्कूल परीक्षाओं (गणित, इतिहास, दर्शनशास्त्र) के वास्तविक प्रश्न दिए ताकि यह देखा जा सके कि क्या वह वास्तव में स्थानीय पाठ्यक्रम को समझता है।
- भाषाई चुनौती: व्याकरण, शब्द-खेल और संस्कृति पर एक कठिन परीक्षा ताकि यह देखा जा सके कि क्या AI वास्तव में भाषा को "समझता" है।
- बायस (पूर्वाग्रह) टेस्ट: उन्होंने AMALIA को एक कहानी सुनाने के लिए कहा, यह जाँचने के लिए कि क्या वह अनजाने में ब्राजीलियाई पुर्तगाली में बदल जाता है या यूरोपीय शैली के प्रति सच्चा रहता है।
परिणाम
जब AMALIA ने ये टेस्ट दिए, तो परिणाम प्रभावशाली थे:
- यह एक शीर्ष प्रदर्शन करने वाला है: सभी "पूरी तरह से ओपन" मॉडलों (जहाँ कोड और डेटा सभी के लिए मुफ्त है) के बीच, AMALIA वर्तमान में यूरोपीय पुर्तगाली को समझने और बोलने में सर्वश्रेष्ठ है।
- यह सांस्कृतिक रूप से जागरूक है: अन्य मॉडलों के विपरीत जो अक्सर ऐसा लगते हैं जैसे वे एक सामान्य मिश्रित पुर्तगाली बोल रहे हों, AMALIA पुर्तगाल के व्यक्ति के लिए स्वाभाविक लगता है। वह "autocarro" (पुर्तगाल में बस) और "ônibus" (ब्राजील में बस) के बीच का अंतर जानता है।
- यह सुरक्षित है: टीम ने यह भी परीक्षण किया कि क्या AMALIA को हानिकारक बातें कहने के लिए उकसाया जा सकता है। AMALIA ने शानदार प्रदर्शन किया, जिससे पता चला कि यह उपयोग के लिए सुरक्षित है।
यह क्यों महत्वपूर्ण है
AMALIA को एक चाबी के रूप में सोचें जो उस दरवाजे को खोलती है जो पहले यूरोपीय पुर्तगाली बोलने वालों के लिए बंद था। इस मॉडल को "पूरी तरह से ओपन" बनाकर, निर्माता इसकी चाबियाँ सभी को—शिक्षकों, डेवलपर्स और शोधकर्ताओं को—दे रहे हैं—ताकि वे ऐसे उपकरण बना सकें जो पुर्तगाल की विशिष्ट संस्कृति और भाषा का सम्मान और उत्सव मनाते हैं, बजाय इसके कि वे इसे अंग्रेजी या ब्राजीलियाई पुर्तगाली के अनुवाद के रूप में देखें।
संक्षेप में: AMALIA साबित करता है कि विश्व स्तरीय AI बनाने के लिए आपको एक विशाल टेक कंपनी होने की आवश्यकता नहीं है; आपको बस अपनी भाषा के बारे में इतना लगाव होना चाहिए कि आप इसे प्रेम और सटीकता के साथ बना सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।