NorBERTo: A ModernBERT Model Trained for Portuguese with 331 Billion Tokens Corpus
यह शोध पत्र NorBERTo को प्रस्तुत करता है, जो ब्राज़ीलियाई पुर्तगाली के लिए एक आधुनिक एनकोडर-ओनली मॉडल है जिसे 331 बिलियन टोकन के सबसे बड़े खुले रूप से उपलब्ध मोनोलिंगुअल कॉर्पस (Aurora-PT) पर प्रशिक्षित किया गया है, जो कई सिमेंटिक बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है और डाउनस्ट्रीम एनएलपी कार्यों के लिए एक कुशल, तैनात करने योग्य समाधान प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को पुर्तगाली भाषा समझना सिखाने की कोशिश कर रहे हैं। लंबे समय तक, सबसे अच्छे रोबोट उन छात्रों की तरह थे जिन्होंने कुछ अच्छी किताबें तो पढ़ ली थीं, लेकिन उन्होंने पूरी लाइब्रेरी नहीं देखी थी। यह शोध पत्र एक नए रोबोट NorBERTo और एक विशाल नई लाइब्रेरी Aurora-PT का परिचय देता है जो इसे सीखने में मदद करती है।
यहाँ बताया गया है कि उन्होंने यह कैसे किया, सरल शब्दों में:
1. समस्या: रोबोट को एक बड़ी लाइब्रेरी की ज़रूरत थी
इससे पहले, बेहतरीन पुर्तगाली भाषा वाले रोबोट (जैसे BERTimbau और Albertina) को लगभग 2 से 3 बिलियन "शब्दों" (टोकन्स) वाली लाइब्रेरी पर प्रशिक्षित किया गया था। हालांकि वे अच्छे थे, लेकिन यह ऐसा है जैसे किसी भाषा को कुछ उपन्यासों और एक शब्दकोश को पढ़कर सीखने की कोशिश करना।
लेखकों ने महसूस किया कि एक वास्तव में स्मार्ट रोबोट बनाने के लिए, उन्हें एक विशाल शहर के आकार की लाइब्रेरी की आवश्यकता थी। वे एक ऐसा रोबोट बनाना चाहते थे जो बिना किसी विशाल, महंगे सुपर-कंप्यूटर की मदद लिए ब्राज़ीलियाई पुर्तगाली की बारीकियों को समझ सके, जो अंतहीन कहानियाँ उत्पन्न करता है (जो अक्सर चीजें बना लेने या "भ्रमित" होने के प्रति प्रवृत्त होते हैं)।
2. नई लाइब्रेरी: Aurora-PT
टीम ने टेक्स्ट का एक बिल्कुल नया संग्रह बनाया।
- पैमाना: इसमें 331 बिलियन टोकन हैं। इसे समझने के लिए, यदि पुरानी लाइब्रेरी एक अकेली बुकशेल्फ़ थी, तो Aurora-PT एक पूरा गोदाम है। यह पुर्तगाली के लिए अपने प्रकार की सबसे बड़ी ओपन लाइब्रेरी है।
- सफाई: उन्होंने सब कुछ बस यूँ ही नहीं डाल दिया। उन्होंने सख्त पुस्तकालयाध्यक्षों की तरह काम किया, स्वचालित उपकरणों का उपयोग करके कचरा, डुप्लिकेट पेज और विषाक्त सामग्री को बाहर निकाल दिया। उन्होंने विकिपीडिया, ब्लॉग और वेब पेजों जैसे विविध स्रोतों से केवल उच्च-गुणवत्ता वाला, साफ टेक्स्ट रखा।
3. नया रोबोट: NorBERTo
इस विशाल लाइब्रेरी का उपयोग करके, उन्होंने NorBERTo नामक एक नया रोबोट प्रशिक्षित किया।
- डिज़ाइन: रोबोटों के लिए पुराने, मानक डिज़ाइन का उपयोग करने के बजाय, उन्होंने ModernBERT नामक एक आधुनिक ब्लूप्रिंट का उपयोग किया। इसे एक साइकिल से हाई-स्पीड इलेक्ट्रिक बाइक में अपग्रेड करने के रूप में सोचें। इसमें विशेष विशेषताएं हैं जो इसे भ्रमित हुए बिना लंबे वाक्यों को पढ़ने और जानकारी को तेज़ी से प्रोसेस करने में मदद करती हैं।
- आकार: उन्होंने दो संस्करण बनाए: एक "बेस" मॉडल (लगभग 150 मिलियन "मस्तिष्क कोशिकाएं" या पैरामीटर्स) और एक "लार्ज" मॉडल (लगभग 395 मिलियन)।
- प्रशिक्षण: उन्होंने रोबोट को केवल पुर्तगाली टेक्स्ट का उपयोग करके शुरू से सिखाया। उन्होंने अंग्रेजी के ज्ञान से शुरुआत करके कोई धोखाधड़ी नहीं की; उन्होंने शुद्ध रूप से Aurora-PT लाइब्रेरी से पुर्तगाली सीखी।
4. टेस्ट ड्राइव: इसका प्रदर्शन कैसा रहा?
टीम ने यह देखने के लिए कि NorBERTo पुराने चैंपियनों की तुलना में पुर्तगाली को कितनी अच्छी तरह समझता है, उसे कई ड्राइविंग टेस्ट (बेंचमार्क) से गुजारा।
- "तर्क" परीक्षण (टेक्स्टुअल एंटेलमेंट): कल्पना करें कि आप रोबोट को दो वाक्य दिखा रहे हैं और पूछ रहे हैं, "क्या दूसरा वाक्य तार्किक रूप से पहले वाक्य का अनुसरण करता है?"
- परिणाम: NorBERTo (Large) ने इस श्रेणी में जीत हासिल की, और पिछले सर्वश्रेष्ठ मॉडलों को पीछे छोड़ दिया। इसने साबित कर दिया कि आधुनिक डिज़ाइन + एक विशाल लाइब्रेरी = बेहतर तर्क।
- "अर्थ" परीक्षण (सिमेंटिक सिमिलैरिटी): कल्पना करें कि आप पूछ रहे हैं, "क्या ये दो वाक्य एक ही बात कह रहे हैं?"
- परिणाम: पुराने चैंपियन, BERTimbau ने यहाँ बढ़त बनाए रखी। लेखक बताते हैं कि ऐसा संभवतः इसलिए है क्योंकि BERTimbá ने अंग्रेजी प्रशिक्षण से एक शुरुआती बढ़त प्राप्त की थी, जबकि NorBERTo को शून्य से सब कुछ सीखना पड़ा।
- "पैराफ्रेस" परीक्षण (MRPC): क्या रोबोट यह बता सकता है कि क्या दो वाक्य केवल एक ही बात कहने के अलग-अलग तरीके हैं?
- परिणाम: NorBERTo (Large) ने प्रतियोगिता को बुरी तरह हरा दिया, और पुर्तगाली में इस विशिष्ट कार्य के लिए अब तक का उच्चतम स्कोर प्राप्त किया।
5. मुख्य निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि विशिष्ट कार्यों को अच्छी तरह से करने के लिए आपको एक विशाल, महंगे "सुपर-रोबोट" (जैसे कि कहानियाँ लिखने वाले विशाल AI मॉडल) की आवश्यकता नहीं है।
एक विशाल, साफ लाइब्रेरी (Aurora-PT) को एक आधुनिक, कुशल डिज़ाइन (ModernBERT) के साथ जोड़कर, उन्होंने एक "गोल्डिलॉक्स" रोबोट बनाया:
- यह बहुत छोटा नहीं है (यह पुराने मॉडलों से अधिक स्मार्ट है)।
- यह बहुत बड़ा नहीं है (यह विशाल AI की तुलना में चलाने में सस्ता और तेज़ है)।
- यह ईमेल सॉर्ट करने, ग्राहकों के सवालों को समझने, या सर्च इंजन को सही उत्तर खोजने में मदद करने जैसे वास्तविक दुनिया के कार्यों के लिए बिल्कुल सही है।
संक्षेप में: उन्होंने एक बड़ी, साफ लाइब्रेरी और एक स्मार्ट, अधिक कुशल रोबोट बनाया, यह साबित करते हुए कि पुर्तगाली को समझने के लिए, आपको कमरे में सबसे बड़ा AI होने की आवश्यकता नहीं है—आपको बस सही उपकरण और सही डेटा की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।