← नवीनतम पेपर
💬 NLP

moBERTo: A Modern Encoder for Portuguese via Continued Pretraining of ModernBERT

यह शोध पत्र moBERTo को प्रस्तुत करता है, जो एक उच्च-प्रदर्शन वाला पुर्तगाली एनकोडर-ओनली मॉडल है जिसे 60 बिलियन टोकन पर ModernBERT के प्रीट्रेनिंग को जारी रखकर बनाया गया है, जो रिट्रीवल, क्लासिफिकेशन और NER कार्यों में अत्याधुनिक परिणाम प्राप्त करता है और साथ ही लॉन्ग-कॉन्टेक्स्ट क्षमताओं को बनाए रखने के लिए स्क्रैच से प्रशिक्षण के बजाय निरंतर प्रीट्रेनिंग की श्रेष्ठता को प्रदर्शित करता है।

मूल लेखक: Thiago Laitz, Thales Sales Almeida, João Guilherme Alves Santos, Giovana Kerche Bonás

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thiago Laitz, Thales Sales Almeida, João Guilherme Alves Santos, Giovana Kerche Bonás

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, उच्च शिक्षित लाइब्रेरियन है जो उत्तम अंग्रेजी बोलता है और जिसने 2 ट्रिलियन किताबें पढ़ी हैं। यह लाइब्रेरियन अविश्वसनीय रूप से तेज़ है, लंबी कहानियों को बिना भ्रमित हुए याद रख सकता है, और विषयों के आधार पर किताबें खोजने या उन्हें छाँटने में माहिर है। हालाँकि, उसे पुर्तगाली भाषा का एक शब्द भी नहीं आता।

यह शोध पत्र moBERTo का परिचय देता है, जो एक ऐसा प्रोजेक्ट है जो इस अंग्रेजी बोलने वाले लाइब्रेरियन को पुर्तगाली भाषा का एक क्रैश कोर्स कराता है ताकि वह एक ब्राजीलियाई लाइब्रेरी में प्रभावी ढंग से काम कर सके।

उन्होंने यह कैसे किया और उन्हें क्या मिला, इसका सरल विवरण यहाँ दिया गया है:

1. रणनीति: "कंटीन्यूड प्रीट्रेनिंग" (शुरुआत से शुरू न करें)

एक नया लाइब्रेरियन नियुक्त करने और उसे सब कुछ शुरू से सिखाने के बजाय (जिसमें बहुत समय और पैसा खर्च होता), टीम ने मौजूदा अंग्रेजी विशेषज्ञ को 60 बिलियन पुर्तगाली शब्द (लगभग 5 साल की पढ़ने की सामग्री) खिलाए।

  • उपमा: इसे ऐसे समझें जैसे किसी मास्टर शेफ को, जो फ्रांसीसी व्यंजनों को पूरी तरह से जानता है, पुर्तगाली कुकबुक्स का एक विशाल ढेर पढ़ने के लिए दिया जाए। वह खाना बनाना नहीं भूलता; वह बस यह सीखता है कि नए अवयवों (ingredients) के साथ अपने कौशल का उपयोग कैसे करना है।
  • परिणाम: यह एक नए मॉडल को शुरू से प्रशिक्षित करने की तुलना में बहुत बेहतर था। "पुराने" लाइब्रेरियन ने अपनी महाशक्तियाँ (जैसे लंबी कहानियों को याद रखना) बरकरार रखीं और साथ ही नई भाषा भी सीख ली।

2. टूलकिट: आधुनिक अपग्रेड

जिस लाइब्रेरियन से उन्होंने शुरुआत की थी, वह कोई साधारण मॉडल नहीं था; उन्होंने ModernBERT का उपयोग किया था। यह क्लासिक लाइब्रेरी असिस्टेंट का एक "अगली पीढ़ी" वाला संस्करण है।

  • पुराने लाइब्रेरियन (जैसे BERTimbau): वे भ्रमित होने से पहले केवल 512 शब्द पढ़ सकते थे। वे वाक्य में अपनी जगह याद रखने के लिए पुराने, बोझिल तरीकों का उपयोग करते थे।
  • moBERTo: यह बिना अपनी जगह खोए एक बार में 8,192 शब्द पढ़ सकता है। यह लंबे दस्तावेज़ों को सहजता से संभालने के लिए "फ्लैश" गति और स्मार्ट अटेंशन स्पैन का उपयोग करता है।

3. प्रयोग: विभिन्न शिक्षण विधियों को आजमाना

शोधकर्ताओं ने लाइब्रेरियन को पुर्तगाली सिखाने के लिए कई अलग-अलग तरीके आजमाए ताकि यह देखा जा सके कि क्या सबसे अच्छा काम करता है:

  • विधि A: "मूल शब्दकोश" (Original Tokenizer)
    उन्होंने लाइब्रेरियन को मूल अंग्रेजी शब्दकोश का उपयोग करके सिखाया, बस जहाँ फिट बैठता था वहाँ पुर्तगाली शब्दों को शामिल कर दिया।

    • परिणाम: यह लंबे दस्तावेज़ों को पढ़ने के लिए आश्चर्यजनक रूप से अच्छा रहा क्योंकि लाइब्रेरियन का "मेमोरी मैप" सुरक्षित रहा।
  • विधि B: "नया शब्दकोश" (Portuguese Tokenizer)
    उन्होंने लाइब्रेरियन को एक बिल्कुल नया शब्दकोश दिया जो विशेष रूप से पुर्तगाली के लिए बनाया गया था।

    • परिणाम: यह वाक्य में नाम पहचानने (Named Entity Recognition) या छोटे वाक्यों को समझने जैसे छोटे कार्यों के लिए बहुत अच्छा था। हालाँकि, बहुत लंबे टेक्स्ट पढ़ते समय इसने लाइब्रेरियन को भ्रमित कर दिया, जिससे वह अपनी जगह खो देता था।
  • विधि C: "हाइब्रिड ब्रिज" (Subword-Matching)
    यही विजेता रणनीति थी। उन्होंने एक नया पुर्तगाली शब्दकोश बनाया लेकिन नए शब्दों को लाइब्रेरियन की पुरानी अंग्रेजी मेमोरी से जोड़ने के लिए एक विशेष "ब्रिज" का उपयोग किया।

    • परिणाम: इसने दोनों दुनियाओं का सर्वश्रेष्ठ संयोजन दिया। लाइब्रेरियन पुर्तगाली बारीकियों को भी समझ सकता था और अपनी लंबी-मेमोरी वाली महाशक्तियों को भी बनाए रख सकता था।

4. परिणाम: कौन जीता?

टीम ने विभिन्न कार्यों के लिए moBERTo का परीक्षण किया, जैसे विशिष्ट दस्तावेज़ खोजना, समाचार लेखों को छाँटना और टेक्स्ट में नाम पहचानना।

  • चैंपियन: moBERTo-SWM-8k मॉडल (वह मॉडल जिसमें "हाइब्रिड ब्रिज" और अतिरिक्त लंबी-कहानी प्रशिक्षण था) स्पष्ट विजेता था।
    • इसने प्रासंगिक दस्तावेज़ खोजने में पिछले चैंपियन (BERTimbau) को पछाड़ दिया।
    • यह पुर्तगाली टेक्स्ट के अर्थ को समझने में सर्वश्रेष्ठ था।
    • यह वाक्यों में नाम और स्थानों को पहचानने में उत्कृष्ट था।
  • लंबी कहानी का सरप्राइज: भले ही लाइब्रेरियन को मुख्य रूप से छोटी कहानियों (1,024 शब्द) पर प्रशिक्षित किया गया था, फिर भी वह अन्य किसी भी पुर्तगाली मॉडल की तुलना में बड़े 8,000-शब्दों के दस्तावेज़ों को बेहतर ढंग से पढ़ और समझ सकता था। इसने साबित कर दिया कि "आधुनिक" आर्किटेक्चर बहुत शक्तिशाली है।

5. निष्कर्ष (Takeaway)

शोध पत्र निष्कर्ष निकालता है कि पुर्तगाली में शानदार परिणाम प्राप्त करने के लिए आपको शून्य से एक विशाल, महंगी मॉडल बनाने की आवश्यकता नहीं है। एक आधुनिक, कुशल अंग्रेजी मॉडल को लेकर और उसे बहुत सारी अच्छी पुर्तगाली डेटा के साथ "फाइन-ट्यून" करके, आप एक ऐसा मॉडल प्राप्त करते हैं जो:

  1. बड़े चैटबॉट्स की तुलना में चलाने में तेज़ और सस्ता है।
  2. पुराने पुर्तगाली मॉडलों की तुलना में जानकारी खोजने और टेक्स्ट को समझने में अधिक स्मार्ट है।
  3. रास्ता भटके बिना बहुत लंबे दस्तावेज़ों को पढ़ने में सक्षम है।

टीम ने अपना "लाइब्रेरियन" (मॉडल वेट्स) और अपनी "लाइब्रेरी बुक्स" (प्रशिक्षण डेटा) सभी के लिए साझा कर दी है, ताकि पुर्तगाली भाषी दुनिया में हर कोई बेहतर AI उपकरण बनाने में मदद मिल सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →