← नवीनतम पेपर
🤖 machine learning

MrBERT: Modern Multilingual Encoders via Vocabulary, Domain, and Dimensional Adaptation

यह शोधपत्र MrBERT को प्रस्तुत करता है, जो ModernBERT आर्किटेक्चर पर निर्मित कुशल, ओपन-सोर्स बहुभाषी एनकोडर का एक परिवार है, जो इन्फरेंस और स्टोरेज लागत को कम करने के लिए Matryoshka Representation Learning का लाभ उठाते हुए विशिष्ट भाषाओं और विशेष डोमेन में अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Daniel Tamayo, Iñaki Lacunza, Paula Rivera-Hidalgo, Severino Da Dalt, Javier Aula-Blasco, Aitor Gonzalez-Agirre, Marta Villegas

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daniel Tamayo, Iñaki Lacunza, Paula Rivera-Hidalgo, Severino Da Dalt, Javier Aula-Blasco, Aitor Gonzalez-Agirre, Marta Villegas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अत्यंत बुद्धिमान लाइब्रेरियन है जिसका नाम Mr. BERT है। इस लाइब्रेरियन ने 35 अलग-अलग भाषाओं में दुनिया की लगभग हर चीज़ पढ़ी है। वह उत्तर खोजने में बहुत कुशल है, लेकिन वह थोड़ा "जैक ऑफ ऑल ट्रेड्स, मास्टर ऑफ नन" (हर काम में हाथ आज़माने वाला, पर किसी में माहिर नहीं) भी है। वह सब कुछ के बारे में थोड़ा-बहुत जानता है, लेकिन यदि आप उससे किसी दुर्लभ चिकित्सा स्थिति या स्पेनिश में किसी जटिल कानूनी अनुबंध के बारे में बहुत विशिष्ट प्रश्न पूछते हैं, तो वह एक सामान्य उत्तर दे सकता है जो बारीकियों को छोड़ देता है।

यह पेपर MrBERT को पेश करता है, जो विशेष कार्यों के लिए डिज़ाइन किए गए लाइब्रेरियन का एक नया परिवार है। उन्होंने इसे ठीक करने के लिए आधुनिक, हाई-स्पीड "ModernBERT" आर्किटेक्चर (सोचिए कि आपने लाइब्रेरियन के मस्तिष्क को एक सुपरकंप्यूटर में अपग्रेड कर दिया है) लिया और उन्हें तीन विशेष अपग्रेड दिए ताकि वे विशिष्ट कार्यों के लिए एकदम सही बन सकें।

यहाँ बताया गया है कि उन्होंने इसे रोज़मर्रा के उपमाओं (analogies) का उपयोग करके कैसे किया:

1. शब्दावली अपग्रेड (द "स्पेशलाइज्ड डिक्शनरी")

समस्या: मूल Mr. BERT एक ऐसे शब्दकोश का उपयोग करता है जिसमें "सेब" से लेकर "क्वांटम फिजिक्स" तक के 50,000 शब्द शामिल हैं। लेकिन एक स्पेनिश वक्ता के लिए, यह शब्दकोश बहुत बड़ा और बोझिल है। यह ऐसा है जैसे किसी ऐसी भाषा में उपन्यास पढ़ने की कोशिश करना जहाँ हर शब्द एक पैराग्राफ के बराबर हो।

समाधान: टीम ने MrBERT-es (स्पेनिश के लिए) और MrBERT-ca (कैटलन के लिए) बनाया। उन्होंने उस विशाल, सामान्य शब्दकोश को हटाकर एक कस्टम-टेलर, कॉम्पैक्ट शब्दकोश से बदल दिया जिसमें केवल वे शब्द और वाक्यांश शामिल हैं जिनका इन विशिष्ट भाषाओं में सबसे अधिक उपयोग किया जाता है।

  • उपमा: कल्पना कीजिए कि एक शेफ जो आमतौर पर एक विशाल अंतरराष्ट्रीय बुफे के लिए खाना पकाता है। बार्सिलोना में एक छोटा, हाई-एंड बिस्ट्रो चलाने के लिए, उन्हें 5,000 सामग्रियों की आवश्यकता नहीं है; उन्हें एक छोटी, तेज़ चाकू और स्थानीय, उच्च गुणवत्ता वाली सामग्रियों की एक चुनिित सूची की आवश्यकता है।
  • परिणाम: ये छोटे मॉडल (300 मिलियन के बजाय 150 मिलियन "ब्रेन सेल्स") स्पेनिश और कैटलन में विशाल संस्करण की तुलना में वास्तव में अधिक स्मार्ट हैं क्योंकि वे उन शब्दों पर ऊर्जा बर्बाद नहीं कर रहे हैं जिनकी उन्हें ज़रूरत नहीं है। वे तेज़ हैं, चलाने में सस्ते हैं, और अधिक सटीक हैं।

2. डोमेन विशेषज्ञता (द "मेडिकल एंड लॉ स्कूल")

समस्या: कभी-कभी आपको लाइब्रेरियन को डॉक्टर या वकील बनाने की आवश्यकता होती है। एक सामान्य लाइब्रेरियन को पता हो सकता है कि "हार्ट अटैक" क्या है, लेकिन वह मेडिकल रिपोर्ट में "एक्यूट मायोकार्डियल इन्फार्क्शन" और "स्टेबल एंजाइना" के बीच अंतर नहीं जान पाएगा। इसी तरह, उसे पता हो सकता है कि "अनुबंध" (contract) क्या है, लेकिन स्पेनिश अदालत के फैसले की विशिष्ट कानूनी शब्दावली का ज्ञान नहीं होगा।

समाधान: टीम ने मुख्य Mr. BERT को लिया और उसे विशेष प्रशिक्षण शिविरों (कंटीन्यूड प्री-ट्रेनिंग) में भेजा।

  • मेडिकल कैंप: उन्होंने उसे लाखों मेडिकल पेपर्स और क्लिनिकल नोट्स खिलाए।
  • लॉ कैंप: उन्होंने उसे हजारों कानूनी कोड, अदालती फैसलों और अनुबंधों से प्रशिक्षित किया।
  • उपमा: यह एक प्रतिभाशाली जनरल प्रैक्टिशनर को लेने और उन्हें कार्डियोलॉजी में 2 साल की रेजिडेंसी के लिए भेजने जैसा है। वे यह नहीं भूलते कि वे एक डॉक्टर हैं; वे बस कार्डियोलॉजी में विश्व-स्तरीय बन जाते हैं।
  • परिणाम: ये विशिष्ट मॉडल (MrBERT-biomed और MrBERT-legal) अब जटिल चिकित्सा या कानूनी दस्तावेजों को पढ़ सकते हैं और मौजूदा किसी भी विशेष AI की तुलना में बेहतर तरीके से सटीक जानकारी ढूंढ सकते हैं।

3. मात्रोशका डॉल ट्रिक (द "रशियन नेस्टिंग डॉल्स")

समस्या: वास्तविक दुनिया में, आपके पास हमेशा सुपरकंप्यूटर नहीं होता। कभी-कभी आप फोन पर एक ऐप चला रहे होते हैं, या आपके पास एक विशाल डेटाबेस होता है जहाँ आपको पलक झपकते ही लाखों दस्तावेज़ों को खोजना होता है। एक पूर्ण-आकार का मॉडल इन कार्यों के लिए बहुत भारी और धीमा होता है।

समाधान: उन्होंने Matryoshka Representation Learning नामक तकनीक लागू की।

  • उपमा: एक रूसी नेस्टिंग डॉल (Matryoshka) के बारे में सोचें। सबसे बड़ी गुड़िया में पूरी, विस्तृत तस्वीर होती है। लेकिन इस गुड़िया के अंदर एक थोड़ी छोटी गुड़िया है, और उसके अंदर एक और छोटी गुड़िया है, और इसी तरह।
    • बड़ी गुड़िया (100%): पूर्ण मॉडल। इसमें सभी विवरण हैं। उच्च-जोखिम वाले निर्णयों के लिए बेहतरीन है, लेकिन धीमी और भारी है।
    • मध्यम गुड़िया (50%): आप गुड़िया का ऊपरी आधा हिस्सा काट सकते हैं। यह छोटी और तेज़ है, और इसमें अभी भी सबसे महत्वपूर्ण विवरण मौजूद हैं।
    • छोटी गुड़िया (25%): आप इसे बहुत छोटे आकार तक सिकोड़ सकते हैं। यह अविश्वसनीय रूप से तेज़ है और बहुत कम जगह लेती है, लेकिन फिर भी इसे उत्तर का "सार" पता होता है।
  • परिणाम: आप स्थिति के आधार पर तय कर सकते हैं कि "मस्तिष्क" को कितना बड़ा या छोटा होना चाहिए। यदि आप एक विशाल कानूनी डेटाबेस खोज रहे हैं, तो आप त्वरित उम्मीदवारों की सूची प्राप्त करने के लिए "टाइनी डॉल" का उपयोग कर सकते हैं, और फिर विस्तृत रूप से शीर्ष परिणामों को पढ़ने के लिए "बिग डॉल" का उपयोग कर सकते हैं। इससे बहुत सारे पैसे और समय की बचत होती है।

यह क्यों मायने रखता है?

पेपर दिखाता है कि शानदार परिणाम प्राप्त करने के लिए आपको हमेशा एक विशाल, महंगी AI की आवश्यकता नहीं होती है।

  • भाषाओं के लिए: "शब्दावली" को कस्टमाइज़ करके, उन्होंने छोटे, तेज़ मॉडल बनाए जो विशाल मॉडलों की तुलना में स्पेनिश और कैटलन में वास्तव में बेहतर हैं।
  • विशेष कार्यों के लिए: विशिष्ट डेटा पर प्रशिक्षित करके, उन्होंने उन्हें चिकित्सा और कानून में विशेषज्ञ बनाया।
  • वास्तविक जीवन के लिए: "मात्रोशका" ट्रिक का उपयोग करके, उन्होंने इन मॉडलों को इतना लचीला बना दिया कि वे अपनी बुद्धिमत्ता खोए बिना शक्तिशाली सर्वरों से लेकर मोबाइल फोन तक सब कुछ चलाने के लिए उपयुक्त हैं।

संक्षेप में: MrBERT साबित करता है कि AI का भविष्य केवल बड़े मॉडल बनाने के बारे में नहीं है; यह सही काम के लिए सही मॉडल बनाने के बारे में है, चाहे वह फोन के लिए एक छोटा, तेज़ मॉडल हो या अस्पताल के लिए एक विशेष विशेषज्ञ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →