← नवीनतम पेपर
💬 NLP

EuroBERT: Scaling Multilingual Encoders for European Languages

यह शोधपत्र यूरोबर्ट (EuroBERT) प्रस्तुत करता है, जो यूरोपीय और वैश्विक भाषाओं को कवर करने वाले बहुभाषी एनकोडर्स का एक परिवार है, जो विविध कार्यों में मौजूदा विकल्पों से बेहतर प्रदर्शन करने के लिए हालिया जनरेटिव मॉडल नवाचारों का लाभ उठाता है और स्वाभाविक रूप से 8,192 टोकन तक के अनुक्रमों (sequences) का समर्थन करता है।

मूल लेखक: Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Duarte M. Alves, André Martins, Ayoub Hammal, Caio Corro, Céline Hudelot, Emmanuel Malherbe, Etienne Malaboeuf, Fanny Jourdan, Gabriel Hautreux, João Alve
प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nicolas Boizard, Hippolyte Gisserot-Boukhlef, Duarte M. Alves, André Martins, Ayoub Hammal, Caio Corro, Céline Hudelot, Emmanuel Malherbe, Etienne Malaboeuf, Fanny Jourdan, Gabriel Hautreux, João Alves, Kevin El Haddad, Manuel Faysse, Maxime Peyrard, Nuno M. Guerreiro, Patrick Fernandes, Ricardo Rei, Pierre Colombo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास दर्जनों अलग-अलग यूरोपीय भाषाओं में लिखी गई किताबों का एक विशाल पुस्तकालय है, साथ ही कुछ कोड और गणित की पाठ्यपुस्तकें भी हैं। लंबे समय से, इन किताबों को पढ़ने और समझने वाले "पुस्तकालयाध्यक्ष" (AI मॉडल्स) थोड़े पुराने ढंग के होते जा रहे थे। इस बीच, एक नई पीढ़ी के "कथाकारों" (जेनरेटिव AI) ने सारा ध्यान खींच लिया है क्योंकि वे शून्य से नई कहानियाँ लिख सकते हैं।

इस शोध पत्र के लेखकों ने एक सरल प्रश्न पूछा: "हम पुस्तकालयाध्यक्षों को क्यों अनदेखा कर रहे हैं? क्या हम उन्हें कथाकारों जितना स्मार्ट नहीं बना सकते?"

उन्होंने पुस्तकालयाध्यक्षों का एक नया परिवार बनाया जिसे EuroBERT कहा गया। उन्होंने इसे कैसे किया, इसका सरल विवरण यहाँ दिया गया है:

1. नए पुस्तकालयाध्यक्ष का टूलकिट (आर्किटेक्चर)

पुराने पुस्तकालयाध्यक्ष जानकारी व्यवस्थित करने का एक मानक, थोड़ा बोझिल तरीका इस्तेमाल करते थे। EuroBERT एक बिल्कुल नए टूलकिट का उपयोग करता है जो सबसे उन्नत कथाकारों से लिया गया है।

  • उपमा: पुराने पुस्तकालयाध्यक्ष को एक ऐसे व्यक्ति के रूप में सोचें जो आवर्धक लेंस (magnifying glass) के साथ एक-एक पंक्ति पढ़ रहा है। EuroBERT एक ऐसे पुस्तकालयाध्यक्ष की तरह है जो एक बार में पूरे पन्ने को स्कैन कर सकता है, संदर्भ (context) को तुरंत समझ सकता है, और बिना भ्रमित हुए यह याद रख सकता है कि सब कुछ कहाँ है। उन्होंने अनावश्यक "अव्यवस्था" (biases) को हटा दिया और बहुत तेज़ मेमोरी टूल्स (जैसे Rotary Position Embeddings) जोड़े ताकि वे अपनी जगह खोए बिना बहुत लंबे दस्तावेज़ों को संभाल सकें।

2. प्रशिक्षण का आहार (डेटा)

इन पुस्तकालयाध्यक्षों को बुद्धिमान बनाने के लिए, आपको उन्हें सही भोजन खिलाना होगा।

  • दावत: उन्होंने EuroBERT को 5 ट्रिलियन शब्दों (टोकन) के विशाल आहार पर प्रशिक्षित किया। यह केवल इंटरनेट की रैंडम बातें नहीं हैं; यह एक सावधानीपूर्वक तैयार किया गया मिश्रण है:
    • 15 भाषाएँ: प्रमुख यूरोपीय भाषाओं (जैसे फ्रेंच, जर्मन, स्पेनिश) और व्यापक रूप से बोली जाने वाली वैश्विक भाषाओं (जैसे चीनी, अरबी, हिंदी) सहित।
    • विशेष विषय: उन्होंने उन्हें केवल कहानियाँ ही नहीं खिलाईं; उन्होंने उन्हें कोड (प्रोग्रामिंग भाषाएं) और गणित भी खिलाया।
    • परिणाम: ठीक वैसे ही जैसे इतिहास, गणित और कोडिंग पढ़ने वाला छात्र एक बेहतर समस्या-समाधानकर्ता बन जाता है, EuroBERT सभी अलग-अलग विषयों में जानकारी खोजने में बेहतर बन गया।

3. दो-चरणीय प्रशिक्षण (रेसिपी)

उन्होंने सभी किताबें एक साथ पुस्तकालयाध्यक्ष पर नहीं डालीं। उन्होंने दो-चरणों वाली कुकिंग विधि का उपयोग किया:

  • चरण 1: प्री-ट्रेनिंग (कच्चा मसौदा): उन्होंने मॉडल को भाषा, कोड और गणित की बुनियादी बातें सीखने के लिए एक विशाल, विविध डेटा दिया। इस चरण के दौरान, उन्होंने एक खेल खेला जहाँ उन्होंने 50% शब्दों को छिपा दिया और मॉडल से उन्हें पहचानने के लिए कहा। इसने मॉडल को संदर्भ पर वास्तव में ध्यान देने के लिए मजबूर किया।
  • चरण 2: एनीलिंग (पॉलिश करना): यह "फिनिशिंग टच" है। उन्होंने मॉडल को लिया और उसे एक दूसरा, अधिक केंद्रित आहार दिया। उन्होंने अधिक उच्च-गुणवत्ता वाली शैक्षिक सामग्री और समानांतर अनुवाद (दो भाषाओं में अगल-बगल के वाक्य) को शामिल करने के लिए मिश्रण को समायोजित किया। महत्वपूर्ण रूप से, उन्होंने खेल बदल दिया: 50% शब्दों को छिपाने के बजाय, उन्होंने केवल 10% को छिपाया। इससे मॉडल पूर्ण वाक्यों को समझने में बेहतर हुआ, न कि केवल गायब शब्दों का अनुमान लगाने में।

4. परिणाम: वे कितने अच्छे हैं?

लेखकों ने अन्य प्रसिद्ध पुस्तकालयाध्यक्षों (जैसे XLM-RoBERTa और mGTE) के विरुद्ध कई "परीक्षाओं" में EuroBERT का परीक्षण किया:

  • खोज परीक्षण (रिट्रीवल): यदि आप पूछते हैं, "फ्रेंच में नवीकरणीय ऊर्जा के बारे में एक दस्तावेज़ खोजें," तो EuroBERT सही पन्ना खोजने में अविश्वसनीय रूप से तेज़ और सटीक है।
  • समझ का परीक्षण (वर्गीकरण): यदि आप उसे एक वाक्य दिखाते हैं और पूछते, "क्या यह सकारात्मक है या नकारात्मक?" या "क्या इन दो वाक्यों का अर्थ एक ही है?", तो वह प्रतिस्पर्धा की तुलना में अधिक बार सही उत्तर देता है।
  • विशिष्ट परीक्षण (कोड और गणित): यहीं पर EuroBERT सबसे अधिक चमकता है। क्योंकि उन्होंने इसे गणित और कोड खिलाया था, इसलिए यह अन्य समान आकार के मॉडल्स की तुलना में प्रोग्रामिंग भाषाओं और गणितीय सूत्रों को समझने में काफी बेहतर है।
  • लंबे दस्तावेज़ का परीक्षण: EuroBERT 8,192 टोकन (लगभग 6,000-8,000 शब्द) तक लंबे दस्तावेज़ पढ़ सकता है बिना भ्रमित हुए या शुरुआत को भूले। पुराने मॉडल लंबे दस्तावेज़ों के साथ "भूलने" लगते हैं, लेकिन EuroBERT याद रखता है।

5. कुछ आश्चर्यजनक खोजें

EuroBERT बनाते समय, टीम ने कुछ विपरीत तर्क वाली चीजें सीखीं:

  • गुणवत्ता ही सब कुछ नहीं है: उन्हें लगा था कि मॉडल को केवल उच्चतम-गुणवत्ता वाले, सबसे शैक्षिक ग्रंथों को खिलाने से वह अधिक स्मार्ट हो जाएगा। ऐसा नहीं हुआ। मॉडल वास्तव में एक व्यापक मिश्रण के साथ बेहतर प्रदर्शन करता था, जिसमें ऐसी चीजें भी शामिल थीं जो सख्त रूप से "शैक्षिक" नहीं थीं।
  • अंग्रेजी कम होना ही अधिक होना है: उन्होंने अंग्रेजी डेटा की मात्रा कम कर दी और अन्य भाषाओं को बढ़ा दिया। इसने मॉडल को अधिक संतुलित और अन्य गैर-अंग्रेजी भाषाओं को समझने में बेहतर बनाया।
  • कोड हर चीज़ में मदद करता है: प्रशिक्षण डेटा में प्रोग्रामिंग कोड को शामिल करने से न केवल कोडिंग कार्यों में मदद मिली; इसने वास्तव में मॉडल को सामान्य टेक्स्ट में भी जानकारी खोजने में बेहतर बनाया।

निष्कर्ष

लेखकों ने EuroBERT को सभी के लिए एक मुफ्त टूल के रूप में जारी किया है। यह तीन मॉडलों (छोटा, मध्यम और बड़ा) का एक सेट है जो वर्तमान में यूरोपीय और वैश्विक भाषाओं के लिए सर्वश्रेष्ठ "ऑल-राउंडर" पुस्तकालयाध्यक्ष हैं। वे साबित करते हैं कि शक्तिशाली होने के लिए आपको "कथाकार" (जेनरेटिव AI) होने की आवश्यकता नहीं है; एक अच्छी तरह से प्रशिक्षित "समझने वाला" (एनकोडर) अभी भी टेक्स्ट को खोजने, वर्गीकृत करने और विश्लेषण करने के लिए सबसे अच्छा उपकरण हो सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →