EuroBERT: Scaling Multilingual Encoders for European Languages
यह शोधपत्र यूरोबर्ट (EuroBERT) प्रस्तुत करता है, जो यूरोपीय और वैश्विक भाषाओं को कवर करने वाले बहुभाषी एनकोडर्स का एक परिवार है, जो विविध कार्यों में मौजूदा विकल्पों से बेहतर प्रदर्शन करने के लिए हालिया जनरेटिव मॉडल नवाचारों का लाभ उठाता है और स्वाभाविक रूप से 8,192 टोकन तक के अनुक्रमों (sequences) का समर्थन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास दर्जनों अलग-अलग यूरोपीय भाषाओं में लिखी गई किताबों का एक विशाल पुस्तकालय है, साथ ही कुछ कोड और गणित की पाठ्यपुस्तकें भी हैं। लंबे समय से, इन किताबों को पढ़ने और समझने वाले "पुस्तकालयाध्यक्ष" (AI मॉडल्स) थोड़े पुराने ढंग के होते जा रहे थे। इस बीच, एक नई पीढ़ी के "कथाकारों" (जेनरेटिव AI) ने सारा ध्यान खींच लिया है क्योंकि वे शून्य से नई कहानियाँ लिख सकते हैं।
इस शोध पत्र के लेखकों ने एक सरल प्रश्न पूछा: "हम पुस्तकालयाध्यक्षों को क्यों अनदेखा कर रहे हैं? क्या हम उन्हें कथाकारों जितना स्मार्ट नहीं बना सकते?"
उन्होंने पुस्तकालयाध्यक्षों का एक नया परिवार बनाया जिसे EuroBERT कहा गया। उन्होंने इसे कैसे किया, इसका सरल विवरण यहाँ दिया गया है:
1. नए पुस्तकालयाध्यक्ष का टूलकिट (आर्किटेक्चर)
पुराने पुस्तकालयाध्यक्ष जानकारी व्यवस्थित करने का एक मानक, थोड़ा बोझिल तरीका इस्तेमाल करते थे। EuroBERT एक बिल्कुल नए टूलकिट का उपयोग करता है जो सबसे उन्नत कथाकारों से लिया गया है।
- उपमा: पुराने पुस्तकालयाध्यक्ष को एक ऐसे व्यक्ति के रूप में सोचें जो आवर्धक लेंस (magnifying glass) के साथ एक-एक पंक्ति पढ़ रहा है। EuroBERT एक ऐसे पुस्तकालयाध्यक्ष की तरह है जो एक बार में पूरे पन्ने को स्कैन कर सकता है, संदर्भ (context) को तुरंत समझ सकता है, और बिना भ्रमित हुए यह याद रख सकता है कि सब कुछ कहाँ है। उन्होंने अनावश्यक "अव्यवस्था" (biases) को हटा दिया और बहुत तेज़ मेमोरी टूल्स (जैसे Rotary Position Embeddings) जोड़े ताकि वे अपनी जगह खोए बिना बहुत लंबे दस्तावेज़ों को संभाल सकें।
2. प्रशिक्षण का आहार (डेटा)
इन पुस्तकालयाध्यक्षों को बुद्धिमान बनाने के लिए, आपको उन्हें सही भोजन खिलाना होगा।
- दावत: उन्होंने EuroBERT को 5 ट्रिलियन शब्दों (टोकन) के विशाल आहार पर प्रशिक्षित किया। यह केवल इंटरनेट की रैंडम बातें नहीं हैं; यह एक सावधानीपूर्वक तैयार किया गया मिश्रण है:
- 15 भाषाएँ: प्रमुख यूरोपीय भाषाओं (जैसे फ्रेंच, जर्मन, स्पेनिश) और व्यापक रूप से बोली जाने वाली वैश्विक भाषाओं (जैसे चीनी, अरबी, हिंदी) सहित।
- विशेष विषय: उन्होंने उन्हें केवल कहानियाँ ही नहीं खिलाईं; उन्होंने उन्हें कोड (प्रोग्रामिंग भाषाएं) और गणित भी खिलाया।
- परिणाम: ठीक वैसे ही जैसे इतिहास, गणित और कोडिंग पढ़ने वाला छात्र एक बेहतर समस्या-समाधानकर्ता बन जाता है, EuroBERT सभी अलग-अलग विषयों में जानकारी खोजने में बेहतर बन गया।
3. दो-चरणीय प्रशिक्षण (रेसिपी)
उन्होंने सभी किताबें एक साथ पुस्तकालयाध्यक्ष पर नहीं डालीं। उन्होंने दो-चरणों वाली कुकिंग विधि का उपयोग किया:
- चरण 1: प्री-ट्रेनिंग (कच्चा मसौदा): उन्होंने मॉडल को भाषा, कोड और गणित की बुनियादी बातें सीखने के लिए एक विशाल, विविध डेटा दिया। इस चरण के दौरान, उन्होंने एक खेल खेला जहाँ उन्होंने 50% शब्दों को छिपा दिया और मॉडल से उन्हें पहचानने के लिए कहा। इसने मॉडल को संदर्भ पर वास्तव में ध्यान देने के लिए मजबूर किया।
- चरण 2: एनीलिंग (पॉलिश करना): यह "फिनिशिंग टच" है। उन्होंने मॉडल को लिया और उसे एक दूसरा, अधिक केंद्रित आहार दिया। उन्होंने अधिक उच्च-गुणवत्ता वाली शैक्षिक सामग्री और समानांतर अनुवाद (दो भाषाओं में अगल-बगल के वाक्य) को शामिल करने के लिए मिश्रण को समायोजित किया। महत्वपूर्ण रूप से, उन्होंने खेल बदल दिया: 50% शब्दों को छिपाने के बजाय, उन्होंने केवल 10% को छिपाया। इससे मॉडल पूर्ण वाक्यों को समझने में बेहतर हुआ, न कि केवल गायब शब्दों का अनुमान लगाने में।
4. परिणाम: वे कितने अच्छे हैं?
लेखकों ने अन्य प्रसिद्ध पुस्तकालयाध्यक्षों (जैसे XLM-RoBERTa और mGTE) के विरुद्ध कई "परीक्षाओं" में EuroBERT का परीक्षण किया:
- खोज परीक्षण (रिट्रीवल): यदि आप पूछते हैं, "फ्रेंच में नवीकरणीय ऊर्जा के बारे में एक दस्तावेज़ खोजें," तो EuroBERT सही पन्ना खोजने में अविश्वसनीय रूप से तेज़ और सटीक है।
- समझ का परीक्षण (वर्गीकरण): यदि आप उसे एक वाक्य दिखाते हैं और पूछते, "क्या यह सकारात्मक है या नकारात्मक?" या "क्या इन दो वाक्यों का अर्थ एक ही है?", तो वह प्रतिस्पर्धा की तुलना में अधिक बार सही उत्तर देता है।
- विशिष्ट परीक्षण (कोड और गणित): यहीं पर EuroBERT सबसे अधिक चमकता है। क्योंकि उन्होंने इसे गणित और कोड खिलाया था, इसलिए यह अन्य समान आकार के मॉडल्स की तुलना में प्रोग्रामिंग भाषाओं और गणितीय सूत्रों को समझने में काफी बेहतर है।
- लंबे दस्तावेज़ का परीक्षण: EuroBERT 8,192 टोकन (लगभग 6,000-8,000 शब्द) तक लंबे दस्तावेज़ पढ़ सकता है बिना भ्रमित हुए या शुरुआत को भूले। पुराने मॉडल लंबे दस्तावेज़ों के साथ "भूलने" लगते हैं, लेकिन EuroBERT याद रखता है।
5. कुछ आश्चर्यजनक खोजें
EuroBERT बनाते समय, टीम ने कुछ विपरीत तर्क वाली चीजें सीखीं:
- गुणवत्ता ही सब कुछ नहीं है: उन्हें लगा था कि मॉडल को केवल उच्चतम-गुणवत्ता वाले, सबसे शैक्षिक ग्रंथों को खिलाने से वह अधिक स्मार्ट हो जाएगा। ऐसा नहीं हुआ। मॉडल वास्तव में एक व्यापक मिश्रण के साथ बेहतर प्रदर्शन करता था, जिसमें ऐसी चीजें भी शामिल थीं जो सख्त रूप से "शैक्षिक" नहीं थीं।
- अंग्रेजी कम होना ही अधिक होना है: उन्होंने अंग्रेजी डेटा की मात्रा कम कर दी और अन्य भाषाओं को बढ़ा दिया। इसने मॉडल को अधिक संतुलित और अन्य गैर-अंग्रेजी भाषाओं को समझने में बेहतर बनाया।
- कोड हर चीज़ में मदद करता है: प्रशिक्षण डेटा में प्रोग्रामिंग कोड को शामिल करने से न केवल कोडिंग कार्यों में मदद मिली; इसने वास्तव में मॉडल को सामान्य टेक्स्ट में भी जानकारी खोजने में बेहतर बनाया।
निष्कर्ष
लेखकों ने EuroBERT को सभी के लिए एक मुफ्त टूल के रूप में जारी किया है। यह तीन मॉडलों (छोटा, मध्यम और बड़ा) का एक सेट है जो वर्तमान में यूरोपीय और वैश्विक भाषाओं के लिए सर्वश्रेष्ठ "ऑल-राउंडर" पुस्तकालयाध्यक्ष हैं। वे साबित करते हैं कि शक्तिशाली होने के लिए आपको "कथाकार" (जेनरेटिव AI) होने की आवश्यकता नहीं है; एक अच्छी तरह से प्रशिक्षित "समझने वाला" (एनकोडर) अभी भी टेक्स्ट को खोजने, वर्गीकृत करने और विश्लेषण करने के लिए सबसे अच्छा उपकरण हो सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।