MTEB-BR: A Text Embedding Benchmark for Brazilian Portuguese
यह शोध पत्र MTEB-BR को प्रस्तुत करता है, जो अनुवाद पर निर्भर रहने के बिना टेक्स्ट एम्बेडिंग मॉडल का मूल्यांकन करने के लिए 22 मूल ब्राज़ीलियाई-पुर्तगाली कार्यों वाला पहला समर्पित बेंचमार्क है, जो यह प्रकट करता है कि ओपन-सोर्स मॉडल के साथ शीर्ष-स्तरीय प्रदर्शन प्राप्त करना संभव है और यह प्रदर्शित करता है कि वैश्विक बहुभाषी रैंकिंग केवल पुर्तगाली-विशिष्ट प्रभावशीलता की मध्यम रूप से भविष्यवाणी करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ MTEB-BR पेपर का सरल भाषा में अनुवाद दिया गया है:
समस्या: "अनुवाद में खो जाने" का जाल (The "Lost in Translation" Trap)
कल्पना कीजिए कि आप विशेष रूप से ब्राज़ीलियाई सड़कों पर चलाने के लिए एक उच्च गुणवत्ता वाली कार खरीदने की कोशिश कर रहे हैं। आप एक वैश्विक कार समीक्षा वेबसाइट पर जाते हैं, लेकिन उनके पास केवल अमेरिकी या यूरोपीय राजमार्गों पर परीक्षण की गई कारों की समीक्षाएँ हैं। वे आपसे कहते हैं, "यह कार शानदार है!" क्योंकि इसने उन विदेशी ट्रैक पर अच्छा प्रदर्शन किया था।
लेकिन यहाँ एक पेंच है: ब्राज़ीलियाई सड़कों में अलग तरह के गड्ढे, अलग ट्रैफिक पैटर्न और अलग मौसम होता है। एक कार जो यूरोपीय ट्रैक पर जीत सकती है, वह ब्राज़ीलियाई ट्रैक पर संघर्ष कर सकती है।
लंबे समय तक, AI की दुनिया में ब्राज़ीलियाई पुर्तगाली (Brazilian Portuguese) के साथ यही स्थिति थी। यदि आप यह परीक्षण करना चाहते थे कि एक AI पुर्तगाली वाक्यों को कितनी अच्छी तरह समझता है, तो आपको इनका उपयोग करना पड़ता था:
- अनुवादित परीक्षण (Translated tests): अंग्रेजी परीक्षणों को लेना और उन्हें पुर्तगाली में अनुवाद करना (जिससे अक्सर भाषा का "स्वाद" और सूक्ष्मता खो जाती है)।
- कम कवरेज (Thin coverage): बहुत कम परीक्षण जो इस बात को कवर नहीं करते थे कि ब्राज़ील में लोग वास्तव में कैसे बोलते और लिखते हैं।
समाधान: MTEB-BR (द "ब्राज़ीलियाई ड्राइविंग टेस्ट")
लेखकों ने MTEB-BR बनाया, जो एक बिल्कुल नया, नेटिव बेंचमार्क है। इसे सीधे तौर पर साओ पाउलो में एक समर्पित ड्राइविंग टेस्ट ट्रैक बनाने जैसा समझें, जिसमें केवल ब्राज़ीलियाई यातायात नियमों और सड़क स्थितियों का उपयोग किया गया हो।
- कोई अनुवाद मान्य नहीं (No Translations Allowed): उन्होंने किसी भी ऐसे टेस्ट डेटा पर सख्त प्रतिबंध लगा दिया जो अंग्रेजी से अनुवादित था। इस परीक्षण में उपयोग किया गया हर एक प्रश्न, कानूनी दस्तावेज़, मेडिकल नोट या सोशल मीडिया पोस्ट मूल रूप से ब्राज़ीलियाई पुर्तगाली में बनाया गया था।
- कोर्स (The Course): उन्होंने सात अलग-अलग प्रकार के ड्राइविंग कौशल को कवर करने वाला एक 22-स्टॉप बाधा कोर्स (obstacle course) बनाया:
- वर्गीकरण (Classification): मेल को सही डिब्बों में छाँटना (जैसे, क्या यह ट्वीट घृणास्पद है?)।
- रिट्रीवल (Retrieval): ढेर में से सही सुई ढूँढना (जैसे, एक विशाल डेटाबेस में एक विशिष्ट कानून ढूँढना)।
- क्लस्टरिंग (Clustering): समान वस्तुओं को एक साथ समूहबद्ध करना (जैसे, मेडिकल रिकॉर्ड को विषय के आधार पर व्यवस्थित करना)।
- और अन्य, जिनमें कानूनी, चिकित्सा और टैक्स डोमेन शामिल हैं।
दौड़: कौन जीता? (The Race: Who Won?)
उन्होंने 93 अलग-अलग AI मॉडल्स को इस कोर्स से गुजारा। कुछ फ्री, ओपन-सोर्स मॉडल थे (जैसे एक DIY कार जिसे आप खुद बना सकते हैं), और कुछ महंगे, क्लोज्ड कमर्शियल API थे (जैसे एक लग्जरी कार जिसे आपको प्रति मिनट किराए पर लेना पड़ता है)।
परिणाम:
- "फ्रंटियर" टाई (The "Fronter" Tie): शीर्ष 6 मॉडल प्रदर्शन में इतने करीब थे कि परीक्षण सांख्यिकीय रूप से यह नहीं बता सका कि वास्तव में "सर्वश्रेष्ठ" कौन है। वे सभी एक ही एलीट श्रेणी में हैं। यह एक ऐसी दौड़ की तरह है जहाँ शीर्ष छह कारें एक मिलीमीटर के भीतर फिनिश लाइन पार करती हैं।
- सरप्राइज विनर (The Surprise Winner): शीर्ष प्रदर्शन करने वालों में से एक एक ओपन-सोर्स मॉडल (Qwen3-Embedding-8B) था। यह बहुत बड़ी बात है क्योंकि इसका मतलब है कि आपको शीर्ष-स्तरीय प्रदर्शन प्राप्त करने के लिए किसी कमर्शियल कंपनी को भुगतान करने की आवश्यकता नहीं है; आप इस मॉडल को अपने आप के लिए मुफ्त में चला सकते हैं।
- "ग्लोबल" जाल (The "Global" Trap): पेपर ने जाँच की कि क्या वैश्विक "विश्व चैंपियन" AI (जो अंग्रेजी और बहुभाषी परीक्षणों में जीतता है) यहाँ भी जीतेगा। उत्तर नहीं था।
- उपमा: कल्पना कीजिए कि एक फॉर्मूला 1 चैंपियन ड्राइवर है। यदि आप उन्हें एक रैली कार में ब्राज़ील के कीचड़ भरे कच्चे रास्ते पर रखते हैं, तो शायद वे नहीं जीत पाएंगे।
- एक मॉडल वैश्विक स्तर पर तीसरे स्थान पर था लेकिन ब्राज़ील में 49वें स्थान पर आ गया। यह साबित करता है कि अंग्रेजी में अच्छा होना स्वचालित रूप से पुर्तगाली में अच्छा होने की गारंटी नहीं है।
"सांख्यिकीय परत" (रेफरी की नोटबुक) (The "Statistical Layer")
अधिकांश बेंचमार्क केवल एक स्कोर और एक रैंक (1st, 2nd, 3rd) देते हैं। लेखकों को लगा कि यह बहुत सरल है, जैसे यह कहना कि "कार A, कार B से तेज़ है" बिना मार्जिन बताए।
उन्होंने एक सांख्यिकीय परत (statistical layer) जोड़ी जो एक सतर्क रेफरी की तरह काम करती है:
- कॉन्फिडेंस इंटरवल (Confidence Intervals): केवल यह कहने के बजाय कि "मॉडल A का स्कोर 0.68 है," वे कहते हैं "मॉडल A का स्कोर 0.68 है, +/- 0.05 के साथ।" यह बताता है कि दो मॉडलों के बीच का अंतर वास्तविक है या केवल एक इत्तेफाक।
- आइटम रिस्पॉन्स थ्योरी (IRT): यह पूछने का एक शानदार तरीका है कि, "कौन से हिस्से वास्तव में अच्छे ड्राइवरों को बुरे ड्राइवरों से अलग करते हैं?"
- उन्होंने पाया कि रिट्रीवल कार्य (सूचना खोजना) मॉडलों को अलग करने में सबसे अच्छे थे।
- क्लस्टरिंग कार्य (चीजों को समूहबद्ध करना) मॉडलों के बीच अंतर बताने में सबसे खराब थे।
- उपमा: यह महसूस करने जैसा है कि गणित का टेस्ट जीनियस को पहचानने में बहुत अच्छा है, लेकिन स्पेलिंग बी (Spelling Bee) हाई स्कूल के छात्र और कॉलेज के छात्र के बीच अंतर करने में बहुत अच्छा नहीं है।
उपयोगकर्ताओं के लिए मुख्य बातें (The Bottom Line for Users)
यदि आप ब्राज़ील में एक डेवलपर या बिजनेस ओनर हैं:
- ग्लोबल लीडरबोर्ड पर आँख बंद करके भरोसा न करें। एक मॉडल जो दुनिया में नंबर 1 है, वह ब्राज़ील में औसत दर्जे का हो सकता है।
- आपको भुगतान करने की आवश्यकता नहीं है। आप टॉप-टियर प्रदर्शन के साथ फ्री, सेल्फ-होस्टेड मॉडल प्राप्त कर सकते हैं।
- "फ्रंटियर" को देखें। चूंकि शीर्ष 6 मॉडल सांख्यिकीय रूप से टाई हैं, इसलिए आपका चुनाव मामूली स्कोर अंतर के आधार पर नहीं होना चाहिए। इसके बजाय, लागत (फ्री बनाम पेड), गति, और लाइसेंस (क्या आप इसे व्यावसायिक रूप से उपयोग कर सकते हैं?) के आधार पर चुनाव करें।
संक्षेप में, MTEB-BR पहली बार ब्राज़ीलियाई पुर्तगाली बोलने वालों के लिए AI मॉडल्स को आंकने का एक निष्पक्ष, नेटिव और सांख्यिकीय रूप से कठोर तरीका है, जो यह साबित करता है कि स्थानीय बारीकियां (nuance) मायने रखती हैं, और आपको सर्वश्रेष्ठ परिणाम पाने के लिए कमर्शियल API की आवश्यकता नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।