← नवीनतम पेपर
💬 NLP

Beyond Multilingual Averages: MTEB-PT, a Benchmark for Portuguese Sentence Encoders

यह शोध पत्र MTEB-PT को प्रस्तुत करता है, जो एक व्यापक पुर्तगाली बेंचमार्क है जो यह प्रदर्शित करता है कि बहुभाषी रैंकिंग विविध कार्यों में पुर्तगाली-विशिष्ट प्रदर्शन की भविष्यवाणी करने में विफल रहती है, जबकि यह दर्शाता है कि मैट्रोस्का प्रतिनिधित्व शिक्षण (Matryoshka Representation Learning) के साथ भाषा-विशिष्ट फाइन-ट्यूनिंग मॉडल की प्रभावशीलता को महत्वपूर्ण रूप से बढ़ाती है, विशेष रूप से सिमेंटिक समानता और लॉन्ग-कॉन्टेक्स्ट रिट्रीवल के लिए।

मूल लेखक: Lucas Hideki Takeuchi Okamura, Alexandre Alcoforado, Anna Helena Reali Costa

प्रकाशित 2026-07-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lucas Hideki Takeuchi Okamura, Alexandre Alcoforado, Anna Helena Reali Costa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

इंटरनेट की कल्पना एक विशाल, अराजक पुस्तकालय के रूप में करें जहाँ हर किताब, ट्वीट और समाचार लेख एक अलग भाषा में लिखा गया है। सही जानकारी खोजने के लिए, कंप्यूटरों को एक विशेष प्रकार के लाइब्रेरियन की आवश्यकता होती है जो पुर्तगाली में एक वाक्य पढ़ सके, उसके अर्थ को समझ सके, और तुरंत डेटाबेस में एक मिलान करने वाले वाक्य को खोज सके, भले ही शब्द पूरी तरह से अलग हों। इस लाइब्रेरियन को "सेंटेंस एनकोडर" (sentence encoder) कहा जाता है। इसे एक ऐसे अनुवादक के रूप में सोचें जो केवल शब्दों को बदलता नहीं है, बल्कि एक वाक्य के विचार को एक गुप्त कोड (संख्याओं की एक सूची) में बदल देता है जो उसकी आत्मा को पकड़ लेता है। वर्षों तक, इन लाइब्रेरियन को मुख्य रूप से अंग्रेजी किताबों पर प्रशिक्षित किया गया है। हालांकि वे अंग्रेजी समझने में माहिर हैं, हम केवल यह अनुमान लगा रहे थे कि वे पुर्तगाली—जो दुनिया की सबसे अधिक बोली जाने वाली भाषाओं में से एक है—को कितनी अच्छी तरह संभालते हैं। यह एक ऐसे शेफ को काम पर रखने जैसा है जो फ्रांसीसी व्यंजनों का उस्ताद है और हम यह मान लेते हैं कि वह स्वचालित रूप से एक बेहतरीन ब्राज़ीलियाई फोजोआडा (feijoada) बना सकता है क्योंकि उसे चूल्हा चलाना आता है। बड़ा सवाल यह है: क्या ये बहुभाषी शेफ वास्तव में स्थानीय व्यंजनों को जानते हैं, या वे केवल अनुमान लगाते हैं?

यहीं पर एक नया अध्ययन शेफ के एप्रन की जाँच करने के लिए आता है। शोधकर्ताओं ने एक विशेष परीक्षण बनाया जिसे MTEB-PT कहा जाता है, जो विशेष रूप से पुर्तगाली सेंटेंस एनकोडर्स के लिए डिज़ाइन किया गया एक "जिम" है। मॉडलों से केवल दो समान वाक्यों को मिलाने (जैसे पर्यायवाची खोजना) के लिए कहने के बजाय, उन्होंने उन्हें चार अलग-अलग प्रकार की चुनौतियों में झोंक दिया: अर्थों का मिलान करना (Semantic Textual Similarity), वाक्यों को "हेट स्पीच" या "सेंटिमेंट" जैसी श्रेणियों में वर्गीकृत करना (Classification), एक खोज क्वेरी के लिए सही दस्तावेज़ ढूँढना (Retrieval), और सर्वश्रेष्ठ परिणाम को सबसे ऊपर रखने के लिए खोज परिणामों की एक सूची को रैंक करना (Reranking)। उन्होंने ओपन-सोर्स सामुदायिक परियोजनाओं से लेकर बड़े, बंद-स्रोत वाणिज्यिक दिग्गजों तक, 17 अलग-अलग मॉडलों का परीक्षण किया।

परिणाम थोड़े चौंकाने वाले थे। अध्ययन में पाया गया कि "बहुभाषी चैंपियन" होना स्वचालित रूप से "पुर्तगाली चैंपियन" नहीं बनाता है। एक मॉडल जो वैश्विक, बहुभाषी परीक्षण में नंबर 1 पर आता है, वह विशेष रूप से पुर्तगाली कार्य के बारे में करते समय नंबर 10 पर गिर सकता है। यह पता चला कि प्रदर्शन कार्य की प्रकृति पर अत्यधिक निर्भर करता है। यदि आपको दो समान वाक्यों के बीच सूक्ष्म अंतर को समझने के लिए एक मॉडल की आवश्यकता है, तो पुर्तगाली डेटा पर विशेष रूप से फाइन-ट्यून किया गया मॉडल सबसे अच्छा काम करता है। लेकिन यदि आपको हजारों लंबे दस्तावेजों के माध्यम से घास के ढेर में सुई खोजने के लिए एक मॉडल की आवश्यकता है, तो वे मॉडल जिनमें लंबी "अटेंशन स्पैन" (शुरुआत को भूले बिना लंबे टेक्स्ट को पढ़ने की क्षमता) है और जिन्हें विशेष रूप से खोज कार्यों के लिए प्रशिक्षित किया गया है, वे बढ़त बना लेते हैं।

शोधकर्ताओं ने मैट्र्योस्का रिप्रेजेंटेशन लर्निंग (MRL) नामक एक चतुर तकनीक भी आजमाई। रूसी नेस्टिंग डॉल्स (एक के अंदर एक रखी जाने वाली गुड़िया) के सेट की कल्पना करें। आमतौर पर, एक कंप्यूटर को पूरी तस्वीर पाने के लिए पूरी बड़ी गुड़िया को संग्रहीत करने की आवश्यकता होती है। MRL इस मॉडल को स्वयं एक "नेस्टिंग डॉल" बनने की अनुमति देता है: आप उच्च-गुणवत्ता वाले कार्यों के लिए पूरी चीज़ का उपयोग कर सकते हैं, या आप बहुत अधिक गुणवत्ता खोए बिना तेज़, सस्ते कार्यों के लिए इसके बाहरी परतों को हटाकर एक छोटे, अधिक कॉम्पैक्ट संस्करण का उपयोग कर सकते हैं। उन्होंने तीन लोकप्रिय मॉडलों को इस तकनीक और पुर्तगाली डेटा के साथ फाइन-ट्यून किया। ये नए "पुर्तगाली-मूल निवासी" मॉडल वाक्य के अर्थों को समझने में सर्वश्रेष्ठ बन गए, और जब उन्हें छोटे आकार में सिकोड़ा गया, तब भी वे प्रतिस्पर्धी बने रहे। हालाँकि, सबसे कठिन खोज कार्यों के लिए, बड़े, विशेष खोज मॉडल अभी भी शीर्ष पर थे।

अंततः, यह पेपर सुझाव देता है कि पुर्तगाली के लिए कोई एक "जादुई गोली" (magic bullet) वाला मॉडल नहीं है। आप केवल उस मॉडल को नहीं चुन सकते जिसका वैश्विक स्कोर सबसे अधिक है और उम्मीद नहीं कर सकते कि यह हर जगह काम करेगा। यदि आप एक चैटबॉट बना रहे हैं जिसे भावनाओं को समझने की आवश्यकता है, तो आपको एक अलग मॉडल की आवश्यकता है बजाय इसके कि आप एक कानूनी दस्तावेजों के लिए खोज इंजन बना रहे हों। अध्ययन यह सिद्ध करता है कि पुर्तगाली में सर्वोत्तम परिणाम प्राप्त करने के लिए, आपको अपने मॉडलों का परीक्षण पुर्तगाली-विशिष्ट कार्यों पर करना होगा, और कभी-कभी, आपको उनकी क्षमता को वास्तव में अनलॉक करने के लिए उन्हें भाषा में थोड़ा अतिरिक्त प्रशिक्षण देने की भी आवश्यकता होगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →