Beyond Multilingual Averages: MTEB-PT, a Benchmark for Portuguese Sentence Encoders
यह शोध पत्र MTEB-PT को प्रस्तुत करता है, जो एक व्यापक पुर्तगाली बेंचमार्क है जो यह प्रदर्शित करता है कि बहुभाषी रैंकिंग विविध कार्यों में पुर्तगाली-विशिष्ट प्रदर्शन की भविष्यवाणी करने में विफल रहती है, जबकि यह दर्शाता है कि मैट्रोस्का प्रतिनिधित्व शिक्षण (Matryoshka Representation Learning) के साथ भाषा-विशिष्ट फाइन-ट्यूनिंग मॉडल की प्रभावशीलता को महत्वपूर्ण रूप से बढ़ाती है, विशेष रूप से सिमेंटिक समानता और लॉन्ग-कॉन्टेक्स्ट रिट्रीवल के लिए।