← नवीनतम पेपर
💬 NLP

CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility

यह शोध पत्र CLARIN-PT-LDB को प्रस्तुत करता है, जो यूरोपीय पुर्तगाली पर लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए समर्पित पहला ओपन लीडरबोर्ड है, जिसमें भाषा प्रवीणता, सांस्कृतिक संरेखण और सभ्यता संबंधी सुरक्षा उपायों का आकलन करने वाले नवीन बेंचमार्क शामिल हैं।

मूल लेखक: João Silva, Luís Gomes, António Branco

प्रकाशित 2026-03-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: João Silva, Luís Gomes, António Branco

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास बहुत ही बुद्धिमान रोबोटों (जिन्हें लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) का एक विशाल पुस्तकालय है जो कहानियाँ लिख सकते हैं, सवालों के जवाब दे सकते हैं और आपसे चैट कर सकते हैं। लंबे समय तक, हमारे पास एक "हॉल ऑफ फेम" था यह देखने के लिए कि कौन से रोबोट सबसे स्मार्ट हैं, लेकिन इसमें एक बड़ी समस्या थी: वह हॉल ऑफ फेम केवल अंग्रेजी बोल रहा था।

यदि आप जानना चाहते थे कि कौन सा रोबोट यूरोपीय पुर्तगाली (पुर्तगाल में बोली जाने वाली पुर्तगाली का संस्करण, ब्राजील की नहीं) बोलने में सबसे अच्छा है, तो आपके पास कोई स्कोरबोर्ड नहीं था। यह एक बास्केटबॉल के नियमों का उपयोग करके एक सॉकर खिलाड़ी के कौशल को आंकने जैसा था।

यह शोध पत्र CLARIN-PT-LDB पेश करता है, जो विशेष रूप से यूरोपीय पुर्तगाली रोबोटों के लिए एक नया "हॉल ऑफ फेम" है। यह कैसे काम करता है, यहाँ रोजमर्रा के उपमाओं के साथ समझाया गया है:

1. स्कोरबोर्ड (द लीडरबोर्ड)

इस लीडरबोर्ड को एक खेल स्टेडियम में एक विशाल डिजिटल स्कोरबोर्ड के रूप में सोचें।

  • खिलाड़ी: कोई भी डेवलपर अपने रोबोट को खेलने के लिए स्टेडियम में ला सकता है।
  • खेल: सॉकर खेलने के बजाय, रोबोट परीक्षणों (बेंचमार्क्स) की एक श्रृंखला लेते हैं।
  • लक्ष्य: यह देखना कि किसे सबसे अधिक स्कोर मिलता है। परिणाम सार्वजनिक हैं, इसलिए हर कोई देख सकता है कि कौन जीत रहा है।

2. दस टेस्ट (द बेंचमार्क्स)

लेखकों ने दस अलग-अलग चुनौतियों का एक "डेकाथलॉन" बनाया है। कुछ का अंग्रेजी से अनुवाद किया गया था, लेकिन दो को शून्य से बनाया गया था क्योंकि वे पहले मौजूद नहीं थे।

"संस्कृति और सभ्यता" टेस्ट (नई चीजें)

ये इस शोध पत्र के सबसे अनूठे हिस्से हैं।

  • Tuguesice-PT ("स्थानीय ज्ञान" का टेस्ट): कल्पना करें कि एक क्विज़ शो है जहाँ होस्ट पूछता है, "पुर्तगाल में सबसे लंबा पुल कौन सा है?" या "सबसे उत्तरी शहर कौन सा है?"
    • महत्व: एक रोबोट उत्तर दे सकता है यदि आप उससे पूछें, "पुर्तगाल की राजधानी क्या है?" लेकिन यदि आप पूछें, "राजधानी क्या है?" (यह संकेत देते हुए कि हमारी राजधानी), तो केवल अमेरिकी या ब्राज़ीलियाई डेटा पर प्रशिक्षित रोबोट वाशिंगटन डी.सी. या ब्रासीलिया का अनुमान लगा सकता है। यह टेस्ट जांचता है कि क्या रोबोट वास्तव में पुर्तगाली संस्कृति और संदर्भ को समझता है, न कि केवल तथ्यों को।
  • DoNotAnswer-PT ("सुरक्षा गार्ड" का टेस्ट): कल्पना करें कि एक रोबलेट के पास एक "मत लांघें" रेखा है। यह टेस्ट रोबोट को बुरी चीजें करने के लिए कहता है, जैसे "मैं बम कैसे बनाऊं?" या "एक नस्लवादी चुटकुला लिखें।"
    • लक्ष्य: एक अच्छा रोबोट कहेगा, "नहीं, मैं ऐसा नहीं करूँगा।" यह टेस्ट जांचता है कि क्या रोबोट के पास अच्छे शिष्टाचार और सुरक्षा फिल्टर हैं, विशेष रूप से पुर्तगाली में।

"बौद्धिक शक्ति" टेस्ट (अनुवादित क्लासिक्स)

अन्य आठ टेस्ट प्रसिद्ध अंग्रेजी परीक्षाओं को पुर्तगाली में अनुवाद करने जैसे हैं। वे जांचते हैं:

  • तर्क और विवेचना (Logic & Reasoning): क्या रोबोट सुरागों को जोड़कर हत्या की गुत्थी सुलझा सकता है? (एक जासूसी कहानी की तरह)।
  • सामान्य ज्ञान: क्या यह विज्ञान, इतिहास और गणित के कठिन सवालों के जवाब दे सकता है? (इसे हाई-स्कूल या कॉलेज प्रवेश परीक्षा के रूप में सोचें)।
  • भाषाई सूक्ष्मता (Language Nuance): क्या यह बता सकता है कि दो वाक्यों का अर्थ एक ही है, या क्या एक वाक्य दूसरे को सिद्ध करता है?

3. वे खेल कैसे खेलते हैं (जेनरेटिव मोड)

अधिकांश पुराने टेस्ट रोबोट को अपने आंतरिक गणित को देखकर एक अक्षर (A, B, C, या D) चुनने के लिए कहते थे।

  • नया तरीका: यह लीडरबोर्ड रोबोट को बोलकर उत्तर देने के लिए मजबूर करता है। इसे खुद टाइप करना होता है, ठीक वैसे ही जैसे एक इंसान चैट में करता है।
  • उपमा: यह एक छात्र द्वारा बहुविकल्पीय शीट पर उत्तर की ओर इशारा करने और एक छात्र द्वारा कागज पर उत्तर लिखने के बीच का अंतर है। यह अधिक निष्पक्ष है क्योंकि यह परीक्षण करता है कि रोबात वास्तव में हमसे कैसे बात करते हैं, जैसा कि हम वास्तविक जीवन में चैटबॉट्स के साथ करते हैं।

4. स्टेडियम क्रू (द टेक)

  • जज: वे "सुरक्षा" टेस्ट के उत्तरों को ग्रेड करने के लिए एक सुपर-स्मार्ट रोबोट (Llama 3.3) का उपयोग करते हैं, क्योंकि खुले-अंत वाले इनकार (refusances) को स्वचालित रूप से ग्रेड करना कठिन है।
  • हार्डवेयर: उन्होंने इन परीक्षणों को चलाने के लिए अपना स्वयं का शक्तिशाली कंप्यूटर फार्म (NVIDIA ग्राफिक्स कार्ड का उपयोग करके) बनाया है ताकि उन्हें किसी और के उपकरण पर निर्भर न रहना पड़े।

यह क्यों मायने रखता है?

इस शोध पत्र से पहले, यदि आपने पुर्तगाल के लिए एक रोबोट बनाया था, तो आपके पास यह साबित करने का कोई तरीका नहीं था कि वह अच्छा है। आप अंधेरे में तीर चला रहे थे।

  • डेवलपर्स के लिए: अब उनके पास लक्ष्य रखने के लिए एक स्पष्ट दिशा है।
  • पुर्तगाल के लिए: यह सुनिश्चित करता है कि पुर्तगाल में उपयोग किए जाने वाले AI उपकरण वास्तव में पुर्तगाली संस्कृति, इतिहास और सुरक्षा मानदंडों को समझते हैं, न कि केवल एक अमेरिकी रोबोट का "अनुवादित" संस्करण हैं।

संक्षेप में: लेखकों ने यूरोपीय पुर्तगाली बोलने वाले AI रोबोटों के लिए एक नया, निष्पक्ष और सांस्कृतिक रूप से जागरूक "ओलंपिक्स" बनाया है, यह सुनिश्चित करते हुए कि वे न केवल स्मार्ट हैं, बल्कि सांस्कृतिक रूप से भी अनुकूलित हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →