← नवीनतम पेपर
💬 NLP

GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek

यह शोधपत्र GreekMMLU को प्रस्तुत करता है, जो 45 विषयों में 21,000 से अधिक बहुविकल्पीय प्रश्नों वाला एक व्यापक, मूल-स्रोत (native-sourced) बेंचमार्क है, जिसे ग्रीक भाषा के मॉडलों के लिए प्रामाणिक मूल्यांकन उपकरणों की कमी को दूर करने के लिए डिज़ाइन किया गया है और जो फ्रंटियर, ओपन-वेट और ग्रीक-अनुकूलित मॉडलों के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।

मूल लेखक: Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

प्रकाशित 2026-03-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yang Zhang, Mersin Konomi, Christos Xypolopoulos, Konstantinos Divriotis, Konstantinos Skianis, Giannis Nikolentzos, Giorgos Stamou, Guokan Shang, Michalis Vazirgiannis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल पुस्तकालय है, और उसके अंदर अंग्रेजी में लिखी हजारों किताबें हैं। अब, कल्पना कीजिए कि आप एक नए AI रोबोट की बुद्धिमत्ता का परीक्षण करना चाहते हैं। आप उसे उन अंग्रेजी किताबों पर आधारित एक क्विज़ देते हैं। यदि रोबोट उच्च स्कोर प्राप्त करता है, तो आप सोचते हैं, "वाह, यह रोबोट तो जीनियस है!"

लेकिन यहाँ एक समस्या है: क्या होगा यदि आप उसी रोबोट का परीक्षण यूनानी (Greek) संस्कृति, इतिहास और भाषा पर करना चाहते हैं?

यदि आप केवल अंग्रेजी क्विज़ लेते हैं और उसे मशीन ट्रांसलेटर का उपयोग करके यूनानी में बदल देते हैं, तो रोब melalui उच्च स्कोर प्राप्त कर सकता है। लेकिन ऐसा इसलिए नहीं है क्योंकि वह यूनानी समझता है; बल्कि इसलिए क्योंकि वह उस अंग्रेजी संस्करण के आधार पर अनुमान लगाने में कुशल है जिसे वह पहले से जानता है। यह वैसा ही है जैसे किसी को ऐसी भाषा में कविता सुनाने के लिए कहना जिसे वे नहीं बोलते, लेकिन उन्होंने अंग्रेजी अनुवाद याद कर लिया है और बस शब्दों को उल्टा-पुल्टा पढ़ रहे हैं। वे भाषा जानते हुए प्रतीत होते हैं, लेकिन वे वास्तव में अर्थ, चुटकुलों या सांस्कृतिक हृदय को नहीं समझते हैं।

यही वह समस्या है जिसे इस पेपर के लेखकों ने ठीक करने की कोशिश की है।

समस्या: "अनुवादित" जाल (The "Translated" Trap)

लंबे समय तक, AI को यूनानी भाषा पर परखने के लिए, शोधकर्ताओं ने केवल अंग्रेजी परीक्षणों को लिया और उनका अनुवाद किया। यह एक शेफ की प्रामाणिक यूनानी भोजन बनाने की क्षमता को फ्रांसीसी से अनुवादित रेसिपी देकर आंकने जैसा है। सामग्री वहां हो सकती है, लेकिन स्वाद गलत है। AI बारीकियों, यूनानी लोग अपने इतिहास के बारे में कैसे सोचते हैं, और उनकी भाषा की अनूठी संरचना को मिस कर देता है।

समाधान: GreekMMLU (द "नेटिव" क्विज़)

टीम ने GreekMMLU बनाया, जो एक बिल्कुल नया, प्रामाणिक यूनानी परीक्षण बनाने जैसा है।

  • प्रश्न कहाँ से आए? अंग्रेजी का अनुवाद करने के बजाय, वे सीधे स्रोत पर गए: वास्तविक यूनानी स्कूली परीक्षाएँ, विश्वविद्यालय की परीक्षाएँ, पेशेवर लाइसेंसिंग परीक्षाएँ (जैसे डॉक्टरों या वकीलों के लिए), और यहाँ तक कि ड्राइविंग टेस्ट भी।
  • इसके अंदर क्या है? यह 45 अलग-अलग विषयों को कवर करने वाले 21,805 प्रश्नों का एक विशाल संग्रह है।
    • STEM: गणित, भौतिकी, जीव विज्ञान।
    • मानविकी (Humanities): यूनानी पौराणिक कथाएं, इतिहास, साहित्य।
    • सामाजिक विज्ञान: अर्थशास्त्र, कानून, राजनीति।
    • यूनानी-विशिष्ट: ऐसी चीजें जो केवल एक यूनानी वक्ता ही जान सकता है, जैसे यूनानी ड्राइविंग के नियम या यूनानी रूढ़िवादी परंपराओं के विवरण।
  • "सीक्रेट सॉस" (The Secret Sauce): उन्होंने प्रश्नों को दो ढेरों में विभाजित किया। एक ढेर सार्वजनिक है (ताकि कोई भी अपने AI का परीक्षण कर सके), और दूसरा "गुप्त" ढेर है जिसे एक तिजोरी में रखा गया है। यह AI कंपनियों को परीक्षण होने से पहले ही उत्तरों को याद करने (एक समस्या जिसे "डेटा कंटैमिनेशन" कहा जाता है) से रोकता है।

बड़ा प्रयोग: किसने टेस्ट पास किया?

लेखकों ने 80 से अधिक विभिन्न AI मॉडल (दोनों मुफ्त, ओपन-सोर्स और महंगे, क्लोज्ड-सोर्स) को लिया और उन्हें यह यूनानी क्विज़ दिया। यहाँ उन्होंने पाया, कुछ सरल उपमाओं का उपयोग करते हुए:

  1. "बड़े दिमाग" बनाम "छोटे दिमाग":

    • सबसे बड़े, सबसे शक्तिशाली AI मॉडल (जैसे Google और OpenAI के मॉडल) बहुत अच्छा प्रदर्शन करते हैं। वे उन छात्रों की तरह हैं जिन्होंने पुस्तकालय की हर किताब पढ़ ली है।
    • छोटे, ओपन-सोर्स मॉडल संघर्ष करते हैं। उनमें से कुछ का स्कोर रैंडम अनुमान लगाने से भी बहुत कम था। यह किसी ऐसे व्यक्ति को हाई स्कूल की भौतिकी परीक्षा देने जैसा है जिसने अभी तक मिडिल स्कूल भी पूरा नहीं किया है।
  2. "विशेषज्ञ" बनाम "सामान्यज्ञ" (The "Specialist" vs. The "Generalist"):

    • कुछ AI "सामान्यज्ञ" (Generalists) होते हैं—वे कई भाषाओं में बहुत कुछ के बारे में थोड़ा-थोड़ा जानते हैं।
    • कुछ "विशेषज्ञ" (Specialists) होते हैं—उन्हें विशेष रूप से बेहतर यूनानी बोलने और समझने के लिए प्रशिक्षित किया गया था।
    • परिणाम: विशेषज्ञ जीत गए! जो मॉडल विशेष रूप से यूनानी के लिए ट्यून किए गए थे (जैसे Llama-Krikri या Meltomi), उन्होंने समान आकार के सामान्य बहुभाषी मॉडलों की तुलना में बहुत बेहतर प्रदर्शन किया। यह एक स्थानीय टूर गाइड (विशेषज्ञ) बनाम एक ऐसे गाइड को काम पर रखने जैसा है जिसने केवल एक फ्रेजबुक से भाषा सीखी है (सामान्यज्ञ)। स्थानीय गाइड शॉर्टकट और छिपे हुए रत्नों को जानता है।
  3. "निर्देश" का बढ़ावा (The "Instruction" Boost):

    • उन्होंने पाया कि यदि आप AI को टेस्ट कैसे देना है यह "सिखाते" हैं (उसे उत्तर देने के उदाहरण देकर), तो वह अधिक स्मार्ट हो जाता है। इसे "इंस्ट्रक्शन ट्यूनिंग" कहा जाता है। यह एक छात्र को वास्तविक परीक्षा से पहले अभ्यास परीक्षा देने जैसा है; वे बहुत बेहतर प्रदर्शन करते हैं क्योंकि वे प्रारूप को समझते हैं।

यह क्यों मायने रखता है?

यह पेपर एक चेतावनी है। यह दिखाता है कि केवल इसलिए कि एक AI यूनानी बोलता है, इसका मतलब यह नहीं है कि वह यूनानी समझता है।

  • शोधकर्ताओं के लिए: यह उन्हें एक निष्पक्ष, ईमानदार पैमाना देता है कि एक AI वास्तव में यूनानी भाषा में कितना अच्छा है।
  • भविष्य के लिए: यह कंपनियों को केवल अंग्रेजी परीक्षणों का अनुवाद करने के बजाय हर संस्कृति के लिए वास्तविक, मूल-भाषा परीक्षण बनाने के लिए प्रोत्साहित करता है। यदि हम चाहते हैं कि AI वास्तव में यूनानियों के लिए उपयोगी हो, तो उसे यूनानी शब्दों को ही नहीं, बल्कि यूनानी संस्कृति को भी समझना होगा।

संक्षेप में: लेखकों ने AI को "दिखावा करने" से रोकने के लिए एक वास्तविक, प्रामाणिक यूनानी परीक्षा बनाई। उन्होंने पाया कि हालांकि सबसे बड़े AI स्मार्ट हैं, लेकिन जो विशेष रूप से यूनानी संस्कृति पर प्रशिक्षित हैं, वे ही भाषा के असली चैंपियन हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →