GreekMMLU: A Native-Sourced Multitask Benchmark for Evaluating Language Models in Greek
यह शोधपत्र GreekMMLU को प्रस्तुत करता है, जो 45 विषयों में 21,000 से अधिक बहुविकल्पीय प्रश्नों वाला एक व्यापक, मूल-स्रोत (native-sourced) बेंचमार्क है, जिसे ग्रीक भाषा के मॉडलों के लिए प्रामाणिक मूल्यांकन उपकरणों की कमी को दूर करने के लिए डिज़ाइन किया गया है और जो फ्रंटियर, ओपन-वेट और ग्रीक-अनुकूलित मॉडलों के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास ज्ञान का एक विशाल पुस्तकालय है, और उसके अंदर अंग्रेजी में लिखी हजारों किताबें हैं। अब, कल्पना कीजिए कि आप एक नए AI रोबोट की बुद्धिमत्ता का परीक्षण करना चाहते हैं। आप उसे उन अंग्रेजी किताबों पर आधारित एक क्विज़ देते हैं। यदि रोबोट उच्च स्कोर प्राप्त करता है, तो आप सोचते हैं, "वाह, यह रोबोट तो जीनियस है!"
लेकिन यहाँ एक समस्या है: क्या होगा यदि आप उसी रोबोट का परीक्षण यूनानी (Greek) संस्कृति, इतिहास और भाषा पर करना चाहते हैं?
यदि आप केवल अंग्रेजी क्विज़ लेते हैं और उसे मशीन ट्रांसलेटर का उपयोग करके यूनानी में बदल देते हैं, तो रोब melalui उच्च स्कोर प्राप्त कर सकता है। लेकिन ऐसा इसलिए नहीं है क्योंकि वह यूनानी समझता है; बल्कि इसलिए क्योंकि वह उस अंग्रेजी संस्करण के आधार पर अनुमान लगाने में कुशल है जिसे वह पहले से जानता है। यह वैसा ही है जैसे किसी को ऐसी भाषा में कविता सुनाने के लिए कहना जिसे वे नहीं बोलते, लेकिन उन्होंने अंग्रेजी अनुवाद याद कर लिया है और बस शब्दों को उल्टा-पुल्टा पढ़ रहे हैं। वे भाषा जानते हुए प्रतीत होते हैं, लेकिन वे वास्तव में अर्थ, चुटकुलों या सांस्कृतिक हृदय को नहीं समझते हैं।
यही वह समस्या है जिसे इस पेपर के लेखकों ने ठीक करने की कोशिश की है।
समस्या: "अनुवादित" जाल (The "Translated" Trap)
लंबे समय तक, AI को यूनानी भाषा पर परखने के लिए, शोधकर्ताओं ने केवल अंग्रेजी परीक्षणों को लिया और उनका अनुवाद किया। यह एक शेफ की प्रामाणिक यूनानी भोजन बनाने की क्षमता को फ्रांसीसी से अनुवादित रेसिपी देकर आंकने जैसा है। सामग्री वहां हो सकती है, लेकिन स्वाद गलत है। AI बारीकियों, यूनानी लोग अपने इतिहास के बारे में कैसे सोचते हैं, और उनकी भाषा की अनूठी संरचना को मिस कर देता है।
समाधान: GreekMMLU (द "नेटिव" क्विज़)
टीम ने GreekMMLU बनाया, जो एक बिल्कुल नया, प्रामाणिक यूनानी परीक्षण बनाने जैसा है।
- प्रश्न कहाँ से आए? अंग्रेजी का अनुवाद करने के बजाय, वे सीधे स्रोत पर गए: वास्तविक यूनानी स्कूली परीक्षाएँ, विश्वविद्यालय की परीक्षाएँ, पेशेवर लाइसेंसिंग परीक्षाएँ (जैसे डॉक्टरों या वकीलों के लिए), और यहाँ तक कि ड्राइविंग टेस्ट भी।
- इसके अंदर क्या है? यह 45 अलग-अलग विषयों को कवर करने वाले 21,805 प्रश्नों का एक विशाल संग्रह है।
- STEM: गणित, भौतिकी, जीव विज्ञान।
- मानविकी (Humanities): यूनानी पौराणिक कथाएं, इतिहास, साहित्य।
- सामाजिक विज्ञान: अर्थशास्त्र, कानून, राजनीति।
- यूनानी-विशिष्ट: ऐसी चीजें जो केवल एक यूनानी वक्ता ही जान सकता है, जैसे यूनानी ड्राइविंग के नियम या यूनानी रूढ़िवादी परंपराओं के विवरण।
- "सीक्रेट सॉस" (The Secret Sauce): उन्होंने प्रश्नों को दो ढेरों में विभाजित किया। एक ढेर सार्वजनिक है (ताकि कोई भी अपने AI का परीक्षण कर सके), और दूसरा "गुप्त" ढेर है जिसे एक तिजोरी में रखा गया है। यह AI कंपनियों को परीक्षण होने से पहले ही उत्तरों को याद करने (एक समस्या जिसे "डेटा कंटैमिनेशन" कहा जाता है) से रोकता है।
बड़ा प्रयोग: किसने टेस्ट पास किया?
लेखकों ने 80 से अधिक विभिन्न AI मॉडल (दोनों मुफ्त, ओपन-सोर्स और महंगे, क्लोज्ड-सोर्स) को लिया और उन्हें यह यूनानी क्विज़ दिया। यहाँ उन्होंने पाया, कुछ सरल उपमाओं का उपयोग करते हुए:
"बड़े दिमाग" बनाम "छोटे दिमाग":
- सबसे बड़े, सबसे शक्तिशाली AI मॉडल (जैसे Google और OpenAI के मॉडल) बहुत अच्छा प्रदर्शन करते हैं। वे उन छात्रों की तरह हैं जिन्होंने पुस्तकालय की हर किताब पढ़ ली है।
- छोटे, ओपन-सोर्स मॉडल संघर्ष करते हैं। उनमें से कुछ का स्कोर रैंडम अनुमान लगाने से भी बहुत कम था। यह किसी ऐसे व्यक्ति को हाई स्कूल की भौतिकी परीक्षा देने जैसा है जिसने अभी तक मिडिल स्कूल भी पूरा नहीं किया है।
"विशेषज्ञ" बनाम "सामान्यज्ञ" (The "Specialist" vs. The "Generalist"):
- कुछ AI "सामान्यज्ञ" (Generalists) होते हैं—वे कई भाषाओं में बहुत कुछ के बारे में थोड़ा-थोड़ा जानते हैं।
- कुछ "विशेषज्ञ" (Specialists) होते हैं—उन्हें विशेष रूप से बेहतर यूनानी बोलने और समझने के लिए प्रशिक्षित किया गया था।
- परिणाम: विशेषज्ञ जीत गए! जो मॉडल विशेष रूप से यूनानी के लिए ट्यून किए गए थे (जैसे Llama-Krikri या Meltomi), उन्होंने समान आकार के सामान्य बहुभाषी मॉडलों की तुलना में बहुत बेहतर प्रदर्शन किया। यह एक स्थानीय टूर गाइड (विशेषज्ञ) बनाम एक ऐसे गाइड को काम पर रखने जैसा है जिसने केवल एक फ्रेजबुक से भाषा सीखी है (सामान्यज्ञ)। स्थानीय गाइड शॉर्टकट और छिपे हुए रत्नों को जानता है।
"निर्देश" का बढ़ावा (The "Instruction" Boost):
- उन्होंने पाया कि यदि आप AI को टेस्ट कैसे देना है यह "सिखाते" हैं (उसे उत्तर देने के उदाहरण देकर), तो वह अधिक स्मार्ट हो जाता है। इसे "इंस्ट्रक्शन ट्यूनिंग" कहा जाता है। यह एक छात्र को वास्तविक परीक्षा से पहले अभ्यास परीक्षा देने जैसा है; वे बहुत बेहतर प्रदर्शन करते हैं क्योंकि वे प्रारूप को समझते हैं।
यह क्यों मायने रखता है?
यह पेपर एक चेतावनी है। यह दिखाता है कि केवल इसलिए कि एक AI यूनानी बोलता है, इसका मतलब यह नहीं है कि वह यूनानी समझता है।
- शोधकर्ताओं के लिए: यह उन्हें एक निष्पक्ष, ईमानदार पैमाना देता है कि एक AI वास्तव में यूनानी भाषा में कितना अच्छा है।
- भविष्य के लिए: यह कंपनियों को केवल अंग्रेजी परीक्षणों का अनुवाद करने के बजाय हर संस्कृति के लिए वास्तविक, मूल-भाषा परीक्षण बनाने के लिए प्रोत्साहित करता है। यदि हम चाहते हैं कि AI वास्तव में यूनानियों के लिए उपयोगी हो, तो उसे यूनानी शब्दों को ही नहीं, बल्कि यूनानी संस्कृति को भी समझना होगा।
संक्षेप में: लेखकों ने AI को "दिखावा करने" से रोकने के लिए एक वास्तविक, प्रामाणिक यूनानी परीक्षा बनाई। उन्होंने पाया कि हालांकि सबसे बड़े AI स्मार्ट हैं, लेकिन जो विशेष रूप से यूनानी संस्कृति पर प्रशिक्षित हैं, वे ही भाषा के असली चैंपियन हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।