BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks
यह शोध पत्र BenchMarker प्रस्तुत करता है, जो एक शिक्षा-प्रेरित टूलकिट है जो बहुविकल्पीय बेंचमार्क में संदूषण (contamination), शॉर्टकट और लेखन त्रुटियों का पता लगाने के लिए LLM जजों का उपयोग करता है, जिससे यह पता चलता है कि इस तरह के दोष 12 प्रमुख डेटासेट में बने हुए हैं, मूल्यांकन मेट्रिक्स को महत्वपूर्ण रूप से विकृत करते हैं, और अक्सर पहले से सुधारे गए बेंचमार्क्स में भी उभर आते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक शिक्षक हैं जो अपने छात्रों के लिए एक अंतिम परीक्षा तैयार कर रहे हैं। आप चाहते हैं कि परीक्षा निष्पक्ष, स्पष्ट हो और वास्तव में यह मापे कि छात्रों ने क्या सीखा है, न कि केवल यह कि वे कितनी अच्छी तरह से नकल कर सकते हैं या अनुमान लगा सकते हैं।
अब, कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, शोधकर्ता बिल्कुल यही काम कर रहे हैं। वे AI मॉडल्स की बुद्धिमत्ता को परखने के लिए "परीक्षाएं" (जिन्हें बेंचमार्क कहा जाता है) बनाते हैं। लेकिन, इस पेपर के अनुसार, इनमें से कई AI परीक्षाएं खराब हैं। ये टाइपो (लिखने की गलतियों), भ्रमित करने वाले प्रश्नों और कुछ ऐसे प्रश्नों से भरी हैं जिन्हें ऑनलाइन ढूंढना बहुत आसान है, जिससे AI केवल सोचने के बजाय उत्तरों को याद करके "नकल" कर रहा है।
इस पेपर के लेखक, जो विश्वविद्यालयों और Scale AI जैसी कंपनियों के शोधकर्ताओं की एक टीम है, ने BenchMarker नामक एक नया टूल बनाया है। BenchMarker को एक अत्यंत सख्त, शिक्षा-पारखी टीचिंग असिस्टेंट की तरह समझें जिसका एकमात्र काम AI द्वारा परीक्षा देने से पहले उन परीक्षाओं की जांच करना है।
यहाँ बताया गया है कि BenchMarker कैसे काम करता है, जिसमें एक खराब परीक्षा प्रश्न को पहचानने के तीन सरल तरीके दिए गए हैं:
1. "नकल" की जाँच (कंटैमिनेशन/Contamination)
समस्या: कल्पना कीजिए कि आप एक छात्र को गणित का एक सवाल देते हैं, लेकिन वही सटीक सवाल पिछले हफ्ते एक लोकप्रिय होमवर्क-हेल्प वेबसाइट पर पोस्ट किया गया था। यदि छात्र उसे गूगल करता है, तो उसे तुरंत उत्तर मिल जाता है। उसने गणित नहीं सीखा; उसने केवल उत्तर कुंजी ढूंढ ली।
BenchMarker का समाधान: BenchMarker एक जासूस की तरह काम करता है। यह AI परीक्षा के हर प्रश्न को लेता है और पूरे इंटरनेट को खंगालता है। यदि इसे वह प्रश्न (या उत्तर) किसी वेबसाइट पर मिलता है, तो यह उसे "Contaminated" (दूषित) के रूप में चिह्नित कर देता है।
- परिणाम: उन्होंने पाया कि एक प्रसिद्ध टेस्ट (TruthfulQA) के लगभग आधे प्रश्न पहले से ही ऑनलाइन मौजूद थे। AI बुद्धिमान नहीं था; वह केवल इंटरनेट पर देखी गई चीजों को याद कर रहा था।
2. "ट्रिक क्वेश्चन" की जाँच (शॉर्टकट/Shortcuts)
समस्या: कल्पना कीजिए कि एक बहुविकल्पीय प्रश्न है जहाँ प्रश्न पूछता है, "इनमें से कौन सा एक फल है?" विकल्प हैं: A) कार, B) कुत्ता, C) सेब, D) ट्रक।
आपको प्रश्न पढ़ने की भी ज़रूरत नहीं है यह जानने के लिए कि उत्तर सेब है। यह एकमात्र फल है। AI प्रश्न को समझे बिना, केवल विकल्पों को देखकर ही उत्तर का अनुमान लगा सकता है। यह एक "शॉर्टकट" है।
BenchMarker का समाधान: BenchMarker "प्रश्न का अनुमान लगाओ" का खेल खेलता है। यह विकल्पों (कार, कुत्ता, सेब, ट्रक) को लेता है और एक अत्यंत बुद्धिमान AI से पूछता है, "तुम्हें क्या लगता है कि इन उत्तरों के साथ कौन सा प्रश्न जाता होगा?" यदि AI केवल विकल्पों को देखकर प्रश्न का अनुमान लगा सकता है, तो इसका मतलब है कि परीक्षा में एक शॉर्टकट है।
- परिणाम: उन्होंने पाया कि कुछ परीक्षाएं इन ट्रिक्स से इतनी भरी हुई हैं कि AI वास्तव में सोचने के बजाय एक अनुमान लगाने वाला खेल खेल रहा है।
3. "ग्रामर पुलिस" की जाँच (लेखन त्रुटियां/Writing Errors)
समस्या: कल्पना कीजिए कि एक परीक्षा है जहाँ कुछ प्रश्न एक मूल अंग्रेजी भाषी द्वारा लिखे गए हैं, लेकिन अन्य एक रोबोट द्वारा लिखे गए हैं जिसने अंत में पूर्ण विराम लगाना भूल गया है, या जहाँ उत्तर विकल्प प्रश्न की व्याकरण संरचना से मेल नहीं खाते (जैसे, प्रश्न एक बहुवचन संज्ञा के लिए पूछता है, लेकिन सभी उत्तर एकवचन हैं)। यह छात्र को भ्रमित करता है और परीक्षा को अनुचित बनाता है।
BenchMarker का समाधान: BenchMarker वास्तविक शिक्षा विशेषज्ञों से लिए गए 19-बिंदु चेकलिस्ट का उपयोग करता है। यह निम्नलिखित चीजों की जांच करता है:
- क्या व्याकरण सुसंगत है?
- क्या उत्तर एक-दूसरे की तुलना में बहुत लंबे या बहुत छोटे हैं?
- क्या केवल एक ही सही उत्तर है?
- परिणाम: उन्होंने पाया कि कुछ AI बेंचमार्क बहुत ही अस्त-व्यस्त हैं। उदाहरण के लिए, HellaSwag नामक एक डेटासेट में, प्रत्येक एकल प्रश्न इन व्याकरण नियमों में से कम से कम दो का उल्लंघन करता था।
यह क्यों महत्वपूर्ण है?
यह पेपर दिखाता है कि जब आप इन खराब प्रश्नों को ठीक करते हैं, तो स्कोर नाटकीय रूप से बदल जाता है।
- "नकली" उच्च स्कोर: जब AI "नकल" वाले प्रश्नों (कंटैमिनेशन) से भरी परीक्षा देता है, तो उसे उच्च स्कोर मिलता है। लेकिन यदि आप उन प्रश्नों को हटा देते हैं, तो स्कोर गिर जाता है। AI वास्तव में उतना बुद्धिमान नहीं था।
- "नकली" निम्न स्कोर: जब परीक्षा टाइपो और खराब व्याकरण से भरी होती है, तो AI को कम स्कोर मिलता है। लेकिन इसका मतलब यह नहीं है कि AI मूर्ख है; इसका मतलब केवल यह है कि परीक्षा खराब तरीके से लिखी गई थी।
- रैंकिंग में बदलाव: सबसे चौंकाने वाला निष्कर्ष यह है कि इन त्रुटियों को ठीक करने से लीडरबोर्ड बदल जाता है। एक बार जब आप टेस्ट को साफ कर देते हैं, तो रैंक #1 पर रहने वाला AI मॉडल गिरकर #3 पर आ सकता है। यह एक ऐसी दौड़ की तरह है जहाँ विजेता ट्रैक टूटे होने के कारण समय से पहले ही फिनिश लाइन पार कर गया था।
बड़ा सबक
लेखकों का कहना है कि लंबे समय से, AI शोधकर्ता इन परीक्षणों को केवल फिर से लिखकर ठीक करने की कोशिश कर रहे हैं। लेकिन वे अक्सर एक समस्या को ठीक करते हैं और अनजाने में एक नई समस्या पैदा कर देते हैं (जैसे कि प्रश्नों को इतना कठिन बना देना कि वे भ्रमित करने वाले हो जाएं)।
BenchMarker ही समाधान है। यह एक टूलकिट है जो शोधकर्ताओं को उनके परीक्षणों का ऑडिट करने में मदद करता है, ठीक वैसे ही जैसे एक शिक्षक परीक्षा बांटने से पहले उसकी समीक्षा करता है। मानव शिक्षा के नियमों को अपनाकर, वे बेहतर, अधिक निष्पक्ष और अधिक ईमानदार आर्टिफिशियल इंटेलिजेंस परीक्षण बनाने की उम्मीद करते हैं।
संक्षेप में: BenchMarker वह टूल है जो AI को नकल करने, अनुमान लगाने और खराब व्याकरण से भ्रमित होने से रोकता है, यह सुनिश्चित करता है कि जब हम कहें कि एक AI "स्मार्ट" है, तो हमारा वास्तव में वही अर्थ हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।