← नवीनतम पेपर
💬 NLP

BenchMarker: An Education-Inspired Toolkit for Highlighting Flaws in Multiple-Choice Benchmarks

यह शोध पत्र BenchMarker प्रस्तुत करता है, जो एक शिक्षा-प्रेरित टूलकिट है जो बहुविकल्पीय बेंचमार्क में संदूषण (contamination), शॉर्टकट और लेखन त्रुटियों का पता लगाने के लिए LLM जजों का उपयोग करता है, जिससे यह पता चलता है कि इस तरह के दोष 12 प्रमुख डेटासेट में बने हुए हैं, मूल्यांकन मेट्रिक्स को महत्वपूर्ण रूप से विकृत करते हैं, और अक्सर पहले से सुधारे गए बेंचमार्क्स में भी उभर आते हैं।

मूल लेखक: Nishant Balepur, Bhavya Rajasekaran, Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nishant Balepur, Bhavya Rajasekaran, Jane Oh, Michael Xie, Atrey Desai, Vipul Gupta, Steven James Moore, Eunsol Choi, Rachel Rudinger, Jordan Lee Boyd-Graber

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शिक्षक हैं जो अपने छात्रों के लिए एक अंतिम परीक्षा तैयार कर रहे हैं। आप चाहते हैं कि परीक्षा निष्पक्ष, स्पष्ट हो और वास्तव में यह मापे कि छात्रों ने क्या सीखा है, न कि केवल यह कि वे कितनी अच्छी तरह से नकल कर सकते हैं या अनुमान लगा सकते हैं।

अब, कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, शोधकर्ता बिल्कुल यही काम कर रहे हैं। वे AI मॉडल्स की बुद्धिमत्ता को परखने के लिए "परीक्षाएं" (जिन्हें बेंचमार्क कहा जाता है) बनाते हैं। लेकिन, इस पेपर के अनुसार, इनमें से कई AI परीक्षाएं खराब हैं। ये टाइपो (लिखने की गलतियों), भ्रमित करने वाले प्रश्नों और कुछ ऐसे प्रश्नों से भरी हैं जिन्हें ऑनलाइन ढूंढना बहुत आसान है, जिससे AI केवल सोचने के बजाय उत्तरों को याद करके "नकल" कर रहा है।

इस पेपर के लेखक, जो विश्वविद्यालयों और Scale AI जैसी कंपनियों के शोधकर्ताओं की एक टीम है, ने BenchMarker नामक एक नया टूल बनाया है। BenchMarker को एक अत्यंत सख्त, शिक्षा-पारखी टीचिंग असिस्टेंट की तरह समझें जिसका एकमात्र काम AI द्वारा परीक्षा देने से पहले उन परीक्षाओं की जांच करना है।

यहाँ बताया गया है कि BenchMarker कैसे काम करता है, जिसमें एक खराब परीक्षा प्रश्न को पहचानने के तीन सरल तरीके दिए गए हैं:

1. "नकल" की जाँच (कंटैमिनेशन/Contamination)

समस्या: कल्पना कीजिए कि आप एक छात्र को गणित का एक सवाल देते हैं, लेकिन वही सटीक सवाल पिछले हफ्ते एक लोकप्रिय होमवर्क-हेल्प वेबसाइट पर पोस्ट किया गया था। यदि छात्र उसे गूगल करता है, तो उसे तुरंत उत्तर मिल जाता है। उसने गणित नहीं सीखा; उसने केवल उत्तर कुंजी ढूंढ ली।
BenchMarker का समाधान: BenchMarker एक जासूस की तरह काम करता है। यह AI परीक्षा के हर प्रश्न को लेता है और पूरे इंटरनेट को खंगालता है। यदि इसे वह प्रश्न (या उत्तर) किसी वेबसाइट पर मिलता है, तो यह उसे "Contaminated" (दूषित) के रूप में चिह्नित कर देता है।

  • परिणाम: उन्होंने पाया कि एक प्रसिद्ध टेस्ट (TruthfulQA) के लगभग आधे प्रश्न पहले से ही ऑनलाइन मौजूद थे। AI बुद्धिमान नहीं था; वह केवल इंटरनेट पर देखी गई चीजों को याद कर रहा था।

2. "ट्रिक क्वेश्चन" की जाँच (शॉर्टकट/Shortcuts)

समस्या: कल्पना कीजिए कि एक बहुविकल्पीय प्रश्न है जहाँ प्रश्न पूछता है, "इनमें से कौन सा एक फल है?" विकल्प हैं: A) कार, B) कुत्ता, C) सेब, D) ट्रक।
आपको प्रश्न पढ़ने की भी ज़रूरत नहीं है यह जानने के लिए कि उत्तर सेब है। यह एकमात्र फल है। AI प्रश्न को समझे बिना, केवल विकल्पों को देखकर ही उत्तर का अनुमान लगा सकता है। यह एक "शॉर्टकट" है।
BenchMarker का समाधान: BenchMarker "प्रश्न का अनुमान लगाओ" का खेल खेलता है। यह विकल्पों (कार, कुत्ता, सेब, ट्रक) को लेता है और एक अत्यंत बुद्धिमान AI से पूछता है, "तुम्हें क्या लगता है कि इन उत्तरों के साथ कौन सा प्रश्न जाता होगा?" यदि AI केवल विकल्पों को देखकर प्रश्न का अनुमान लगा सकता है, तो इसका मतलब है कि परीक्षा में एक शॉर्टकट है।

  • परिणाम: उन्होंने पाया कि कुछ परीक्षाएं इन ट्रिक्स से इतनी भरी हुई हैं कि AI वास्तव में सोचने के बजाय एक अनुमान लगाने वाला खेल खेल रहा है।

3. "ग्रामर पुलिस" की जाँच (लेखन त्रुटियां/Writing Errors)

समस्या: कल्पना कीजिए कि एक परीक्षा है जहाँ कुछ प्रश्न एक मूल अंग्रेजी भाषी द्वारा लिखे गए हैं, लेकिन अन्य एक रोबोट द्वारा लिखे गए हैं जिसने अंत में पूर्ण विराम लगाना भूल गया है, या जहाँ उत्तर विकल्प प्रश्न की व्याकरण संरचना से मेल नहीं खाते (जैसे, प्रश्न एक बहुवचन संज्ञा के लिए पूछता है, लेकिन सभी उत्तर एकवचन हैं)। यह छात्र को भ्रमित करता है और परीक्षा को अनुचित बनाता है।
BenchMarker का समाधान: BenchMarker वास्तविक शिक्षा विशेषज्ञों से लिए गए 19-बिंदु चेकलिस्ट का उपयोग करता है। यह निम्नलिखित चीजों की जांच करता है:

  • क्या व्याकरण सुसंगत है?
  • क्या उत्तर एक-दूसरे की तुलना में बहुत लंबे या बहुत छोटे हैं?
  • क्या केवल एक ही सही उत्तर है?
  • परिणाम: उन्होंने पाया कि कुछ AI बेंचमार्क बहुत ही अस्त-व्यस्त हैं। उदाहरण के लिए, HellaSwag नामक एक डेटासेट में, प्रत्येक एकल प्रश्न इन व्याकरण नियमों में से कम से कम दो का उल्लंघन करता था।

यह क्यों महत्वपूर्ण है?

यह पेपर दिखाता है कि जब आप इन खराब प्रश्नों को ठीक करते हैं, तो स्कोर नाटकीय रूप से बदल जाता है।

  • "नकली" उच्च स्कोर: जब AI "नकल" वाले प्रश्नों (कंटैमिनेशन) से भरी परीक्षा देता है, तो उसे उच्च स्कोर मिलता है। लेकिन यदि आप उन प्रश्नों को हटा देते हैं, तो स्कोर गिर जाता है। AI वास्तव में उतना बुद्धिमान नहीं था।
  • "नकली" निम्न स्कोर: जब परीक्षा टाइपो और खराब व्याकरण से भरी होती है, तो AI को कम स्कोर मिलता है। लेकिन इसका मतलब यह नहीं है कि AI मूर्ख है; इसका मतलब केवल यह है कि परीक्षा खराब तरीके से लिखी गई थी।
  • रैंकिंग में बदलाव: सबसे चौंकाने वाला निष्कर्ष यह है कि इन त्रुटियों को ठीक करने से लीडरबोर्ड बदल जाता है। एक बार जब आप टेस्ट को साफ कर देते हैं, तो रैंक #1 पर रहने वाला AI मॉडल गिरकर #3 पर आ सकता है। यह एक ऐसी दौड़ की तरह है जहाँ विजेता ट्रैक टूटे होने के कारण समय से पहले ही फिनिश लाइन पार कर गया था।

बड़ा सबक

लेखकों का कहना है कि लंबे समय से, AI शोधकर्ता इन परीक्षणों को केवल फिर से लिखकर ठीक करने की कोशिश कर रहे हैं। लेकिन वे अक्सर एक समस्या को ठीक करते हैं और अनजाने में एक नई समस्या पैदा कर देते हैं (जैसे कि प्रश्नों को इतना कठिन बना देना कि वे भ्रमित करने वाले हो जाएं)।

BenchMarker ही समाधान है। यह एक टूलकिट है जो शोधकर्ताओं को उनके परीक्षणों का ऑडिट करने में मदद करता है, ठीक वैसे ही जैसे एक शिक्षक परीक्षा बांटने से पहले उसकी समीक्षा करता है। मानव शिक्षा के नियमों को अपनाकर, वे बेहतर, अधिक निष्पक्ष और अधिक ईमानदार आर्टिफिशियल इंटेलिजेंस परीक्षण बनाने की उम्मीद करते हैं।

संक्षेप में: BenchMarker वह टूल है जो AI को नकल करने, अनुमान लगाने और खराब व्याकरण से भ्रमित होने से रोकता है, यह सुनिश्चित करता है कि जब हम कहें कि एक AI "स्मार्ट" है, तो हमारा वास्तव में वही अर्थ हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →