Automated Benchmark Auditing for AI Agents and Large Language Models
यह शोध पत्र ऑटो बेंचमार्क ऑडिट (ABA) प्रस्तुत करता है, जो एक एजेंटिक फ्रेमवर्क है जो व्यवस्थित रूप से 25% से अधिक AI बेंचमार्क में महत्वपूर्ण खामियों की पहचान करता है, यह प्रदर्शित करते हुए कि इन समस्याग्रस्त कार्यों को हटाने से मॉडल रैंकिंग महत्वपूर्ण रूप से बदल जाती है और प्रदर्शन मेट्रिक्स में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया एक विशाल, उच्च-दांव वाले स्पोर्ट्स लीग की तरह है। यह तय करने के लिए कि सबसे अच्छे खिलाड़ी (AI मॉडल्स) कौन हैं, हम प्रतियोगिताएं आयोजित करते हैं जिन्हें बेंचमार्क (benchmarks) कहा जाता है। ये मानकीकृत परीक्षणों या बाधा कोर्स (obstacle courses) की तरह हैं, जिन्हें यह देखने के लिए डिज़ाइन किया गया है कि कोई AI कितना स्मार्ट या सक्षम है।
वर्षों से, इन प्रतियोगिताओं को चलाने वाले लोग यह सुनिश्चित करने के लिए नियमों की मैन्युअल रूप से जांच कर रहे हैं कि परीक्षण निष्पक्ष हो। लेकिन जैसे-जैसे AI खिलाड़ी अधिक जटिल होते गए, परीक्षण भी अविश्वसनीय रूप से जटिल होते गए। अब उनमें वर्चुअल कंप्यूटर, छिपे हुए डिपेंडेंसीज़ और पेचीदा ग्रेडिंग स्क्रिप्ट शामिल हैं जिन्हें इंसानों के लिए स्पॉट-चेक करना कठिन है।
यह पेपर एक नया टूल पेश करता है जिसे ऑटो बेंचमार्क ऑडिट (Auto Benchmark Audit - ABA) कहा जाता है। इसे एक सुपर-डिटेक्टिव रोबोट के रूप में सोचें जिसका एकमात्र काम इन प्रतियोगिताओं का ऑडिट करना है ताकि किसी के भी खेलने से पहले बग्स, जाल और अनुचित नियमों को खोजा जा सके।
यहाँ यह पेपर इसे सरल उपमाओं (analogies) का उपयोग करके समझाता है:
1. समस्या: "टूटा हुआ बाधा कोर्स" (The Broken Obstacle Course)
लेखकों का तर्क है कि कई वर्तमान AI परीक्षण गुप्त रूप से टूटे हुए हैं, भले ही वे कागज़ पर एकदम सही दिखते हों।
- छिपा हुआ जाल: कल्पना कीजिए कि एक दौड़ है जहाँ निर्देश कहते हैं, "फिनिश लाइन तक दौड़ें," लेकिन फिनिश लाइन वास्तव में एक बंद इमारत के अंदर है जिसके बारे में धावकों को बताया ही नहीं गया था। धावक इसलिए असफल नहीं होते क्योंकि वे धीमे हैं, बल्कि इसलिए क्योंकि कोर्स में हेरफेर किया गया था।
- अस्पष्ट निर्देश: या कल्पना कीजिए कि एक परीक्षण कहता है, "बिल्ली के बारे में एक कविता लिखें," लेकिन ग्रेडिंग करने वाला रोबोट केवल उन कविताओं को स्वीकार करता है जो एक विशिष्ट, बिना बताए गए तरीके से तुकबंदी करती हैं। यदि आप एक बेहतरीन कविता लिखते हैं जो उस तरीके से तुकबंदी नहीं करती है, तो आपको शून्य मिलता है।
- लापता उपकरण: कभी-कभी परीक्षण AI को एक विशिष्ट उपकरण (जैसे रिंच/wrench) का उपयोग करने के लिए कहता है, लेकिन AI का "वर्कशॉप" (कंप्यूटर वातावरण) में वास्तव में वह रिंच मौजूद ही नहीं होता।
पेपर का दावा है कि मानव विशेषज्ञ बहुत व्यस्त या बहुत भरोसेमंद होते हैं, जिससे वे इन सूक्ष्म त्रुटियों को पकड़ने में विफल रहते हैं। वे अक्सर यह मान लेते हैं कि परीक्षण निष्पक्ष है क्योंकि उन्होंने इसे बनाया है, और वे उन छोटी बारीकियों को मिस कर देते हैं जो इसे पास करना असंभव बना देती हैं।
2. समाधान: "रोबोट डिटेक्टिव" (ABA)
लेखकों ने एक एजेंटिक फ्रेमवर्क (एक स्मार्ट AI सिस्टम) बनाया है जिसे ABA कहा जाता है, जो इन परीक्षणों के माध्यम से जाकर खामियों को ढूंढता है।
- यह कैसे काम करता है: निर्देशों को केवल पढ़ने के बजाय, ABA एक जासूस की तरह काम करता है। इसके दो मोड हैं:
- स्टैटिक मोड (Static Mode): यह नियम पुस्तिका, प्रश्नों और ग्रेडिंग कोड को पढ़ता है ताकि यह देख सके कि क्या वे तार्किक रूप से सही हैं।
- ट्रैजेक्टरी मोड (Trajectory Mode): यह वास्तव में एक "प्रैक्टिस रन" देखता है जहाँ एक AI समस्या को हल करने की कोशिश करता है। यह देखता है कि AI कहाँ अटक रहा है, कौन से टूल्स गायब हैं, या क्या ग्रेडिंग स्क्रिप्ट क्रैश हो रही है।
- रिपोर्ट: जब ABA को कोई समस्या मिलती है, तो वह केवल यह नहीं कहता कि "यह बुरा है।" यह एक विस्तृत रिपोर्ट कार्ड देता है:
- श्रेणी (Category): क्या यह एक बुरा प्रश्न है? एक टूटा हुआ वातावरण है? या एक अनुचित ग्रेडर है?
- गंभीरता (Severity): क्या यह एक मामूली परेशानी है (जैसे टाइपो) या एक बड़ा मुद्दा (जैसे टेस्ट पास करना असंभव है)?
- सुधार (The Fix): यह सुझाव देता है कि नियम को कैसे फिर से लिखा जाए या कोड को कैसे ठीक किया जाए ताकि यह निष्पक्ष हो सके।
3. जांच: उन्होंने क्या पाया
टीम ने अपने रोबोट डिटेक्टिव को 168 अलग-अलग प्रतियोगिताओं का ऑडिट करने के लिए भेजा जिसमें 34,000 से अधिक कार्य (tasks) शामिल थे। इनमें कोडिंग और गणित से लेकर मेडिकल सलाह और सुरक्षा तक सब कुछ शामिल था।
चौंकाने वाले परिणाम:
- 4 में से 1 से अधिक कार्य टूटे हुए हैं: उन्होंने पाया कि 25.7% कार्यों में "प्रमुख" (Major) समस्याएं थीं। इसका मतलब है कि दुनिया के सबसे स्मार्ट AI को रैंक करने के लिए उपयोग किए जाने वाले लगभग एक चौथाई समस्याएं मौलिक रूप से दोषपूर्ण थीं।
- "साफ" कार्य दुर्लभ हैं: 60% से कम कार्य वास्तव में "क्लीन" (पूरी तरह निष्पक्ष) थे।
- अलग-अलग क्षेत्र, अलग-अलग समस्याएं:
- गणित के परीक्षणों में ज्यादातर निर्देश खराब थे (प्रश्न अस्पष्ट था)।
- कोडिंग परीक्षणों में अक्सर वातावरण टूटा हुआ था (कंप्यूटर में सही सॉफ्टवेयर इंस्टॉल नहीं था)।
- सुरक्षा परीक्षणों में अक्सर अनुचित ग्रेडर थे (रोबोट जज बहुत सख्त या बहुत ढीला था)।
4. प्रभाव: यह लीडरबोर्ड को कैसे बदलता है
पेपर का सबसे महत्वपूर्ण हिस्सा वह है जो तब होता है जब वे टूटे हुए कार्यों को हटा देते हैं।
- "रैंकिंग शफल" (The Ranking Shuffle): जब उन्होंने टूटे हुए कार्यों को प्रतियोगिताओं से निकाला और स्कोर को फिर से चलाया, तो लीडरबोर्ड बदल गया। कुछ AI मॉडल जो नीचे रैंक किए गए थे, वे अचानक ऊपर आ गए, जबकि अन्य नीचे गिर गए।
- स्कोर में उछाल: टूटे हुए कार्यों को हटाने के बाद AI मॉडल्स के स्कोर में औसतन लगभग 9-10% की वृद्धि हुई। यह साबित करता है कि मॉडल उतने "बेवकूफ" नहीं थे जितना कि हम सोचते थे; वे केवल इसलिए असफल हो रहे थे क्योंकि परीक्षण उनके खिलाफ हेरफेर किए गए थे।
5. सत्यापन: क्या डिटेक्टिव ने सही पकड़ा?
यह सुनिश्चित करने के लिए कि उनका रोबोट डिटेक्टिव केवल मनगढ़ंत बातें नहीं कर रहा है, लेखकों ने अपने निष्कर्षों की वास्तविक दुनिया की घटनाओं के साथ जांच की:
- "द वाइल्ड में फिक्स" (The Fix in the Wild): उन्होंने ऐसे मामले पाए जहां बेंचमार्क के मूल रचनाकारों ने पहले ही उन्हीं समस्याओं को ठीक कर दिया था जिन्हें रोबोट ने खोजा था, लेकिन बिना रोबोट की मदद के।
- विशेषज्ञ समीक्षा: मानव विशेषज्ञों ने रोबोट के निष्कर्षों की समीक्षा की और इस बात से सहमत हुए कि रोबोट टूटे हुए परीक्षणों के बारे में सही था।
सारांश
संक्षेप में, यह पेपर कहता है: "हमने AI परीक्षणों की जांच करने के लिए एक रोबोट बनाया, और हमने पाया कि उनमें से लगभग एक चौथाई टूटे हुए हैं। जब हम परीक्षणों को ठीक करते हैं, तो AI स्कोर महत्वपूर्ण रूप से बदल जाते हैं, जो यह साबित करता है कि हम AI प्रगति को सटीक रूप से नहीं माप रहे हैं।"
लेखक अपने रोबोट डिटेक्टिव और उनके द्वारा पाए गए सभी डेटा को जारी कर रहे हैं ताकि AI समुदाय इन परीक्षणों को ठीक करना शुरू कर सके और भविष्य के लिए बेहतर, निष्पक्ष प्रतियोगिताएं बना सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।