← नवीनतम पेपर
💬 NLP

BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

यह शोधपत्र बेंचगार्ड (BenchGuard) को प्रस्तुत करता है, जो एक स्वचालित ऑडिटिंग फ्रेमवर्क है जो टास्क-ओरिएंटेड एजेंट बेंचमार्क में दोषों को व्यवस्थित रूप से पहचानने और उन्हें मान्य करने के लिए फ्रंटियर एलएलएम (LLM) का लाभ उठाता है, जो कम लागत पर मानवीय समीक्षा द्वारा छूट जाने वाली महत्वपूर्ण त्रुटियों का पता लगाने में इसकी प्रभावशीलता को प्रदर्शित करता है।

मूल लेखक: Xinming Tu (Minta), Tianze Wang (Minta), Yingzhou (Minta), Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi

प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinming Tu (Minta), Tianze Wang (Minta), Yingzhou (Minta), Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक उच्च-दांव वाली कुकिंग प्रतियोगिता (cooking competition) चला रहे हैं जहाँ एक शेफ हैं। आपके पास व्यंजनों की एक सूची (बेंचमार्क) है जिसका पालन प्रतियोगियों (AI एजेंटों) को करना होगा ताकि वे सिद्ध कर सकें कि वे मास्टर शेफ हैं।

वर्षों तक, उद्योग ने यह मान लिया था कि यदि कोई प्रतियोगी रेसिपी में विफल रहता है, तो इसका कारण यह था कि प्रतियोगी पर्याप्त कुशल नहीं था। लेकिन यह पेपर, BENCHGUARD, तर्क देता है कि कभी-कभी रेसिपी ही खराब होती है। शायद रेसिपी कहती है "एक कप मैदा लें" लेकिन संदर्भ समाधान (reference solution) "एक कप चीनी" का उपयोग करता है। या शायद रेसिपी एक केक के बारे में पूछती है, लेकिन जज की स्कोरिंग शीट केवल एक पाई (pie) को ग्रेड करने के लिए जानती है।

लेखक इसे "समाधान का मोह" (solution fixation) कहते हैं: रेसिपी लिखने वाले लोग अपने काम करने के विशिष्ट तरीके में इतने फंस गए थे कि वे स्पष्ट निर्देश लिखना भूल गए, या उन्होंने अनजाने में एक ऐसा नियम लिख दिया जो वैध और रचनात्मक समाधानों को दंडित करता है।

समस्या: "टूटा हुआ पैमाना" (The Broken Ruler)

AI की दुनिया में, हम मॉडलों का परीक्षण वैज्ञानिक डेटा का विश्लेषण करने या सॉफ़्टवेयर बग्स को ठीक करने जैसे जटिल कार्यों पर करते हैं। ये परीक्षण केवल बहुविकल्पीय प्रश्न नहीं हैं; ये निर्देश, कोड और ग्रेडिंग स्क्रिप्ट के साथ पूर्ण कंप्यूटर प्रोग्राम हैं।

पेपर का तर्क है कि ये "पिकर" (rulers) जिनका उपयोग हम AI को मापने के लिए करते हैं, अक्सर टेढ़े होते हैं।

  • रेसिपी बनाम समाधान: निर्देश कह सकता है "फाइल A का विश्लेषण करें," लेकिन सही उत्तर कुंजी "फाइल B" का उपयोग करती है।
  • जज बनाम नियम: निर्देश रासायनिक कोड (SMILES) की एक सूची मांग सकते हैं, लेकिन ग्रेडिंग स्क्रिप्ट केवल रासायनिक नामों की जांच करती है।
  • छिपा हुआ जाल: क्योंकि इन परीक्षणों में कई चलते-फिरते हिस्से (निर्देश, कोड, वातावरण) शामिल हैं, इसलिए एक मानव विशेषज्ञ निर्देश और कोड को अलग-अलग देख सकता है और सोच सकता है, "यह ठीक लग रहा है!" वे इस तथ्य को मिस कर देते हैं कि वे वास्तव में एक-दूसरे से मेल नहीं खाते हैं।

समाधान: BENCHGUARD (द "सुपर-इंस्पेक्टर")

लेखकों ने BENCHGUARD नामक एक टूल बनाया है। इसे एक सुपर-इंस्पेक्टर के रूप में समझें जो प्रतियोगियों के खाना बनाना शुरू करने से पहले ही रेसिपी का ऑडिट करने के लिए एक अलग, बहुत स्मार्ट AI ("फ्रंटियर LLM") का उपयोग करता है।

केवल समस्या को हल करने के लिए AI से पूछने के बजाय, BENCHGUARD AI से खुद टेस्ट की आलोचना करने के लिए कहता है। यह पहेली के सभी टुकड़ों को देखता है—निर्देश, संदर्भ कोड, ग्रेडिंग स्क्रिप्ट और कंप्यूटर वातावरण—और यह जाँचता है कि क्या वे सभी एक-दूसरे के साथ सहमत हैं।

यह कैसे काम करता है (उपमा):
एक जासूस की कल्पना करें जो अपराध स्थल को देख रहा है।

  1. निर्देश: "चोर ने लाल फूलदान चुराया।"
  2. साक्ष्य (गोल्ड सॉल्यूशन): एक फोटो जिसमें दिखाया गया है कि नीला फूलदान चोरी हुआ था।
  3. ग्रेडिंग स्क्रिप्ट: एक नियम जो कहता है, "यदि रिपोर्ट में 'नीला' शब्द आता है, तो 0 अंक दें।"

एक इंसान चोर पर ध्यान केंद्रित करने के कारण इस विरोधाभास को मिस कर सकता है। BENCHGUARD वह जासूस है जो इन तीनों टुकड़ों को एक साथ देखता है और कहता है, "रुको जरा! निर्देश लाल कहता है, साक्ष्य नीले को दर्शाता है, और ग्रेडर उस व्यक्ति को दंडित कर रहा है जो रंग को नोटिस करता है। यह टेस्ट टूटा हुआ है।"

उन्होंने क्या पाया

टीम ने दो प्रसिद्ध वैज्ञानिक बेंचमार्क (ScienceAgentBench और BIXBench) पर BENCHGUARD का परीक्षण किया। परिणाम चौंकाने वाले थे:

  1. टूटे हुए टेस्ट आम हैं: यहाँ तक कि उन बेंचमार्क में जिन्हें मानव विशेषज्ञों द्वारा कई बार जांचा जा चुका था, BENCHGUARD ने एक डेटासेट में 12 पुष्ट त्रुटियां पाईं। इनमें से कुछ त्रुटियां इतनी गंभीर थीं कि वे कार्य वास्तव में सही ढंग से हल करना असंभव था।
  2. AI ने वह पकड़ा जो इंसान मिस कर गए: दूसरे डेटासेट पर, BENCHGUARD ने उन 83% त्रुटियों को खोज निकाला जिन्हें बाद में विशेषज्ञों की एक टीम ने पाया था। लेकिन इसने ऐसी नई त्रुटियां भी खोजीं जिन्हें इंसानों ने पूरी तरह से मिस कर दिया था।
  3. यह सस्ता है: इस सिस्टम के साथ 50 जटिल कार्यों का ऑडिट करने की लागत $15 से भी कम थी। यह सुनिश्चित करने के लिए एक बहुत छोटी कीमत है कि आपका पैमाना टेढ़ा न हो।

"क्रॉस-आर्टिफैक्ट" रहस्य (The "Cross-Artifact" Mystery)

पेपर एक विशिष्ट प्रकार की त्रुटि को उजागर करता है जिसे "क्रॉस-आर्टिफैक्ट मिसमैच" कहा जाता है।

  • मामला 1: निर्देश कहता है "फाइल X का उपयोग करें," लेकिन सही कोड "फाइल Y" का उपयोग करता है।
  • मामला 2: निर्देश कहता है "मुझे रासायनिक कोड की सूची दें," लेकिन ग्रेडिंग स्क्रिप्ट केवल "रासायनिक नाम" की जांच करती है।

ये त्रुटियां अदृश्य होती हैं यदि आप केवल निर्देश को देखें या केवल कोड को देखें। आपको उन्हें देखने के लिए उन्हें साथ में देखना होगा। BENCHGUARD विशेष रूप से इन छिपे हुए विरोधाभासों को पकड़ने के लिए डिज़ाइन किया गया है।

मुख्य निष्कर्ष

पेपर निष्कर्ष निकालता है कि हम अब यह जांचने के लिए केवल मानव विशेषज्ञों पर निर्भर नहीं रह सकते कि हमारे AI टेस्ट निष्पक्ष हैं या नहीं। इंसान थक जाते हैं, और वे अपने सोचने के तरीके के प्रति "एंकर" (anchored) हो जाते हैं।

लेखक काम करने का एक नया तरीका प्रस्तावित करते हैं: AI-असिस्टेड बेंचमार्किंग। इससे पहले कि हम यह देखने के लिए कोई टेस्ट प्रकाशित करें कि हमारा AI कितना स्मार्ट है, हमें एक स्मार्ट AI का उपयोग करके टेस्ट का ऑडिट करना चाहिए। यह एक दूसरे जोड़े की आंखों जैसा है जो कभी थकता नहीं है और विशेष रूप से उन विरोधाभासों को पकड़ने के लिए प्रशिक्षित है जिन्हें इंसान मिस कर देते हैं।

संक्षेप में: यदि आप जानना चाहते हैं कि आपका AI स्मार्ट है या नहीं, तो सुनिश्चित करें कि आप जो टेस्ट दे रहे हैं वह टूटा हुआ न हो। BENCHGUARD वह टूल है जो आपके टेस्ट को ठीक करता है ताकि परिणाम वास्तव में मायने रखें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →