← नवीनतम पेपर
🤖 AI

Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents

यह शोध पत्र तर्क देता है कि वर्तमान समुच्चय-स्कोर (aggregate-score) लीडरबोर्ड विविध परिनियोजन आयामों (deployment dimensions) को पकड़ने में अपनी असमर्थता के कारण वास्तविक दुनिया के एलएलएम (LLM) एजेंट प्रदर्शन की भविष्यवाणी करने में विफल रहते हैं, और इसके बजाय एक नए बारह-स्तरीय मापन उपकरण के माध्यम से आउट-ऑफ-डिस्ट्रीब्यूशन (out-of-distribution) सेटिंग्स में रैंक स्थिरता को प्राथमिकता देने वाले एक प्रेडिक्टिव-वैलिडिटी फ्रेमवर्क का प्रस्ताव देता है।

मूल लेखक: Dhaval C. Patel, Kaoutar El Maghraoui, Shuxin Lin, Yusheng Li, Tianjun Feng, Chun-Yi Tsai, Yihan Sun, Wei Alexander Xin, Akshat Bhandari, Tanisha Rathod, Aaron Fan, Sanskruti Vijay Shejwal, Tomas Pasi
प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dhaval C. Patel, Kaoutar El Maghraoui, Shuxin Lin, Yusheng Li, Tianjun Feng, Chun-Yi Tsai, Yihan Sun, Wei Alexander Xin, Akshat Bhandari, Tanisha Rathod, Aaron Fan, Sanskruti Vijay Shejwal, Tomas Pasiecznik, Sagar Chethan Kumar, Tanmay Agarwal, Rohith Kanathur, Sam Colman, Amaan Sheikh, Dev Bahl, Ann Li, Krish Veera, Alimurtaza Mustafa Merchant, Shambhawi Baswaraj Bhure, Sajal Kumar Goyla, Chengrui Li, Kirthana Natarajan, Rui Li, Thomas Ajai, Rujing Li, Vivek G. Iyer, Sanjaii Vijayakumar, Yitong Bai, Ayal Yakobe, Darief Maes, Yassine Jebbouri, Tianyang Xu, Thai Quoc On, Vera Mazeeva, Winston Li, Yuval Shemla, Yeshitha Bhuvanesh, Rushin Bhatt, Siddharth Chethan Gowda, Alisha Vinod, Caroline Cahill, Shriya Aishani Rachakonda, Yunfeng Chen, Aryaman Agrawal, Aman Upganlawar, Mao Le Jonathan Ang, Yubin Sally Go, Madhav Rajkondawar, Yang-Jung Chen, Trisha Maturi, Ananya Kapoor, Andrew Li, Shrey Arora, Mana Abbaszadeh, Shen Li, Charles Xu, Byeolah Kwon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप जटिल औद्योगिक मशीनों (जैसे विशाल एयर कंडीशनर या पावर ग्रिड ट्रांसफॉर्मर) के बेड़े के लिए सबसे अच्छे मैकेनिक को काम पर रखने की कोशिश कर रहे हैं। वर्तमान में, उद्योग यह तय करने के लिए कि किसे काम पर रखा जाए, एक लीडरबोर्ड (Leaderboard) का उपयोग करता है। यह लीडरबोर्ड एक रिपोर्ट कार्ड की तरह है जो प्रत्येक मैकेनिक को एक एकल ग्रेड देता है, जैसे "100 में से 85"।

यह पेपर तर्क देता है कि यह एकल ग्रेड एक जाल (trap) है। यह आपको बताता है कि कौन एक विशिष्ट परीक्षण में "अच्छा" है, लेकिन यह आपको यह नहीं बताता कि जब वास्तविक, अव्यवस्थित और अप्रत्याशित काम शुरू होगा, तो वास्तव में कौन सफल होगा।

यहाँ सरल उपमाओं का उपयोग करके पेपर के तर्क का विवरण दिया गया है:

1. समस्या: "एक-संख्या" का जाल (The "One-Number" Trap)

अभी, AI एजेंटों (मैकेनिकों) को एक एग्रीगेट स्कोर (aggregate score) द्वारा रैंक किया जाता है।

  • उपमा: कल्पना कीजिए कि दो मैकेनिक एक परीक्षा देते हैं।
    • मैकेनिक A योजना बनाने में जीनियस है लेकिन काम पूरा करने में 10 घंटे लेता है और ईंधन में बहुत अधिक खर्च करता है।
    • मैकेनिक B योजना बनाने में औसत है लेकिन 10 मिनट में काम पूरा कर देता है और बहुत कम ईंधन का उपयोग करता है।
    • यदि परीक्षण केवल एक "पास/फेल" स्कोर देता है, तो वे दोनों "A" ग्रेड प्राप्त कर सकते हैं।
  • वास्तविकता: वास्तविक दुनिया में, आप उस 10-घंटे वाले महंगे मैकेनिक को वहन नहीं कर सकते। एकल स्कोर लागत (cost), गति (speed) और कार्यशैली (style) को छिपा देता है। यह बहुत अलग दृष्टिकोणों को ऐसे मानता है जैसे वे एक ही हों।

2. साक्ष्य: "छिपी हुई परीक्षा" का आश्चर्य (The "Hidden Exam" Surprise)

लेखकों ने 149 टीमों वाली एक विशाल प्रतियोगिता का अध्ययन किया।

  • सेटअप: टीमों ने औद्योगिक समस्याओं को हल करने के लिए AI एजेंट बनाए। उन्हें एक "पब्लिक लीडरबोर्ड" (एक अभ्यास परीक्षा की तरह) पर रैंक किया गया।
  • ट्विस्ट: जब टीमों ने "हिडन एग्जाम" (वास्तविक तैनाती परीक्षण) दिया, तो रैंकिंग पूरी तरह से बिखर गई।
    • "प्लानिंग" ट्रैक के लिए, पब्लिक रैंकिंग हिडन रैंकिंग से कुछ हद तक मेल खाती थी।
    • "एग्जीक्यूशन" ट्रैक (वास्तव में काम करना) के लिए, सहसंबंध (correlation) नेगेटिव (negative) था। जिस टीम ने पब्लिक लीडरबोर्ड पर सबसे अच्छा प्रदर्शन किया था, उसने वास्तविक दुनिया में वास्तव में सबसे खराब प्रदर्शन किया।
  • सबक: एक स्थिर परीक्षण पर उच्च स्कोर यह भविष्यवाणी नहीं करता है कि एक एजेंट नई, अनदेखी स्थिति को कैसे संभालेगा। यह उस छात्र की तरह है जिसने अभ्यास गणित परीक्षण के उत्तर रट लिए हैं लेकिन जब संख्याएँ थोड़ी बदल जाती हैं, तो वह असफल हो जाता है।

3. दोष: "स्व-ग्रेडिंग" जज (The "Self-Grading" Judge)

अधिकांश लीडरबोर्ड AI के काम को ग्रेड करने के लिए एक AI का उपयोग करते हैं (जिसे "LLM-as-a-Judge" कहा जाता है)।

  • उपमा: कल्पना कीजिए कि एक शिक्षक अपने छात्रों के निबंधों को ग्रेड करता है, लेकिन वह शिक्षक भी एक AI है जो हर हफ्ते अपना मन बदल देता है। यदि शिक्षक का "मूड" (प्रॉम्प्ट) बदलता है, तो ग्रेड भी बदल जाते हैं, भले ही छात्र का काम वही हो।
  • जोखिम: लीडरबोर्ड अंततः एजेंट के वास्तविक कौशल के बजाय जज के अपने पूर्वाग्रहों (biases) को मापने लगता है। पेपर सुझाव देता है कि हमें काम को सत्यापित करने के लिए एक "नियम-आधारित रेफरी" (एक सख्त चेकलिस्ट की तरह) की आवश्यकता है, न कि केवल अनुमान लगाने वाले दूसरे AI की।

4. समाधान: "12-परत" निरीक्षण (The "12-Layer" Inspection)

लेखक "एक-संख्या" रैंकिंग को रोकने और 12-परत निरीक्षण शुरू करने का प्रस्ताव देते हैं।
इसके बजाय कि "स्कोर क्या है?" पूछा जाए, वे पूछते हैं "यह इन 12 विशिष्ट तरीकों से कैसे व्यवहार करता है?"
इसे एक कार सुरक्षा निरीक्षण (Car Safety Inspection) की तरह समझें, न कि केवल एक स्पीड टेस्ट की तरह। आप केवल यह नहीं जानना चाहते कि कार कितनी तेज चलती है; आपको यह भी जानना होगा:

  1. सफलता (Success): क्या इसने समस्या को ठीक किया?
  2. हाइजीन (Hygiene): क्या इसने उपकरणों को तोड़े बिना सही उपकरणों का उपयोग किया?
  3. योजना (Planning): क्या इसने कार्य करने से पहले सोचा?
  4. लागत (Cost): क्या यह बहुत महंगा था?
  5. विफलता मोड (Failure Modes): जब चीजें गलत होती हैं, तो यह कैसे टूटता है?
  6. इंफ्रास्ट्रक्चर (Infrastructure): क्या यह वास्तविक हार्डवेयर पर तेजी से चलता है?
  7. मल्टी-टर्न (Multi-Turn): क्या यह 5 सेकंड के बजाय 5 मिनट तक चलने वाली बातचीत को संभाल सकता है?
  8. तर्क (Reasoning): क्या यह जरूरत पड़ने पर गहराई से "सोचता" है, या केवल अनुमान लगाता है?
  9. ज्ञान (Knowledge): क्या यह मैनुअल देखता है, या केवल स्मृति (memory) पर भरोसा करता है?
  10. साक्ष्य (Evidence): क्या यह अनुमान के बजाय तथ्यों के साथ अपने उत्तर को सिद्ध कर सकता है?
    (और इसी तरह 12 आयाम)

5. नया लक्ष्य: "भविष्यवाणी वैधता" (Predictive Validity)

पेपर एजेंटों को रैंक करने का एक नया तरीका प्रस्तावित करता है जिसे प्रेडिक्टिव वैलिडिटी (Predictive Validity) कहा जाता है।

  • पुराना तरीका: उस टेस्ट के औसत स्कोर के आधार पर रैंक करें जो आपने अभी लिया है।
  • नया तरीका: इस आधार पर रैंक करें कि आपका टेस्ट स्कोर एक दूसरे टेस्ट पर आपके प्रदर्शन की कितनी अच्छी भविष्यवाणी करता है।
  • उपमा: यदि आप एक पायलट को काम पर रखना चाहते हैं, तो केवल शांत मौसम में सिम्युलेटर पर उनके स्कोर को न देखें। देखें कि उनका सिम्युलेटर स्कोर तूफान में उड़ने की उनकी क्षमता की कितनी अच्छी भविष्यवाणी करता है। यदि सहसंबंध (correlation) कम है, तो लीडरबोर्ड बेकार है।

सारांश

यह पेपर AI समुदाय के लिए एक चेतावनी है: एकल-संख्या वाले लीडरबोर्ड पर भरोसा करना बंद करें। यह एक "स्थिर स्नैपशॉट" है जो विफल हो जाता है जब वास्तविक दुनिया बदल जाती है।

इसके बजाय, हमें निम्नलिखित की आवश्यकता है:

  1. अधिक आयामों को मापना (गति, लागत, सुरक्षा, तर्क)।
  2. स्थिरता के लिए परीक्षण करना (क्या रैंकिंग तब बनी रहती है जब टेस्ट बदल जाता है?)।
  3. स्वतंत्र रेफरी का उपयोग करना (काम को ग्रेड करने के लिए नियम, न कि केवल अन्य AI)।

लेखक स्वीकार करते हैं कि उन्होंने अभी तक अंतिम "प्रूफ" प्रयोग नहीं चलाया है, लेकिन उन्होंने 14 अलग-अलग अध्ययनों से साक्ष्य एकत्र किए हैं जो दिखाते हैं कि वर्तमान प्रणाली टूटी हुई है और एक नया, बहु-स्तरीय दृष्टिकोण वास्तविक दुनिया में AI को उपयोगी बनाने के लिए आवश्यक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →