Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents
यह शोध पत्र तर्क देता है कि वर्तमान समुच्चय-स्कोर (aggregate-score) लीडरबोर्ड विविध परिनियोजन आयामों (deployment dimensions) को पकड़ने में अपनी असमर्थता के कारण वास्तविक दुनिया के एलएलएम (LLM) एजेंट प्रदर्शन की भविष्यवाणी करने में विफल रहते हैं, और इसके बजाय एक नए बारह-स्तरीय मापन उपकरण के माध्यम से आउट-ऑफ-डिस्ट्रीब्यूशन (out-of-distribution) सेटिंग्स में रैंक स्थिरता को प्राथमिकता देने वाले एक प्रेडिक्टिव-वैलिडिटी फ्रेमवर्क का प्रस्ताव देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप जटिल औद्योगिक मशीनों (जैसे विशाल एयर कंडीशनर या पावर ग्रिड ट्रांसफॉर्मर) के बेड़े के लिए सबसे अच्छे मैकेनिक को काम पर रखने की कोशिश कर रहे हैं। वर्तमान में, उद्योग यह तय करने के लिए कि किसे काम पर रखा जाए, एक लीडरबोर्ड (Leaderboard) का उपयोग करता है। यह लीडरबोर्ड एक रिपोर्ट कार्ड की तरह है जो प्रत्येक मैकेनिक को एक एकल ग्रेड देता है, जैसे "100 में से 85"।
यह पेपर तर्क देता है कि यह एकल ग्रेड एक जाल (trap) है। यह आपको बताता है कि कौन एक विशिष्ट परीक्षण में "अच्छा" है, लेकिन यह आपको यह नहीं बताता कि जब वास्तविक, अव्यवस्थित और अप्रत्याशित काम शुरू होगा, तो वास्तव में कौन सफल होगा।
यहाँ सरल उपमाओं का उपयोग करके पेपर के तर्क का विवरण दिया गया है:
1. समस्या: "एक-संख्या" का जाल (The "One-Number" Trap)
अभी, AI एजेंटों (मैकेनिकों) को एक एग्रीगेट स्कोर (aggregate score) द्वारा रैंक किया जाता है।
- उपमा: कल्पना कीजिए कि दो मैकेनिक एक परीक्षा देते हैं।
- मैकेनिक A योजना बनाने में जीनियस है लेकिन काम पूरा करने में 10 घंटे लेता है और ईंधन में बहुत अधिक खर्च करता है।
- मैकेनिक B योजना बनाने में औसत है लेकिन 10 मिनट में काम पूरा कर देता है और बहुत कम ईंधन का उपयोग करता है।
- यदि परीक्षण केवल एक "पास/फेल" स्कोर देता है, तो वे दोनों "A" ग्रेड प्राप्त कर सकते हैं।
- वास्तविकता: वास्तविक दुनिया में, आप उस 10-घंटे वाले महंगे मैकेनिक को वहन नहीं कर सकते। एकल स्कोर लागत (cost), गति (speed) और कार्यशैली (style) को छिपा देता है। यह बहुत अलग दृष्टिकोणों को ऐसे मानता है जैसे वे एक ही हों।
2. साक्ष्य: "छिपी हुई परीक्षा" का आश्चर्य (The "Hidden Exam" Surprise)
लेखकों ने 149 टीमों वाली एक विशाल प्रतियोगिता का अध्ययन किया।
- सेटअप: टीमों ने औद्योगिक समस्याओं को हल करने के लिए AI एजेंट बनाए। उन्हें एक "पब्लिक लीडरबोर्ड" (एक अभ्यास परीक्षा की तरह) पर रैंक किया गया।
- ट्विस्ट: जब टीमों ने "हिडन एग्जाम" (वास्तविक तैनाती परीक्षण) दिया, तो रैंकिंग पूरी तरह से बिखर गई।
- "प्लानिंग" ट्रैक के लिए, पब्लिक रैंकिंग हिडन रैंकिंग से कुछ हद तक मेल खाती थी।
- "एग्जीक्यूशन" ट्रैक (वास्तव में काम करना) के लिए, सहसंबंध (correlation) नेगेटिव (negative) था। जिस टीम ने पब्लिक लीडरबोर्ड पर सबसे अच्छा प्रदर्शन किया था, उसने वास्तविक दुनिया में वास्तव में सबसे खराब प्रदर्शन किया।
- सबक: एक स्थिर परीक्षण पर उच्च स्कोर यह भविष्यवाणी नहीं करता है कि एक एजेंट नई, अनदेखी स्थिति को कैसे संभालेगा। यह उस छात्र की तरह है जिसने अभ्यास गणित परीक्षण के उत्तर रट लिए हैं लेकिन जब संख्याएँ थोड़ी बदल जाती हैं, तो वह असफल हो जाता है।
3. दोष: "स्व-ग्रेडिंग" जज (The "Self-Grading" Judge)
अधिकांश लीडरबोर्ड AI के काम को ग्रेड करने के लिए एक AI का उपयोग करते हैं (जिसे "LLM-as-a-Judge" कहा जाता है)।
- उपमा: कल्पना कीजिए कि एक शिक्षक अपने छात्रों के निबंधों को ग्रेड करता है, लेकिन वह शिक्षक भी एक AI है जो हर हफ्ते अपना मन बदल देता है। यदि शिक्षक का "मूड" (प्रॉम्प्ट) बदलता है, तो ग्रेड भी बदल जाते हैं, भले ही छात्र का काम वही हो।
- जोखिम: लीडरबोर्ड अंततः एजेंट के वास्तविक कौशल के बजाय जज के अपने पूर्वाग्रहों (biases) को मापने लगता है। पेपर सुझाव देता है कि हमें काम को सत्यापित करने के लिए एक "नियम-आधारित रेफरी" (एक सख्त चेकलिस्ट की तरह) की आवश्यकता है, न कि केवल अनुमान लगाने वाले दूसरे AI की।
4. समाधान: "12-परत" निरीक्षण (The "12-Layer" Inspection)
लेखक "एक-संख्या" रैंकिंग को रोकने और 12-परत निरीक्षण शुरू करने का प्रस्ताव देते हैं।
इसके बजाय कि "स्कोर क्या है?" पूछा जाए, वे पूछते हैं "यह इन 12 विशिष्ट तरीकों से कैसे व्यवहार करता है?"
इसे एक कार सुरक्षा निरीक्षण (Car Safety Inspection) की तरह समझें, न कि केवल एक स्पीड टेस्ट की तरह। आप केवल यह नहीं जानना चाहते कि कार कितनी तेज चलती है; आपको यह भी जानना होगा:
- सफलता (Success): क्या इसने समस्या को ठीक किया?
- हाइजीन (Hygiene): क्या इसने उपकरणों को तोड़े बिना सही उपकरणों का उपयोग किया?
- योजना (Planning): क्या इसने कार्य करने से पहले सोचा?
- लागत (Cost): क्या यह बहुत महंगा था?
- विफलता मोड (Failure Modes): जब चीजें गलत होती हैं, तो यह कैसे टूटता है?
- इंफ्रास्ट्रक्चर (Infrastructure): क्या यह वास्तविक हार्डवेयर पर तेजी से चलता है?
- मल्टी-टर्न (Multi-Turn): क्या यह 5 सेकंड के बजाय 5 मिनट तक चलने वाली बातचीत को संभाल सकता है?
- तर्क (Reasoning): क्या यह जरूरत पड़ने पर गहराई से "सोचता" है, या केवल अनुमान लगाता है?
- ज्ञान (Knowledge): क्या यह मैनुअल देखता है, या केवल स्मृति (memory) पर भरोसा करता है?
- साक्ष्य (Evidence): क्या यह अनुमान के बजाय तथ्यों के साथ अपने उत्तर को सिद्ध कर सकता है?
(और इसी तरह 12 आयाम)।
5. नया लक्ष्य: "भविष्यवाणी वैधता" (Predictive Validity)
पेपर एजेंटों को रैंक करने का एक नया तरीका प्रस्तावित करता है जिसे प्रेडिक्टिव वैलिडिटी (Predictive Validity) कहा जाता है।
- पुराना तरीका: उस टेस्ट के औसत स्कोर के आधार पर रैंक करें जो आपने अभी लिया है।
- नया तरीका: इस आधार पर रैंक करें कि आपका टेस्ट स्कोर एक दूसरे टेस्ट पर आपके प्रदर्शन की कितनी अच्छी भविष्यवाणी करता है।
- उपमा: यदि आप एक पायलट को काम पर रखना चाहते हैं, तो केवल शांत मौसम में सिम्युलेटर पर उनके स्कोर को न देखें। देखें कि उनका सिम्युलेटर स्कोर तूफान में उड़ने की उनकी क्षमता की कितनी अच्छी भविष्यवाणी करता है। यदि सहसंबंध (correlation) कम है, तो लीडरबोर्ड बेकार है।
सारांश
यह पेपर AI समुदाय के लिए एक चेतावनी है: एकल-संख्या वाले लीडरबोर्ड पर भरोसा करना बंद करें। यह एक "स्थिर स्नैपशॉट" है जो विफल हो जाता है जब वास्तविक दुनिया बदल जाती है।
इसके बजाय, हमें निम्नलिखित की आवश्यकता है:
- अधिक आयामों को मापना (गति, लागत, सुरक्षा, तर्क)।
- स्थिरता के लिए परीक्षण करना (क्या रैंकिंग तब बनी रहती है जब टेस्ट बदल जाता है?)।
- स्वतंत्र रेफरी का उपयोग करना (काम को ग्रेड करने के लिए नियम, न कि केवल अन्य AI)।
लेखक स्वीकार करते हैं कि उन्होंने अभी तक अंतिम "प्रूफ" प्रयोग नहीं चलाया है, लेकिन उन्होंने 14 अलग-अलग अध्ययनों से साक्ष्य एकत्र किए हैं जो दिखाते हैं कि वर्तमान प्रणाली टूटी हुई है और एक नया, बहु-स्तरीय दृष्टिकोण वास्तविक दुनिया में AI को उपयोगी बनाने के लिए आवश्यक है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।