An Empirical Study of Automating Agent Evaluation
यह शोध पत्र EvalAgent प्रस्तुत करता है, जो एक AI सहायक है जो डोमेन-विशिष्ट विशेषज्ञता को पुन: प्रयोज्य कौशलों में कूटबद्ध करके एजेंट मूल्यांकन को स्वचालित करता है, यह प्रदर्शित करते हुए कि ऐसा ज्ञान निष्पादन योग्य और सार्थक मूल्यांकन कोड उत्पन्न करने के लिए महत्वपूर्ण है जो फ्रंटियर कोडिंग सहायकों और बेसलाइन दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक शानदार, स्वायत्त रोबोट सहायक बनाया है। यह उड़ानें बुक कर सकता है, कोड लिख सकता है और चिकित्सा संबंधी समस्याओं का निदान कर सकता है। लेकिन आपको कैसे पता चलेगा कि यह वास्तव में अच्छा काम कर रहा है?
अतीत में, हमने केवल अंतिम उत्तर की जाँच की: "क्या इसने सही उड़ान बुक की?" लेकिन आधुनिक AI एजेंट जटिल होते हैं; वे कई कदम उठाते हैं, विभिन्न उपकरणों का उपयोग करते हैं, और कभी-कभी बीच में गलतियाँ करते हैं जिन्हें वे बाद में सुधार लेते हैं। केवल अंतिम परिणाम की जाँच करना एक छात्र के अंतिम परीक्षा स्कोर पर ग्रेड देने जैसा है, यह नज़रअंदाज़ करते हुए कि उसने नकल की, संघर्ष किया, या कुछ सीखा भी या नहीं। आपको पूरी प्रक्रिया को देखना होगा।
समस्या यह है कि इन जटिल रोबोटों को देखना और ग्रेड देना अविश्वसनीय रूप से कठिन, महंगा और मानव विशेषज्ञों की आवश्यकता वाला काम है। AWS AI Labs के शोधकर्ताओं ने एक सरल प्रश्न पूछा: क्या हम अन्य रोबोटों को स्वचालित रूप से ग्रेड देने के लिए एक "सुपर-रोबोट" बना सकते हैं?
यहाँ उनके निष्कर्षों की कहानी है, जिसे सरल भाषा में समझाया गया है।
समस्या: वह "स्मार्ट" रोबोट जिसे ग्रेडिंग करना नहीं आता
शोधकर्ताओं ने सबसे पहले उपलब्ध सबसे उन्नत कोडिंग सहायकों (फ्रंटियर मॉडल्स) का उपयोग करके ग्रेडिंग सॉफ्टवेयर लिखने का प्रयास किया। उन्होंने कोडिंग सहायक को रोबोट का कोड दिया और पूछा, "यह देखने के लिए एक टेस्ट लिखें कि क्या यह रोबोट काम करता है।"
परिणाम विनाशकारी था। कोडिंग सहायक उन उत्साही इंटर्न की तरह थे जिन्होंने पहले कभी टेस्ट नहीं देखा हो:
- उन्होंने गलत चीजों को मापा: यह जाँचने के बजाय कि क्या रोबोट ने समस्या हल की, उन्होंने यह गिना कि उसने कितने शब्दों का उपयोग किया या सोचने में कितना समय लिया (जैसे "लेटेंसी" और "टोकन काउंट" जैसे मेट्रिक्स)।
- उन्होंने सब कुछ बहुत जटिल बना दिया: उन्होंने भारी-भरकम, अव्यवस्थित टेस्ट सूट लिखे जिनमें 12 से अधिक अलग-अलग टेस्ट थे, जबकि केवल 2 की आवश्यकता थी। यह अखरोट तोड़ने के लिए हथौड़े का उपयोग करने जैसा था।
- वे भटक गए: उन्होंने एक बेहतरीन रणनीति बनाई लेकिन फिर ऐसा कोड लिखा जो योजना से मेल नहीं खाता था।
सबक: सिर्फ इसलिए कि एक रोबोट कोड लिखने में अच्छा है, इसका मतलब यह नहीं है कि वह कोड का मूल्यांकन करना जानता है। इसमें उस "कॉमन सेंस" की कमी है जो एक अच्छे टेस्ट को बनाता है।
समाधान: EvalAgent (द "एक्सपर्ट ग्रेडर")
इसे ठीक करने के लिए, टीम ने EvalAgent बनाया। EvalAgent को एक सामान्य स्मार्ट रोबोट के रूप में नहीं, बल्कि एक विशेष टूलकिट वाले रोबोट के रूप में सोचें।
केवल अनुमान लगाने के बजाय, EvalAgent के पास मूल्यांकन कौशल (Evaluation Skills) का एक "बैकपैक" है। ये पूर्व-पैकेज किए गए निर्देश, टेम्पलेट और अद्यतित मैनुअल हैं जो रोबोट को ठीक-ठीक बताते हैं कि ग्रेड कैसे देना है।
- प्रक्रियात्मक निर्देश (Procedural Instructions): "पहले, रोबोट की यात्रा देखें, न कि केवल मंजिल।"
- पुन: प्रयोज्य टेम्पलेट (Reusable Templates): "यहाँ टेस्ट लिखने का एक मानक तरीका है ताकि आप पहिये का पुनरुद्धार न करें (यानी शून्य से शुरुआत न करें)।"
- लाइव मैनुअल (Live Manuals): "यहाँ उन उपकरणों के लिए वर्तमान निर्देश पुस्तिका है जिनका रोबोट उपयोग करता है (ताकि हम पुराने कमांड का उपयोग न करें)।"
EvalAgent इन कौशलों का उपयोग करके एक ट्रेस-आधारित पाइपलाइन (Trace-Based Pipeline) बनाता है। कल्पना कीजिए कि एक सुरक्षा कैमरा रोबोट की पूरी यात्रा को रिकॉर्ड कर रहा है। EvalAgent वीडियो देखता है, मुख्य क्षणों को चुनता है (क्या उसने सही टूल का उपयोग किया? क्या उसने त्रुटि से उबरना सीखा?), और इस आधार पर रिपोर्ट लिखता है कि वास्तव में क्या हुआ, न कि इस आधार पर कि कोड कैसा दिखता है।
प्रमाण: क्या यह काम आया?
शोधकर्ताओं ने अपने सिस्टम का परीक्षण करने के लिए 20 अलग-अलग रोबोटों (ट्रैवल प्लानर से लेकर मेडिकल डॉक्यूमेंट प्रोसेसर तक) के साथ AgentEval-Bench नामक एक "जिम" बनाया। उन्होंने EvalAgent की तुलना "जेनेरिक कोडिंग सहायकों" और अन्य तरीकों से की।
परिणाम:
- यह वास्तव में काम करता है: EvalAgent के टेस्ट सफलतापूर्वक चले और पहली बार में ही 65% समय सार्थक परिणाम दिए। अन्य तरीके लगभग 70% बार विफल रहे या बेकार परिणाम दिए।
- इंसान इसे पसंद करते हैं: जब मानव विशेषज्ञों ने रिपोर्ट देखी, तो उन्होंने 80% समय EvalAgent के काम को प्राथमिकता दी।
- यह कुशल है: EvalAgent ने बहुत छोटा और साफ कोड लिखा। जहाँ अन्य तरीकों ने आवश्यक मात्रा से 6 गुना अधिक कोड लिखा (जिससे बहुत सारा "डेड वेट" पैदा हुआ जो कभी चला ही नहीं), वहीं EvalAgent केंद्रित रहा।
मुख्य निष्कर्ष (द "सीक्रेट सॉस")
अध्ययन में तीन मुख्य कारण मिले कि क्यों EvalAgent वहां सफल रहा जहां अन्य विफल रहे:
- फिल्म देखें, केवल स्क्रिप्ट न पढ़ें: रोबोट के वास्तविक एक्जीक्यूशन ट्रेसेस (उसने जो किया उसका वीडियो) के आधार पर मूल्यांकन करना बहुत बेहतर है बजाय केवल उसके कोड को पढ़ने के। यह उन त्रुटियों को पकड़ लेता है जिन्हें स्टैटिक कोड एनालिसिस मिस कर देता है।
- योजना से बेहतर कौशल (Skills Beat Planning): केवल रोबोट को "पहले योजना बनाओ, फिर निर्माण करो" कहना अच्छी तरह काम नहीं करता। रोबोट एक शानदार योजना तो बना लेगा लेकिन फिर एक अस्त-व्यस्त घर बना देगा। मूल्यांकन कौशल (टूलकिट) असली नायक थे, जिन्होंने रोबोट को केंद्रित रखा और उसे बकवास लिखने से रोका।
- मैनुअल को अपडेट रखें: रोबोट जो टूल्स इस्तेमाल करते हैं वे तेजी से बदलते हैं। EvalAgent ने तुरंत नवीनतम दस्तावेज़ प्राप्त करने के लिए एक प्रणाली का उपयोग किया। इसके बिना, इसके द्वारा लिखा गया कोड अक्सर टूटा हुआ होता क्योंकि यह पुराने निर्देशों का उपयोग करता था।
निचोड़
AI एजेंटों की ग्रेडिंग को स्वचालित करना संभव है, लेकिन आप केवल एक स्मार्ट रोबोट से "इसे समझने" के लिए नहीं कह सकते। आपको उसे एक विशेष टूलकिट देना होगा और उसे रोबोट के वास्तविक व्यवहार को देखना सिखाना होगा। EvalAgent बिल्कुल यही करता है, एक अराजक, महंगे मानवीय कार्य को एक सुव्यवस्थित, स्वचालित प्रक्रिया में बदल देता है जो विश्वसनीय और कार्रवाई योग्य रिपोर्ट प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।