← नवीनतम पेपर
💬 NLP

An Empirical Study of Automating Agent Evaluation

यह शोध पत्र EvalAgent प्रस्तुत करता है, जो एक AI सहायक है जो डोमेन-विशिष्ट विशेषज्ञता को पुन: प्रयोज्य कौशलों में कूटबद्ध करके एजेंट मूल्यांकन को स्वचालित करता है, यह प्रदर्शित करते हुए कि ऐसा ज्ञान निष्पादन योग्य और सार्थक मूल्यांकन कोड उत्पन्न करने के लिए महत्वपूर्ण है जो फ्रंटियर कोडिंग सहायकों और बेसलाइन दृष्टिकोणों की तुलना में काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram, Aosong Feng, Vinayak Arannil, Muhyun Kim, Ishan Singh, Darren Wang, Zhichao Xu, Megha Gandhi, Nirmal Prabhu, Soumya Smruti M
प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram, Aosong Feng, Vinayak Arannil, Muhyun Kim, Ishan Singh, Darren Wang, Zhichao Xu, Megha Gandhi, Nirmal Prabhu, Soumya Smruti Mishra, Vivek Singh, Gouri Pandeshwar, Lin Lee Cheong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक शानदार, स्वायत्त रोबोट सहायक बनाया है। यह उड़ानें बुक कर सकता है, कोड लिख सकता है और चिकित्सा संबंधी समस्याओं का निदान कर सकता है। लेकिन आपको कैसे पता चलेगा कि यह वास्तव में अच्छा काम कर रहा है?

अतीत में, हमने केवल अंतिम उत्तर की जाँच की: "क्या इसने सही उड़ान बुक की?" लेकिन आधुनिक AI एजेंट जटिल होते हैं; वे कई कदम उठाते हैं, विभिन्न उपकरणों का उपयोग करते हैं, और कभी-कभी बीच में गलतियाँ करते हैं जिन्हें वे बाद में सुधार लेते हैं। केवल अंतिम परिणाम की जाँच करना एक छात्र के अंतिम परीक्षा स्कोर पर ग्रेड देने जैसा है, यह नज़रअंदाज़ करते हुए कि उसने नकल की, संघर्ष किया, या कुछ सीखा भी या नहीं। आपको पूरी प्रक्रिया को देखना होगा।

समस्या यह है कि इन जटिल रोबोटों को देखना और ग्रेड देना अविश्वसनीय रूप से कठिन, महंगा और मानव विशेषज्ञों की आवश्यकता वाला काम है। AWS AI Labs के शोधकर्ताओं ने एक सरल प्रश्न पूछा: क्या हम अन्य रोबोटों को स्वचालित रूप से ग्रेड देने के लिए एक "सुपर-रोबोट" बना सकते हैं?

यहाँ उनके निष्कर्षों की कहानी है, जिसे सरल भाषा में समझाया गया है।

समस्या: वह "स्मार्ट" रोबोट जिसे ग्रेडिंग करना नहीं आता

शोधकर्ताओं ने सबसे पहले उपलब्ध सबसे उन्नत कोडिंग सहायकों (फ्रंटियर मॉडल्स) का उपयोग करके ग्रेडिंग सॉफ्टवेयर लिखने का प्रयास किया। उन्होंने कोडिंग सहायक को रोबोट का कोड दिया और पूछा, "यह देखने के लिए एक टेस्ट लिखें कि क्या यह रोबोट काम करता है।"

परिणाम विनाशकारी था। कोडिंग सहायक उन उत्साही इंटर्न की तरह थे जिन्होंने पहले कभी टेस्ट नहीं देखा हो:

  • उन्होंने गलत चीजों को मापा: यह जाँचने के बजाय कि क्या रोबोट ने समस्या हल की, उन्होंने यह गिना कि उसने कितने शब्दों का उपयोग किया या सोचने में कितना समय लिया (जैसे "लेटेंसी" और "टोकन काउंट" जैसे मेट्रिक्स)।
  • उन्होंने सब कुछ बहुत जटिल बना दिया: उन्होंने भारी-भरकम, अव्यवस्थित टेस्ट सूट लिखे जिनमें 12 से अधिक अलग-अलग टेस्ट थे, जबकि केवल 2 की आवश्यकता थी। यह अखरोट तोड़ने के लिए हथौड़े का उपयोग करने जैसा था।
  • वे भटक गए: उन्होंने एक बेहतरीन रणनीति बनाई लेकिन फिर ऐसा कोड लिखा जो योजना से मेल नहीं खाता था।

सबक: सिर्फ इसलिए कि एक रोबोट कोड लिखने में अच्छा है, इसका मतलब यह नहीं है कि वह कोड का मूल्यांकन करना जानता है। इसमें उस "कॉमन सेंस" की कमी है जो एक अच्छे टेस्ट को बनाता है।

समाधान: EvalAgent (द "एक्सपर्ट ग्रेडर")

इसे ठीक करने के लिए, टीम ने EvalAgent बनाया। EvalAgent को एक सामान्य स्मार्ट रोबोट के रूप में नहीं, बल्कि एक विशेष टूलकिट वाले रोबोट के रूप में सोचें।

केवल अनुमान लगाने के बजाय, EvalAgent के पास मूल्यांकन कौशल (Evaluation Skills) का एक "बैकपैक" है। ये पूर्व-पैकेज किए गए निर्देश, टेम्पलेट और अद्यतित मैनुअल हैं जो रोबोट को ठीक-ठीक बताते हैं कि ग्रेड कैसे देना है।

  • प्रक्रियात्मक निर्देश (Procedural Instructions): "पहले, रोबोट की यात्रा देखें, न कि केवल मंजिल।"
  • पुन: प्रयोज्य टेम्पलेट (Reusable Templates): "यहाँ टेस्ट लिखने का एक मानक तरीका है ताकि आप पहिये का पुनरुद्धार न करें (यानी शून्य से शुरुआत न करें)।"
  • लाइव मैनुअल (Live Manuals): "यहाँ उन उपकरणों के लिए वर्तमान निर्देश पुस्तिका है जिनका रोबोट उपयोग करता है (ताकि हम पुराने कमांड का उपयोग न करें)।"

EvalAgent इन कौशलों का उपयोग करके एक ट्रेस-आधारित पाइपलाइन (Trace-Based Pipeline) बनाता है। कल्पना कीजिए कि एक सुरक्षा कैमरा रोबोट की पूरी यात्रा को रिकॉर्ड कर रहा है। EvalAgent वीडियो देखता है, मुख्य क्षणों को चुनता है (क्या उसने सही टूल का उपयोग किया? क्या उसने त्रुटि से उबरना सीखा?), और इस आधार पर रिपोर्ट लिखता है कि वास्तव में क्या हुआ, न कि इस आधार पर कि कोड कैसा दिखता है

प्रमाण: क्या यह काम आया?

शोधकर्ताओं ने अपने सिस्टम का परीक्षण करने के लिए 20 अलग-अलग रोबोटों (ट्रैवल प्लानर से लेकर मेडिकल डॉक्यूमेंट प्रोसेसर तक) के साथ AgentEval-Bench नामक एक "जिम" बनाया। उन्होंने EvalAgent की तुलना "जेनेरिक कोडिंग सहायकों" और अन्य तरीकों से की।

परिणाम:

  1. यह वास्तव में काम करता है: EvalAgent के टेस्ट सफलतापूर्वक चले और पहली बार में ही 65% समय सार्थक परिणाम दिए। अन्य तरीके लगभग 70% बार विफल रहे या बेकार परिणाम दिए।
  2. इंसान इसे पसंद करते हैं: जब मानव विशेषज्ञों ने रिपोर्ट देखी, तो उन्होंने 80% समय EvalAgent के काम को प्राथमिकता दी।
  3. यह कुशल है: EvalAgent ने बहुत छोटा और साफ कोड लिखा। जहाँ अन्य तरीकों ने आवश्यक मात्रा से 6 गुना अधिक कोड लिखा (जिससे बहुत सारा "डेड वेट" पैदा हुआ जो कभी चला ही नहीं), वहीं EvalAgent केंद्रित रहा।

मुख्य निष्कर्ष (द "सीक्रेट सॉस")

अध्ययन में तीन मुख्य कारण मिले कि क्यों EvalAgent वहां सफल रहा जहां अन्य विफल रहे:

  1. फिल्म देखें, केवल स्क्रिप्ट न पढ़ें: रोबोट के वास्तविक एक्जीक्यूशन ट्रेसेस (उसने जो किया उसका वीडियो) के आधार पर मूल्यांकन करना बहुत बेहतर है बजाय केवल उसके कोड को पढ़ने के। यह उन त्रुटियों को पकड़ लेता है जिन्हें स्टैटिक कोड एनालिसिस मिस कर देता है।
  2. योजना से बेहतर कौशल (Skills Beat Planning): केवल रोबोट को "पहले योजना बनाओ, फिर निर्माण करो" कहना अच्छी तरह काम नहीं करता। रोबोट एक शानदार योजना तो बना लेगा लेकिन फिर एक अस्त-व्यस्त घर बना देगा। मूल्यांकन कौशल (टूलकिट) असली नायक थे, जिन्होंने रोबोट को केंद्रित रखा और उसे बकवास लिखने से रोका।
  3. मैनुअल को अपडेट रखें: रोबोट जो टूल्स इस्तेमाल करते हैं वे तेजी से बदलते हैं। EvalAgent ने तुरंत नवीनतम दस्तावेज़ प्राप्त करने के लिए एक प्रणाली का उपयोग किया। इसके बिना, इसके द्वारा लिखा गया कोड अक्सर टूटा हुआ होता क्योंकि यह पुराने निर्देशों का उपयोग करता था।

निचोड़

AI एजेंटों की ग्रेडिंग को स्वचालित करना संभव है, लेकिन आप केवल एक स्मार्ट रोबोट से "इसे समझने" के लिए नहीं कह सकते। आपको उसे एक विशेष टूलकिट देना होगा और उसे रोबोट के वास्तविक व्यवहार को देखना सिखाना होगा। EvalAgent बिल्कुल यही करता है, एक अराजक, महंगे मानवीय कार्य को एक सुव्यवस्थित, स्वचालित प्रक्रिया में बदल देता है जो विश्वसनीय और कार्रवाई योग्य रिपोर्ट प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →