← नवीनतम पेपर
💻 computer science

AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

AgentEval एक ऐसा फ्रेमवर्क है जो एजेंटिक वर्कफ़्लो को निर्देशित अचक्रीय ग्राफ़ (DAGs) के रूप में औपचारिक रूप देता है ताकि संरचित, चरण-स्तरीय मूल्यांकन और स्वचालित मूल कारण एट्रिब्यूशन को सक्षम किया जा सके, जो विफलता पहचान रिकॉल में एंड-टू-एंड विधियों से काफी बेहतर प्रदर्शन करता है और उत्पादन वातावरणों में डिबगिंग समय को कम करता है।

मूल लेखक: Dongxin Guo, Jikun Wu, Siu Ming Yiu

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Dongxin Guo, Jikun Wu, Siu Ming Yiu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रेस्टोरेंट के हेड शेफ हैं। आपके पास जूनियर कुक्स (AI एजेंट्स) की एक टीम है जो एक क्रम में काम करती है: एक सब्जियां काटता है, दूसरा सॉस तैयार करता है, तीसरा मांस पकाता है, और अंतिम कुक डिश को प्लेट में सजाता है।

वर्तमान में, अधिकांश लोग इन कुक्स का मूल्यांकन "एंड-टू-एंड इवैल्यूएशन" (End-to-End Evaluation) के माध्यम से करते हैं। यह कुछ ऐसा है जैसे कोई फूड क्रिटिक (खाद्य समीक्षक) आता है, स्टेक का एक निवाला लेता है, और कहता है, "यह खराब है।"

समस्या यह है कि उसे यह नहीं पता कि यह क्यों खराब है। क्या स्टेक ज्यादा पक गया था? क्या सॉस बहुत नमकीन था? या क्या पहले कुक ने सड़ी हुई सब्जियां इस्तेमाल की थीं? क्योंकि क्रिटिक केवल अंतिम प्लेट को देखता है, इसलिए किचन में वही गलतियाँ बार-बार होती रहती हैं, और हेड शेफ को यह समझ नहीं आता कि किसे दोबारा ट्रेनिंग देनी है।

AgentEval एक हाई-टेक, माइक्रोस्कोपिक कैमरा सिस्टम लगाने जैसा है जो किचन में हर एक कुक की हर एक हरकत पर नज़र रखता है।

AgentEval की तीन "सुपरपावर्स"

1. "रेसिपी मैप" (DAG स्ट्रक्चर)

केवल अंतिम प्लेट को देखने के बजाय, AgentEval खाना बनाने की प्रक्रिया को एक फ्लोचार्ट (DAG) की तरह मानता है। वह जानता है कि सॉस, कटे हुए प्याज पर निर्भर है, और प्लेटिंग, सॉस पर निर्भर है।

  • रूपक (Metaphor): यह एक जासूस के "साक्ष्य की श्रृंखला" (chain of evidence) की तरह है। यदि अंतिम व्यंजन खराब हो जाता है, तो AgentEval केवल यह नहीं कहता कि "डिश खराब है"; बल्कि यह पीछे की ओर सबूतों के पदचिह्नों का पीछा करता है ताकि यह पता लगाया जा सके कि ठीक कहाँ पर कड़ी टूटी।

2. "एक्सपर्ट सू-शेफ" (LLM जज)

कुक्स को ग्रेड देने के लिए, AgentEval हर कदम पर नज़र रखने के लिए एक अत्यधिक प्रशिक्षित "मास्टर शेफ" (GPT-4o जैसा एक उन्नत AI) का उपयोग करता है। यह मास्टर शेफ केवल अंतिम परिणाम को नहीं देखता; वे हर व्यक्तिगत क्रिया को ग्रेड देते हैं:

  • "क्या आपने प्याज सही ढंग से काटा?" (स्टेप-लेवल मेट्रिक्स)
  • "क्या आपने सही मसाला चुना?" (टूल सिलेक्शन)
  • "क्या आपने रेसिपी के चरणों का क्रम से पालन किया?" (प्लानिंग)

3. "ब्लेम फाइंडर" (एरर प्रोपेगेशन और टैक्सोनॉमी)

एक किचन में, एक गलती डोमिनो इफेक्ट (domino effect) पैदा करती है। यदि पहला कुक चीनी के बजाय नमक का उपयोग करता है, तो उनके बाद के सभी कुक बर्बाद हो जाते हैं।

  • रूपक: अधिकांश सिस्टम गिरे हुए डोमिनोस के ढेर को देखते हैं और कहते हैं, "डोमिनोस गिर गए।" AgentEval उस "पहले डोमिनो" (मूल कारण/Root Cause) की पहचान करता है।
  • यह एक "फेलियर टैक्सोनॉमी" (Failure Taxonomy) का उपयोग करता है—जो मूल रूप से एक बहुत ही विस्तृत "वॉल ऑफ शेम" (बदनाम करने वाली दीवार) है। केवल यह कहने के बजाय कि "आपने गलती की," यह कहता है, "आपने 'कैटेगरी 2, सब-कैटेगरी B' की गलती की: आपने काम के लिए गलत टूल का उपयोग किया।"

यह वास्तविक दुनिया में क्यों मायने रखता है?

शोधकर्ताओं ने इसका परीक्षण ग्राहक सेवा और डेटा विश्लेषण में उपयोग किए जाने वाले वास्तविक AI सिस्टम पर किया। उन्हें यहाँ क्या पता चला:

  • यह एक सुपर-डिटेक्टर है: पारंपरिक तरीकों ने केवल लगभग 41% गलतियों को पकड़ा। AgentEval ने 89% गलतियों को पकड़ा। यह एक सुरक्षा गार्ड और उस गार्ड के बीच के अंतर जैसा है जो केवल यह देखता है कि सामने का दरवाजा बंद है या नहीं, बनाम एक गार्ड जो इमारत के हर एक कैमरे की निगरानी करता है।
  • यह भारी मात्रा में समय बचाता है: एक वास्तविक परीक्षण में, जब कुछ गलत होता था, तो इंजीनियरों को बग खोजने में 4 घंटे से अधिक का समय लगता था। AgentEval के साथ, उन्होंने समस्या को मात्र 22 मिनट में ढूंढ लिया। यह एक लंबे, निराशाजनक खोज अभियान को एक त्वरित, लक्षित सुधार में बदल देता है।
  • यह "रिग्रेशंस" (Regressions) को रोकता है: कल्पना कीजिए कि आप अपने किचन के ओवन को अपडेट करते हैं, और अचानक सभी केक चपटे आने लगते हैं। AgentEval एक स्वचालित अलार्म सिस्टम की तरह काम करता है जो इन "रिग्रेशंस" को ग्राहक तक पहुँचने से पहले ही पकड़ लेता है।

सारांश

AgentEval AI मूल्यांकन को "क्या यह काम कर गया?" से बदलकर "ठीक कहाँ, कैसे और क्यों विफल हुआ?" पर ले जाता है। यह AI वर्कफ़्लो के "ब्लैक बॉक्स" को एक पारदर्शी, स्टेप-बाय-स्टेप मैप में बदल देता है, जिससे डेवलपर्स को केवल गिरे हुए डोमिनोस की शिकायत करने के बजाय "पहले डोमिनो" को ठीक करने में मदद मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →