← नवीनतम पेपर
🤖 AI

What Is Your Agent's GPA? A Framework for Evaluating Agent Goal-Plan-Action Alignment

यह शोध पत्र एजेंट GPA फ्रेमवर्क पेश करता है, जो एक स्केलेबल और सामान्यीकरण योग्य मूल्यांकन प्रणाली है जो गोल-प्लान-एक्शन (लक्ष्य-योजना-क्रिया) संरेखण को मापने के लिए डोमेन-विशिष्ट LLM जज उत्पन्न करने हेतु स्वचालित प्रॉम्प्ट अनुकूलन का उपयोग करती है, जिससे विभिन्न बेंचमार्क में उच्च सटीकता और मानव मूल्यांकनकर्ताओं के साथ उच्च सहमति के साथ एजेंट विफलताओं को प्रभावी ढंग से पहचानने और उन्हें स्थानीयकृत करने में सक्षम बनाया जा सके।

मूल लेखक: Allison Sihan Jia, Daniel Huang, Nikhil Vytla, Seung Won Wilson Yoo, Nirvika Choudhury, Shayak Sen, John C. Mitchell, Anupam Datta

प्रकाशित 2026-03-31
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Allison Sihan Jia, Daniel Huang, Nikhil Vytla, Seung Won Wilson Yoo, Nirvika Choudhury, Shayak Sen, John C. Mitchell, Anupam Datta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक जटिल समस्या को हल करने के लिए एक अत्यंत बुद्धिमान, अति-प्रतिभाशाली रोबोटिक सहायक को काम पर रखा है, जैसे कि एक देशव्यापी सड़क यात्रा की योजना बनाना या किसी टूटे हुए सॉफ़्टवेयर को ठीक करना। आप उसे एक लक्ष्य देते हैं और वह काम पर लग जाता है। लेकिन कभी-कभी, वह विफल हो जाता है।

अधिकांश वर्तमान तरीकों के साथ समस्या यह है कि वे केवल अंतिम परिणाम को देखते हैं। क्या रोबोट ने सही उत्तर दिया? हाँ या नहीं। यदि उत्तर "नहीं" है, तो आप अपना सिर खुजलाते रह जाते हैं: वह क्यों विफल हुआ? क्या वह शुरुआत में ही भ्रमित हो गया था? क्या उसने गलत नक्शा चुना था? क्या नक्शा अच्छा होने के बावजूद वह खाई में गिर गया?

यह शोध पत्र इन AI एजेंटों को ग्रेड देने का एक नया तरीका पेश करता है जिसे Agent GPA (Goal-Plan-Action) कहा जाता है। इसे केवल एक अंतिम ग्रेड के रूप में नहीं, बल्कि एक विस्तृत रिपोर्ट कार्ड के रूप में देखें जो ठीक से बताता है कि छात्र (रोबोट) कहाँ गलत हुआ।

रिपोर्ट कार्ड के तीन स्तंभ

लेखकों का तर्क है कि हर बार जब एक AI एजेंट काम करता है, तो वह तीन मानसिक चरणों से गुजरता है। "GPA" ढांचा प्रत्येक की व्यक्तिगत रूप से जांच करता है:

  1. लक्ष्य (गंतव्य) [Goal (The Destination)]: क्या रोबोट समझ पाया कि आप वास्तव में क्या चाहते थे?
    • उपमा: कल्पना कीजिए कि आपने एक ट्रैवल एजेंट से "पेरिस में एक होटल बुक करने" के लिए कहा। यदि एजेंट ने आपको गलत समझने के कारण लंदन में एक होटल बुक कर दिया, तो यह एक लक्ष्य विफलता (Goal Failure) है। गंतव्य शुरुआत से ही गलत था।
  2. योजना (नक्शा) [Plan (The Map)]: क्या रोबोट ने वहां पहुँचने के लिए एक अच्छी रणनीति बनाई?
    • उपमा: एजेंट ने "पेरिस" को समझ लिया, लेकिन उसकी योजना "पैदल जाने" की थी। यह एक योजना गुणवत्ता विफलता (Plan Quality Failure) है। नक्शा बहुत खराब था, भले ही गंतव्य सही था।
  3. क्रिया (ड्राइविंग) [Action (The Driving)]: क्या रोबोट ने वास्तव में नक्शे का पालन किया और कार को सही ढंग से चलाया?
    • उपमा: एजेंट के पास पेरिस तक जाने की एक बेहतरीन योजना थी, लेकिन वह कार में पेट्रोल डालना भूल गया, या उसने पहले निकास (exit) पर गलत मोड़ ले लिया। यह एक क्रिया विफलता (Action Failure) है।

"विशेषज्ञ शिक्षक" बनाम "सामान्यist"

अतीत में, शोधकर्ता एक विशाल "जज" (एक एकल AI) का उपयोग करते थे जो पूरी प्रक्रिया को देखता था और कहता था, "आप विफल रहे।" यह एक ही शिक्षक द्वारा आपके गणित, इतिहास और कला के होमवर्क को एक साथ ग्रेड करने जैसा है। वे इस कारण से चूक सकते हैं कि आपने गणित में गलती क्यों की क्योंकि वे कला को देखने में बहुत व्यस्त हैं।

Agent GPA ढांचा विशेषज्ञ जजों की एक टीम का उपयोग करता है।

  • एक जज केवल लक्ष्य (Goal) को देखता है।
  • एक जज केवल योजना (Plan) को देखता है।
  • एक जज क्रियाओं (जैसे टूल का उपयोग या कोड लिखना) को देखता है।

यह बेहतर क्यों है?
शोध पत्र में पाया गया कि इस विशेषज्ञ टीम ने उन 95% त्रुटियों को पकड़ा जो मानव विशेषज्ञों ने पाई थीं, जबकि एक एकल "जनरलिस्ट" जज केवल लगभग 55% ही पकड़ पाया था। यह डॉक्टरों की एक टीम की तरह है: एक हृदय रोग विशेषज्ञ, एक न्यूरोलॉजिस्ट और एक त्वचा रोग विशेषज्ञ एक सामान्य चिकित्सक की तुलना में बहुत बेहतर निदान करते हैं जो अकेले सब कुछ करने की कोशिश करता है।

"ऑटो-ग्रेडर" का जादू

आप पूछ सकते हैं, "लेकिन क्या हमें इन रिपोर्टों को ग्रेड करने के लिए मनुष्यों की आवश्यकता नहीं है?"
शोध पत्र कहता है: नहीं, अब इसकी आवश्यकता नहीं है।

उन्होंने प्रॉम्प्ट ऑप्टिमाइज़ेशन (Prompt Optimization) नामक एक चतुर तकनीक का उपयोग किया। कल्पना कीजिए कि आपके पास एक रोबोट शिक्षक है। अपने आप ग्रेडिंग नियम लिखने के बजाय, आप रोबोट को अपने स्वयं के ग्रेडिंग नियम लिखने और फिर से लिखने दें जब तक कि वह गलतियाँ पकड़ने में कुशल न हो जाए।

  • उन्होंने सार्वजनिक डेटासेट्स (जैसे कोडिंग चुनौतियाँ और अनुसंधान कार्य) पर इसका परीक्षण किया।
  • "ऑटो-ग्रेड किए गए" नियमों ने मानव विशेषज्ञों द्वारा लिखे गए नियमों के समान या उनसे भी बेहतर प्रदर्शन किया।
  • इसका मतलब है कि हम बिना किसी विशाल मानव समीक्षकों की सेना के लाखों AI एजेंटों का परीक्षण करने के लिए इसे स्केल कर सकते हैं।

"निरंतरता" की जाँच

AI जजों के साथ एक बड़ी समस्या यह है कि वे कभी-कभी असंगत होते हैं। यदि आप एक ही AI को दो बार एक ही होमवर्क को ग्रेड करने के लिए कहते हैं, तो वह पहली बार में आपको "A" दे सकता है और दूसरी बार में "C"। यह निराशाजनक है।

लेखकों ने इसे ठीक करने के लिए इवोल्यूशनरी ऑप्टिमाइज़ेशन (Evolutionary Optimization) (कंप्यूटर कोड के लिए प्राकृतिक चयन की तरह) नामक एक तकनीक का उपयोग किया। उन्होंने AI को अपने ग्रेडिंग निर्देशों को बार-बार "विकसित" करने दिया, और उन संस्करणों को रखा जो सबसे अधिक सुसंगत थे।

  • परिणाम: उन्होंने अपनी ग्रेडिंग की निरंतरता को 38% तक सुधारा। अब, AI जज बहुत अधिक विश्वसनीय है, एक सख्त लेकिन निष्पक्ष शिक्षक की तरह जो हमेशा एक ही काम के लिए एक ही ग्रेड देता है।

मुख्य निष्कर्ष

यह शोध पत्र हमें AI एजेंटों के लिए एक सूक्ष्मदर्शी (microscope) प्रदान करता है। केवल यह कहने के बजाय कि "यह विफल रहा," अब हम कह सकते हैं:

"एजेंट ने लक्ष्य को पूरी तरह से समझा, लेकिन उसकी योजना अक्षम थी, और उसने एक टूल को कॉल करते समय एक विशिष्ट त्रुटि की।"

यह इंजीनियरों को रोबोट के मस्तिष्क के उस सटीक हिस्से को ठीक करने की अनुमति देता है जो टूटा हुआ है, बजाय इसके कि वे केवल अनुमान लगाएं। यह AI विकास को "अनुमान और जांच" के खेल से बदलकर एक सटीक इंजीनियरिंग अनुशासन में बदल देता है।

संक्षेप में: Agent GPA AI के लिए अंतिम रिपोर्ट कार्ड है, जो विशेषज्ञ, स्वयं-सुधार करने वाले रोबोटों की एक टीम का उपयोग करता है ताकि हमें ठीक से पता चल सके कि हमारे AI सहायक क्यों विफल हो रहे हैं, ताकि हम उन्हें बेहतर करना सिखा सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →