← नवीनतम पेपर
🤖 AI

ReflexGrad: Within-Episode Failure Recovery in LLM Agents via Progress-Gated Dual-Process Routing

ReflexGrad एक द्वैत-प्रक्रिया (dual-process) आर्किटेक्चर है जो LLM एजेंटों को प्रदर्शनों (demonstrations) के बिना एपिसोड-के-भीतर की विफलताओं से उबरने में सक्षम बनाता है, जो तेज़ निरंतर परिशोधन (fast continuous refinement) और धीमी कारण निदान (slow causal diagnosis) के बीच गतिशील रूप से रूटिंग करके विभिन्न मॉडल पैमानों पर ALFWorld कार्यों पर महत्वपूर्ण प्रदर्शन लाभ प्राप्त करता है।

मूल लेखक: Ankush Kadu, Aswanth Krishnan

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ankush Kadu, Aswanth Krishnan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े ज़िद्दी रोबोट को एक बिखरे हुए कमरे की सफाई करना सिखाने की कोशिश कर रहे हैं। रोबोट के पास निर्देशों की एक सूची है, लेकिन उसके पास कोई इंसान खड़ा नहीं है जो उसे कह सके, "नहीं, यह गलत तरीका है।"

आमतौर पर, जब ये रोबोट फंस जाते हैं, तो वे तब तक एक ही गलत चीज़ को बार-बार करते रहते हैं जब तक कि उनका समय समाप्त न हो जाए। उन्हें यह नहीं पता होता कि रुककर यह कहना है, "ठहरो, मैं यह गलत कर रहा हूँ।"

ReflexGrad इन रोबोटों के लिए एक नया "ब्रेन अपग्रेड" है जो उन्हें काम करने की कोशिश करते समय ही अपनी गलतियों को सुधारने की अनुमति देता है, बिना किसी इंसान द्वारा पहले उन्हें सिखाए।

यह कैसे काम करता है, यहाँ एक सरल उपमा (analogy) दी गई है:

दो-मस्तिष्क प्रणाली (The Two-Brain System)

ReflexGrad रोबोट को सोचने के दो अलग-अलग तरीके देता है, जैसे कि एक तेज़ धावक (Fast Runner) और एक धीमा विचारक (Slow Thinker) एक साथ काम कर रहे हों।

  1. तेज़ धावक (The "Tweaker"):

    • यह क्या करता है: हर कुछ कदमों के बाद, मस्तिष्क का यह हिस्सा देखता है कि रोबोट ने अभी क्या किया और कहता है, "हे, इससे तुम लक्ष्य के करीब नहीं पहुँचे। चलो तुम्हारे अगले कदम में थोड़ा सा बदलाव करते हैं।"
    • उपमा: कल्पना कीजिए कि आप एक धुंधले जंगल से गुजर रहे हैं। तेज़ धावक एक दोस्त की तरह है जो फुसफुसा रहा है, "तुमने बाईं ओर कदम लिया, लेकिन तुम अभी भी धुंध में ही हो। थोड़ा और दाईं ओर कदम रखने की कोशिश करो।" यह आपको ट्रैक पर रखने के लिए छोटे, त्वरित समायोजन करता है।
    • यह कब काम करता है: यह छोटी गलतियों को ठीक करने के लिए बेहतरीन है, जैसे कि किसी पत्थर से टकरा जाना या गलती से गलत वस्तु उठा लेना।
  2. धीमा विचारक (The "Detective"):

    • यह क्या करता है: यह हिस्सा केवल तभी जागता है जब तेज़ धावक सुधार करने की कोशिश करता रहता है, लेकिन रोबोट फिर भी प्रगति नहीं कर पाता। यदि रोबोट लगातार 5 कदम ऐसे लेता है जहाँ कोई प्रगति नहीं होती, तो धीमा विचारक हस्तक्षेप करता है।
    • उपमा: कल्पना कीजिए कि आप कुछ समय से गोल-गोल घूम रहे हैं। धीमा विचारक वह क्षण है जब आप रुकते हैं, बैठते हैं, और कहते हैं, "रुको, मैं सिर्फ गलत तरीके से नहीं चल रहा हूँ; मैं पूरी तरह से गलत दिशा में जा रहा हूँ!" यह पूरी तस्वीर को देखता है, मूल कारण का पता लगाता है (जैसे, "मैं फ्रिज में माइक्रोवेव ढूँढ रहा हूँ!") और एक बिल्कुल नया नक्शा बनाता है।
    • "कूल डाउन" (The "Cool Down"): एक बार जब धीमा विचारक एक नया नक्शा बना लेता है, तो वह तेज़ धावक को कुछ कदमों के लिए बाहर कर देता है। यह सुनिश्चित करता है कि रोबोट वास्तव में नए प्लान का पालन करे, बजाय इसके कि वह तुरंत पुराने, गलत तरीके को "ट्वीक" करने की कोशिश करे।

"ट्रैफिक लाइट" राउटर (The "Traffic Light" Router)

रोबोट को कैसे पता चलता है कि उसे किस मस्तिष्क का उपयोग करना है? इसके पास एक ट्रैफिक लाइट सिस्टम (रूटिंग नियम) है।

  • ग्रीन लाइट: चीजें ठीक चल रही हैं? तेज़ धावक का उपयोग करके छोटे बदलाव करते रहें।
  • रेड लाइट: रोबोट 5 कदम से फंसा हुआ है (कम स्कोर)? समस्या का निदान करने और एक नई योजना बनाने के लिए धीमे विचारक पर स्विच करें।
  • येलो लाइट (कूलडाउन): धीमे विचारक ने अभी-अभी एक नई योजना बनाई है? कुछ क्षण के लिए सभी ट्वीकिंग (tweaking) को रोक दें ताकि रोबोट भ्रमित हुए बिना उस नए प्लान को वास्तव में कर सके।

यह एक बड़ी बात क्यों है

अधिकांश अन्य तरीके दो में से एक चीज़ करते हैं:

  • विधि A (द "ट्राई अगेन लेटर" दृष्टिकोण): रोबोट विफल होता है, इस बारे में एक नोट लिखता है कि क्या गलत हुआ, और फिर पूरे कार्य को शुरू से फिर से करने की कोशिश करता है। यह समय और ऊर्जा बर्बाद करता है।
  • विधि B (द "माइक्रो-एडजस्टमेंट" दृष्टिकोण): रोबमान चलते हुए अपनी गलतियों को ठीक करने की कोशिश करता है, लेकिन यदि वह मौलिक रूप से गलत दिशा में जा रहा है, तो वह गलत काम करने में ही बेहतर होता जाता है।

ReflexGrad विशेष है क्योंकि यह दोनों काम एक ही प्रयास में करता है। यह छोटी गलतियों को जल्दी से ठीक करता है, लेकिन यदि उसे एहसास होता है कि वह गलत रास्ते पर है, तो वह रुकता है, पूरी रणनीति पर फिर से विचार करता है, और बिना दोबारा शुरू किए आगे बढ़ता है।

परिणाम (The Scoreboard)

शोधकर्ताओं ने इसका परीक्षण ALFWorld नामक एक गेम पर किया, जहाँ रोबोट को वस्तुओं को खोजना और उन्हें सही जगह पर रखना होता है (जैसे "टमाटर को गर्म करना और उसे कैबिनेट में रखना")।

  • ReflexGrad के बिना: रोबोट ने लगभग 35% कार्यों को हल किया।
  • ReflexGrad के साथ: रोबोट ने लगभग 75% कार्यों को हल किया।
  • तुलना: यहाँ तक कि अन्य स्मार्ट तरीकों की तुलना में, जिन्हें कार्य करने के एक उदाहरण को पहले देखने की अनुमति दी गई थी (जिसे "डेमोंस्ट्रेशन" कहा जाता है), ReflexGrad (जिसके पास शून्य उदाहरण थे) ने बेहतर या समान प्रदर्शन किया।

कमी (जहाँ यह अभी भी संघर्ष करता है)

पेपर स्वीकार करता है कि यह प्रणाली जादुई नहीं है। यह तब सबसे अच्छा काम करती है जब रोबोट को बस यह समझने की आवश्यकता होती है कि कैसे हिलना है या आगे क्या करना है।

  • सीमा: यदि रोबोट को ऐसी जानकारी की आवश्यकता है जो उसके प्रशिक्षण डेटा में नहीं है (जैसे "आपको चीजों को गर्म करने के लिए माइक्रोवेव की आवश्यकता है, न कि स्टोव की"), तो वह उस ज्ञान को शून्य से पैदा नहीं कर सकता। वह यह महसूस कर सकता है कि वह विफल हो रहा है, लेकिन वह सही उपकरण का अनुमान नहीं लगा सकता यदि उसे पता ही नहीं है कि उसका अस्तित्व है।

संक्षेप में

ReflexGrad एक सेल्फ-करेक्टिंग जीपीएस देने जैसा है।

  • यदि आप गलत मोड़ ले लेते हैं, तो यह आपको वापस लाने के लिए धीरे से धक्का देता है।
  • यदि आप गोल-गोल घूम रहे हैं, तो यह कार रोकता है, मानचित्र का विश्लेषण करता है, महसूस करता है कि आप गलत शहर में हैं, और एक पूरी तरह से नया रास्ता बनाता है—यह सब करते हुए भी आप अभी भी गाड़ी चला रहे हैं, बिना किसी इंसान के स्टीयरिंग संभालने की प्रतीक्षा किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →