← नवीनतम पेपर
🤖 AI

Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry

PivoARL एक LLM एजेंटों के लिए एक सेल्फ-फीडबैक रिट्राय फ्रेमवर्क है जो कुशल स्थानीय पुनरावृत्तियों (local retries) को सक्षम करने के लिए महत्वपूर्ण त्रुटिपूर्ण टर्न की पहचान करता है, जिससे अनुभव संकेतों को केंद्रित करना, अनावश्यक इंटरैक्शन को कम करना और विभिन्न कार्यों में निर्णय लेने के प्रदर्शन में महत्वपूर्ण सुधार करना संभव होता है।

मूल लेखक: Weiyang Guo, Zesheng Shi, Longhui Zhang, Zeen Zhu, Min Zhang, Jing Li

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weiyang Guo, Zesheng Shi, Longhui Zhang, Zeen Zhu, Min Zhang, Jing Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry" (PivoARL) का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "दोबारा करने" की दुविधा (The "Do-Over" Dilemma)

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भूलभुलैया (maze) सुलझाने या माइन्सवीपर (Minesweeper) जैसा खेल खेलने के लिए सिखा रहे हैं। रोबोट कोशिश करता है, असफल होता है, और फिर आप उसे कहते हैं, "फिर से कोशिश करो।"

अधिकांश वर्तमान तरीकों में, जब रोबोट विफल होता है, तो उसे बिल्कुल शुरुआत से शुरू करना पड़ता है। वह भूलभुलैया के पहले 50 कदमों को पूरी तरह से सही चलता है, लेकिन कदम 51 पर दीवार से टकरा जाता है। जब वह दोबारा प्रयास करता है, तो वह उन्हीं 50 सही कदमों को बार-बार चलता है, जिससे समय और ऊर्जा बर्बाद होती है, इससे पहले कि वह अंततः दीवार से टकराए (या शायद उसे ठीक कर ले)।

यह एक ऐसे छात्र की तरह है जो 100 प्रश्नों की गणित की परीक्षा दे रहा है, प्रश्न संख्या 95 में गलती करता है, और फिर उसे हर बार प्रश्न संख्या 1 से 94 को भी पूरी तरह से दोबारा हल करने के लिए मजबूर किया जाता है ताकि वह प्रश्न 95 को ठीक कर सके। यह अविश्वसनीय रूप से अक्षम (inefficient) है।

समाधान: PivoARL (एक "स्मार्ट दोबारा प्रयास")

लेखकों ने PivoARL नामक एक नई विधि प्रस्तावित की है। शुरुआत से शुरू करने के बजाय, रोबोट यह पहचानना सीखता है कि ठीक किस क्षण वह गलत हुआ (वह "पिवोटल" या निर्णायक क्षण) और केवल वहीं से दोबारा प्रयास करता है।

इसे एक GPS नेविगेशन ऐप की तरह समझें। यदि आप गलत मोड़ ले लेते हैं, तो ऐप आपको अपने घर वापस जाकर पूरी यात्रा फिर से शुरू करने के लिए नहीं कहता। वह कहता है, "आपने पिछले चौराहे पर गलती की। आइए उस विशिष्ट स्थान से अपना रास्ता फिर से निर्धारित करें।"

यह कैसे काम करता है: तीन जादु적인 चरण

1. "जासूस" की तरह आत्म-चिंतन (The "Detective" Reflection)

जब रोबोट विफल होता है, तो वह केवल यह नहीं कहता कि "मैं असफल हो गया।" वह एक जासूस की तरह व्यवहार करता है। वह अपनी पूरी यात्रा को देखता है और पूछता है:

  • "मैंने पहली गलती कहाँ की?"
  • "क्या यह कदम 3 था? कदम 10?"

वह Pivotal Turn (निर्णायक मोड़) का पता लगाता है—वह बिल्कुल पहला कदम जिसने आपदा को जन्म दिया।

2. "समय बचाने वाला" पुनः प्रयास (The "Time-Saver" Retry)

एक बार जब वह उस विशिष्ट गलती को ढूंढ लेता है, तो वह उस गलती से पहले किए गए सभी कदमों को सुरक्षित रखता है।

  • पुराना तरीका: सब कुछ मिटा दो। कदम 1 से शुरू करो।
  • PivoARL का तरीका: कदम 1 से 9 तक को रखें (क्योंकि वे सही थे)। कदम 10 (गलती) को हटा दें। कदम 10 के लिए एक नया एक्शन आजमाएं, और फिर आगे बढ़ें।

यह "इंटरैक्शन कॉस्ट" (समय और कंप्यूटर पावर) को बहुत बचा लेता है क्योंकि रोबोट को उन हिस्सों को दोबारा करने की आवश्यकता नहीं होती जिन्हें उसने पहले ही सही कर लिया था।

3. "निष्पक्ष न्यायाधीश" (The "Fair Judge" - Credit Assignment)

यह सबसे पेचीदा हिस्सा है। मशीन लर्निंग में, सिस्टम को यह जानने की आवश्यकता होती है कि किसे "पुरस्कार" देना है और किसे "दंड" देना है।

  • यदि रोबोट कदम 10 पर गलती सुधारता है और सफल हो जाता है, तो पुराने तरीके गलती से गलत कदमों को श्रेय दे सकते हैं या सही कदमों को दंडित कर सकते हैं क्योंकि वे पूरे उलझे हुए इतिहास को देख रहे होते हैं।
  • PivoARL की ट्रिक: यह गलती को अलग कर देता है। यह कहता है, "गलती से पहले के कदम बेहतरीन थे; उन्हें रखें। गलती के बाद के कदम समस्या थे; उन्हें ठीक करें।" यह सुनिश्चित करता है कि रोबोट ठीक वही सीखे जहाँ वह गलत हुआ, बिना भ्रमित हुए।

यह बेहतर क्यों है? ("सिग्नल" की उपमा)

कल्पना कीजिए कि आप घास के ढेर (haystack) में एक विशिष्ट सुई खोजने की कोशिश कर रहे हैं।

  • पुराने तरीके: आप पूरे घास के ढेर को फर्श पर गिरा देते हैं, उसे मिला देते हैं और फिर से सुई ढूंढते हैं। "सिग्नल" (सुई) "शोर" (घास) में खो जाता है।
  • PivoARL: आप उस स्थान को देखते हैं जहाँ सुई आखिरी बार देखी गई थी, महसूस करते हैं कि आप उसे वहीं गिरा चुके थे, और केवल उसी छोटे ढेर में देखते हैं। सिग्नल ठीक वहीं केंद्रित होता है जहाँ त्रुटि हुई थी, जिससे सीखना बहुत आसान हो जाता है।

उन्होंने क्या पाया?

शोधकर्ताओं ने चार अलग-अलग "एजेंट" कार्यों (जैसे आभासी घर में घूमना, माइन्सवीपर खेलना और उत्तर खोजने के लिए वेब खोजना) और सात प्रश्न-उत्तर बेंचमार्क पर इसका परीक्षण किया।

  • बेहतर स्कोर: PivoARL का उपयोग करने वाले रोबोट ने पिछले तरीकों की तुलना में बहुत अधिक बार कार्यों को सफलतापूर्वक हल किया (सर्वश्रेष्ठ मौजूदा विधि की तुलना में सफलता दर में औसतन लगभग 11.5% का सुधार)।
  • तेजी से सीखना: क्योंकि यह सही कदमों को दोबारा करने में समय बर्बाद नहीं करता, इसलिए इसे समान कार्यों को सीखने के लिए लगभग 42% कम प्रयासों की आवश्यकता पड़ी।
  • पहली बार में सफलता: दिलचस्प बात यह है कि क्योंकि रोबोट ने अपनी विशिष्ट गलतियों से बहुत अच्छी तरह सीखा, इसलिए वह न केवल कई प्रयासों के बाद, बल्कि पहली कोशिश में ही समस्याओं को हल करने में भी बेहतर हो गया।

सारांश

PivoARL एक स्मार्ट कोच की तरह है जो एक एथलीट को असफल होते हुए देखता है, उसके लड़खड़ाने के सटीक क्षण की ओर इशारा करता है, और कहता है, "उस पल तक तुम एकदम सही थे। चलो बस उस एक चाल को ठीक करते हैं और आगे बढ़ते हैं।" यह समय बचाता है, भ्रम को कम करता है, और एजेंट को उन तरीकों की तुलना में तेजी से और बेहतर तरीके से सीखने में मदद करता है जो "शून्य से रीस्टार्ट" करने के लिए मजबूर करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →