← नवीनतम पेपर
🤖 AI

ReGRPO: Reflection-Augmented Policy Optimization for Tool-Using Agents

GRPO एक नवीन ढांचा है जो वॉर्म-स्टार्टिंग के लिए एक संरचित रिफ्लेक्टिव डेटा इंजन को रिफ्लेक्शन-ऑगमेंटेड ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन एल्गोरिदम के साथ जोड़कर टूल-इस्तेमाल करने वाले एजेंटों को उन्नत करता है, जिससे एजेंटों को 'नियर-मिस' विफलताओं से प्रभावी ढंग से सीखने और रिफ्लेक्शन टोकन एवं सुधारात्मक कार्यों को संयुक्त रूप से अनुकूलित करने में सक्षम बनाया जाता है ताकि मौजूदा बेसलाइनों से बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Binjie Zhang, Mike Zheng Shou

प्रकाशित 2026-07-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Binjie Zhang, Mike Zheng Shou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े अनाड़ी रोबोट सहायक को डिजिटल गैजेट्स (जैसे वेब सर्च, इमेज रीडर या कोड एक्जीक्यूटर) के टूलबॉक्स का उपयोग करके जटिल पहेलियों को हल करना सिखा रहे हैं। यह रोबोट एक "विज़न-लैंग्वेज मॉडल" है, जिसका अर्थ है कि वह चित्र देख सकता है और टेक्स्ट पढ़ सकता है, लेकिन कभी-कभी वह इन टूल्स का उपयोग करने में गलतियाँ करता है।

यह पेपर एक नई प्रशिक्षण विधि पेश करता है जिसे ReGRPO (रिफ्लेक्शन-ऑगमेंटेड ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। यह यहाँ कैसे काम करता है, इसे सरल उपमाओं के माध्यम से समझाया गया है:

समस्या: वह रोबोट जिसे अपनी गलतियों को सुधारना नहीं आता

वर्तमान में, जब हम इन रोबोटों को प्रशिक्षित करते हैं, तो हम उन्हें ज्यादातर केवल परफेक्ट उदाहरण दिखाते हैं कि किसी कार्य को कैसे हल किया जाए। यह एक छात्र को केवल उत्तर कुंजी दिखाने जैसा है जहाँ हर चरण सही ढंग से किया गया था।

  • समस्या: यदि रोबोट कोई टूल इस्तेमाल करने की कोशिश करता है और विफल हो जाता है (उदाहरण के लिए, वह एक रसीद पढ़ने की कोशिश करता है लेकिन कैमरा एंगल गलत है, इसलिए उसे कुछ दिखाई नहीं देता), तो उसे नहीं पता कि क्या करना है। वह बस बिना सोचे-समझे आगे बढ़ता रहता है या हार मान लेता है।
  • अंतराल: पुराने प्रशिक्षण तरीके रोबोट को यह नहीं सिखाते कि गलती से कैसे उबरना है। वे उसे केवल यह सिखाते हैं कि जब सब कुछ सही चल रहा हो तो कैसे सफल होना है।

समाधान: "एरर-रिफ्लेक्शन-करेक्शन" लूप

लेखकों ने एक नया सिस्टम बनाया है जो रोबोट को रुकने, सोचने और खुद को सुधारने के लिए प्रशिक्षित करता है। वे इसे रिफ्लेक्शन (Reflection) कहते हैं।

इसे एक जीपीएस नेविगेशन सिस्टम की तरह समझें:

  1. गलती (Near-Miss): रोबोट एक मोड़ लेने की कोशिश करता है, लेकिन रास्ता बंद है (टूल विफल हो जाता है)।
  2. रिफ्लेक्शन (The "Aha!" Moment): टकराने के बजाय, रोबोट रुकता है और पूछता है: "यह क्यों विफल हुआ? ओह, मैंने इमेज के गलत हिस्से पर टेक्स्ट पढ़ने की कोशिश की। इसका प्रमाण यह है कि टेक्स्ट खाली है। मेरी योजना कैमरा बॉक्स को दाईं ओर ले जाने की है।"
  3. करेक्शन (Correction): रोबोट तुरंत नई योजना को आजमाता है और सफल होता है।

उन्होंने इसे कैसे बनाया (The "Structured Data Engine")

रोबोट को यह कौशल सिखाने के लिए, शोधकर्ताओं ने केवल प्राकृतिक रूप से विफल होने का इंतजार नहीं किया। उन्होंने एक सिमुलेशन लैब बनाई:

  • उन्होंने एक परफेक्ट टास्क लिया और जानबूझकर उसे बिगाड़ दिया (उदाहरण के लिए, उन्होंने रोबोट को फोटो के गलत हिस्से को देखने के लिए कहा)।
  • उन्होंने देखा कि रोबोट कहाँ विफल हुआ और रिकॉर्ड किया कि वास्तव में क्या गलत हुआ।
  • उन्होंने एक "टीचर एआई" (एक बहुत ही स्मार्ट मॉडल) का उपयोग करके रोबोट के लिए एक स्ट्रक्चर्ड नोट लिखा। इस नोट के तीन विशिष्ट भाग हैं:
    1. एरर टाइप (Error Type): यह किस प्रकार की गलती थी? (जैसे, "मैंने गलत जगह देखा।")
    2. एविडेंस (Evidence): यह क्या साबित करता है? (जैसे, "मेरे द्वारा पढ़ा गया टेक्स्ट खाली था।")
    3. फिक्स प्लान (Fix Plan): इसे कैसे हल करें? (जैसे, "कैमरा बॉक्स को टेक्स्ट की ओर ले जाएं।")
  • इसके बाद उन्होंने रोबोट को इस "गलती + नोट + फिक्स" अनुक्रम को बार-बार दिखाया जब तक कि उसने इसे स्वचालित रूप से करना नहीं सीख लिया।

प्रशिक्षण खेल (Group Relative Policy Optimization)

एक बार जब रोबोट ने बुनियादी बातें सीख लीं, तो उन्होंने उसे और बेहतर बनाने के लिए एक प्रशिक्षण खेल में डाल दिया।

  • खेल: वे रोबोट को एक ही पहेली को 10 बार हल करने के लिए कहते हैं।
  • स्कोरिंग: कुछ बार वह तुरंत सफल हो जाता है। अन्य बार, वह विफल होता है, रुकता है, "रिफ्लेक्ट" करता है, और फिर उसे ठीक करता है।
  • रिवॉर्ड (Reward): रोबोट को पहेली हल करने के लिए अंक मिलते हैं, लेकिन यदि वह अनावश्यक रूप से "सोचने" (रिफ्लेक्ट करने) में बहुत अधिक समय बिताता है, तो उसके अंक कट जाते हैं।
  • लक्ष्य: रोबोट यह सीखता है कि उसे कब रुकना और रिफ्लेक्ट करना चाहिए, और यह भी कि उसकी रिफ्लेक्शन संक्षिप्त और उपयोगी होनी चाहिए। वह अपने प्रयासों की तुलना करना सीखता है: "हे, जिस वर्ज़न में मैंने रिफ्लेक्ट किया और ठीक किया, उसमें बिना सोचे-समझे चलते रहने वाले वर्ज़न की तुलना में अधिक अंक मिले।"

परिणाम: एक स्मार्ट, सेल्फ-हीलिंग रोबोट

शोधकर्ताओं ने इस नए रोबोट (ReGRPO) का परीक्षण दो कठिन चुनौतियों पर किया:

  1. GTA: कार्यों में रसीदें, चार्ट और UI स्क्रीन पढ़ना शामिल है।
  2. GAIA: कार्यों में जटिल दस्तावेज़ जैसे PDF और स्प्रेडशीट शामिल हैं।

परिणाम:

  • नया रोबोट इन कार्यों को हल करने में पिछले ओपन-सोर्स रोबोटों की तुलना में काफी बेहतर था।
  • वह न केवल टूल्स का उपयोग करने में बेहतर हुआ; बल्कि वह टूल्स के विफल होने पर रिकवर करने में भी बेहतर हुआ।
  • महत्वपूर्ण रूप से, उसने यह सब बिना किसी इंसान या दूसरे कंप्यूटर की मदद के किया, जो उसके काम की जांच कर सके। उसने सीखा कि वास्तविक समय में त्रुटियों को ठीक करने के लिए अपने स्वयं के "रिफ्लेक्शन" पर भरोसा कैसे किया जाए।

सारांश

संक्षेप में, यह पेपर एआई एजेंटों को एक सेल्फ-करेक्टिंग मैकेनिक (स्वयं सुधारने वाला मैकेनिक) की तरह सिखाता है। केवल कार को पूरी तरह से चलाना सीखने के बजाय, मैकेनिक यह सीखता है कि एक अजीब आवाज को कैसे पहचानना है, समस्या का निदान कैसे करना है, और बिना सुपरवाइजर को बुलाए तुरंत उसे कैसे ठीक करना है। यह एआई को वास्तविक दुनिया में बहुत अधिक विश्वसनीय बनाता है जहाँ चीजें हमेशा योजना के अनुसार नहीं होती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →