← नवीनतम पेपर
💬 NLP

StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning

यह शोध पत्र StepPO प्रस्तुत करता है, जो एक ऐसा ढांचा है जो अनुकूलन प्रतिमान (optimization paradigm) को टोकन-स्तर से स्टेप-स्तर के मार्कोव निर्णय प्रक्रियाओं (Markov Decision Processes) में स्थानांतरित करके एजेंटिक सुदृढीकरण लर्निंग (Agentic Reinforcement Learning) को उन्नत करता है, जिससे नीति अपडेट और क्रेडिट असाइनमेंट को एजेंट के निर्णयों की स्वाभाविक सूक्ष्मता (granularity) के साथ संरेखित किया जा सके ताकि मल्टी-टर्न इंटरैक्शन, स्पार्स रिवार्ड्स और जटिल टूल उपयोग को बेहतर ढंग से संभाला जा सके।

मूल लेखक: Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Qi Liu, Enhong Chen

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daoyu Wang, Qingchuan Li, Mingyue Cheng, Jie Ouyang, Shuo Yu, Qi Liu, Enhong Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक रोबोट को गेम खेलना सिखाना

कल्पना कीजिए कि आप एक रोबोट (एक लार्ज लैंग्वेज मॉडल) को द लीजेंड ऑफ ज़ेल्डा जैसा कोई जटिल वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं। रोबोट को जीतने के लिए एक कालकोठरी (dungeon) को खोजना, चाबियाँ ढूँढना, राक्षसों को हराना और पहेलियों को सुलझाना होगा।

अतीत में, जब हम AI को प्रशिक्षित करते थे, तो हम उन्हें ज्यादातर एक बार में वाक्य लिखना या उत्तर देना सिखाते थे। हम उनके आउटपुट को अक्षर दर अक्षर (या "टोकन दर टोकन") देखते थे।

समस्या:
जब रोबोट गेम खेल रहा होता है, तो उसे एक-एक अक्षर करके देखना वैसा ही है जैसे किसी को कार चलाना सिखाने के लिए उसके हाथ की उंगली की हर छोटी हरकत की आलोचना करना।

  • "तुम्हारी उंगली बहुत ज्यादा बाईं ओर मुड़ी।"
  • "तुम्हारी उंगली थोड़ी कम दाईं ओर मुड़ी।"
  • "तुमने गैस पेडल बहुत जोर से दबाया।"

यह टोकन-लेवल लर्निंग (Token-Level Learning) है। यह बहुत शोर भरा और बहुत सूक्ष्म (granular) है। रोबोट को यह समझ नहीं आता कि वह क्यों विफल हुआ। क्या वह इसलिए विफल हुआ क्योंकि उसने पहिया थोड़ा गलत घुमाया, या इसलिए क्योंकि उसने पहले से ही दीवार में गाड़ी चलाने का फैसला किया था?

समाधान: StepPO
इस पेपर के लेखक इन "एजेंटिक" (Agentic) AI सिस्टम को प्रशिक्षित करने का एक नया तरीका प्रस्तावित करते हैं। वे इसे StepPO (स्टेप-अलाइन्ड पॉलिसी ऑप्टिमाइज़ेशन) कहते हैं।

रोबोट की उंगलियों की हरकत देखने के बजाय, StepPO रोबोट के निर्णयों को देखता है।

  • चरण 1: रोबोट एक बंद दरवाजा देखता है।
  • चरण 2: रोबोट निर्णय लेता है कि "चाबी की तलाश करनी है।"
  • चरण 3: रोबोट चाबी ढूंढ लेता है और दरवाजा खोल देता है।
  • चरण 4: रोबोट को इनाम (पॉइंट्स) मिलता है।

StepPO कहता है: "रोबोट को 'चाबी की तलाश करें' कहने के लिए लिखे गए विशिष्ट अक्षरों के लिए दोष न दें। चाबी खोजने के निर्णय के लिए उसे जिम्मेदार ठहराएं।"


तीन प्रमुख बदलाव (कैसे करें - "How-To")

यह पेपर तर्क देता है कि इसे सफल बनाने के लिए, हमें AI को प्रशिक्षित करने के तरीके में तीन चीजें बदलने की आवश्यकता है, जिसे घर बनाने के सरल उदाहरण से समझा जा सकता है।

1. ब्लूप्रिंट (MDP फॉर्मूलेशन)

  • पुराना तरीका (टोकन-लेवल): ब्लूप्रिंट हर एक ईंट की सूची है जो रखी गई है। "ईंट 1, ईंट 2, ईंट 3..." यदि आप ईंट 42 में गलती करते हैं, तो पूरी योजना भ्रमित करने वाली हो जाती है।
  • नया तरीका (स्टेप-लेवल): ब्लूप्रिंट कार्यों (tasks) की एक सूची है। "नींव रखें," "दीवारें बनाएं," "छत डालें।"
  • उदाहरण: StepPO में, "एक्शन" केवल एक शब्द टाइप करना नहीं है; यह एक पूरा इंटरैक्शन राउंड पूरा करना है। क्या रोबोट ने सफलतापूर्वक एक टूल (tool) को कॉल किया? क्या उसने सफलतापूर्वक एक प्रश्न पूछा? वह पूरा हिस्सा एक "स्टेप" (चरण) है।

2. स्कोरकार्ड (क्रेडिट असाइनमेंट)

  • पुराना तरीका: यदि अंत में घर ढह जाता है, तो पुराना सिस्टम यह पता लगाने की कोशिश करता है कि किस एक अकेली ईंट के कारण ढह गया। यह दोष (या श्रेय) हजारों छोटी ईंटों में फैला देता है। यह अव्यवस्थित और अक्सर गलत होता है।
  • नया तरीका: यदि घर ढह जाता है, तो हम कार्यों को देखते हैं। "नींव कमजोर थी," या "छत बहुत जल्दी बना दी गई थी।"
  • उदाहरण: StepPO "इनाम" (पॉइंट्स) उस स्टेप को देता है जिसने अंतर पैदा किया। यदि रोबोट ने स्टेप 2 में चाबी ढूंढी, और उससे स्टेप 10 में गेम जीतने में मदद मिली, तो StepPO कहता है, "स्टेप 2 के लिए बहुत बढ़िया!" यह इनाम को उन यादृच्छिक शब्दों से जोड़ता है जो उस निर्णय के दौरान टाइप किए गए थे, बजाय इसके कि वह केवल शब्दों पर ध्यान दे।

3. निर्माण स्थल (ट्रेनिंग सिस्टम)

  • पुराना तरीका: निर्माण दल एक अराजक लाइन में काम करता है। वे कागज के एक लंबे स्क्रॉल पर सब कुछ लिखते हैं। यदि उन्हें कोई गलती सुधारनी पड़ती है, तो उन्हें पूरा स्क्रॉल फिर से लिखना पड़ता है।
  • नया तरीका: निर्माण दल डिजिटल ब्लॉक्स का उपयोग करता है। प्रत्येक "स्टेप" एक स्वतंत्र ब्लॉक (स्टेट + एक्शन + रिवॉर्ड) है। यदि कोई ब्लॉक खराब है, तो आप बाकी घर को खराब किए बिना बस उस ब्लॉक को बदल सकते हैं।
  • उदाहरण: पेपर में उल्लेख किया गया है कि वास्तविक दुनिया के AI प्रशिक्षण को इन ब्लॉक्स को स्टोर करने के लिए एक बेहतर "डेटाबेस" की आवश्यकता है। एक अव्यवस्थित टेक्स्ट फ़ाइल के बजाय, वे एक संरचित प्रणाली का उपयोग करते हैं जहाँ प्रत्येक "स्टेप" को पूरी तरह से सहेजा जाता है, ताकि AI अव्यवस्थित डेटा से भ्रमित हुए बिना अपनी गलतियों से सीख सके।

यह क्यों मायने रखता है? (परिणाम)

लेखकों ने इसका परीक्षण HotpotQA नामक एक कठिन प्रश्न-उत्तर खेल पर किया (जहाँ AI को उत्तर खोजने के लिए कई दस्तावेजों में खोज करनी पड़ती है)।

  • परिणाम: StepPO के साथ प्रशिक्षित AI ने पुराने "अक्षर-दर-अक्षर" तरीके से प्रशिक्षित AI की तुलना में बहुत तेजी से सीखा और बेहतर स्कोर प्राप्त किया।
  • क्यों? क्योंकि AI ने केवल अगले अक्षर का सही अनुमान लगाने के बजाय बेहतर निर्णय (जैसे "मुझे इस विशिष्ट तथ्य को खोजना चाहिए") लेना सीख लिया।

एक वाक्य में सारांश

StepPO प्रशिक्षण का एक नया तरीका है जो AI को शब्द टाइप करना सिखाना बंद करता है और उसे निर्णय लेना सिखाना शुरू करता है, क्योंकि यह हर इंटरैक्शन को अक्षरों की एक लंबी स्ट्रिंग के बजाय एक एकल, पूर्ण "स्टेप" के रूप में देखता है।

"टेकअवे" मेटाफर (सीखने योग्य बात)

कल्पना कीजिए कि आप एक बच्चे को साइकिल चलाना सिखा रहे हैं।

  • टोकन-लेवल ट्रेनिंग: आप उनके पास खड़े होते हैं और चिल्लाते हैं, "ज़ोर से पैडल मारो! बाईं ओर झुको! हैंडल को दाईं ओर घुमाओ! ज़ोर से पैडल मारो!" यह बहुत अधिक और भ्रमित करने वाला है।
  • StepPO ट्रेनिंग: आप उनके एक चक्कर पूरा करने तक प्रतीक्षा करते हैं। फिर आप कहते हैं, "कोने पर मुड़ने के लिए बहुत अच्छा! अगली बार, पहाड़ी से पहले थोड़ा तेज़ पैडल मारने की कोशिश करना।" आप मांसपेशियों की गतिविधियों (टोकन) के बजाय माइलस्टोन्स (स्टेप्स) पर ध्यान केंद्रित करते हैं।

यह पेपर तर्क देता है कि AI के एक वास्तविक "एजेंट" बनने के लिए, हमें सिखाने के StepPO तरीके पर स्विच करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →