StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning
यह शोध पत्र StepPO प्रस्तुत करता है, जो एक ऐसा ढांचा है जो अनुकूलन प्रतिमान (optimization paradigm) को टोकन-स्तर से स्टेप-स्तर के मार्कोव निर्णय प्रक्रियाओं (Markov Decision Processes) में स्थानांतरित करके एजेंटिक सुदृढीकरण लर्निंग (Agentic Reinforcement Learning) को उन्नत करता है, जिससे नीति अपडेट और क्रेडिट असाइनमेंट को एजेंट के निर्णयों की स्वाभाविक सूक्ष्मता (granularity) के साथ संरेखित किया जा सके ताकि मल्टी-टर्न इंटरैक्शन, स्पार्स रिवार्ड्स और जटिल टूल उपयोग को बेहतर ढंग से संभाला जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: एक रोबोट को गेम खेलना सिखाना
कल्पना कीजिए कि आप एक रोबोट (एक लार्ज लैंग्वेज मॉडल) को द लीजेंड ऑफ ज़ेल्डा जैसा कोई जटिल वीडियो गेम खेलना सिखाने की कोशिश कर रहे हैं। रोबोट को जीतने के लिए एक कालकोठरी (dungeon) को खोजना, चाबियाँ ढूँढना, राक्षसों को हराना और पहेलियों को सुलझाना होगा।
अतीत में, जब हम AI को प्रशिक्षित करते थे, तो हम उन्हें ज्यादातर एक बार में वाक्य लिखना या उत्तर देना सिखाते थे। हम उनके आउटपुट को अक्षर दर अक्षर (या "टोकन दर टोकन") देखते थे।
समस्या:
जब रोबोट गेम खेल रहा होता है, तो उसे एक-एक अक्षर करके देखना वैसा ही है जैसे किसी को कार चलाना सिखाने के लिए उसके हाथ की उंगली की हर छोटी हरकत की आलोचना करना।
- "तुम्हारी उंगली बहुत ज्यादा बाईं ओर मुड़ी।"
- "तुम्हारी उंगली थोड़ी कम दाईं ओर मुड़ी।"
- "तुमने गैस पेडल बहुत जोर से दबाया।"
यह टोकन-लेवल लर्निंग (Token-Level Learning) है। यह बहुत शोर भरा और बहुत सूक्ष्म (granular) है। रोबोट को यह समझ नहीं आता कि वह क्यों विफल हुआ। क्या वह इसलिए विफल हुआ क्योंकि उसने पहिया थोड़ा गलत घुमाया, या इसलिए क्योंकि उसने पहले से ही दीवार में गाड़ी चलाने का फैसला किया था?
समाधान: StepPO
इस पेपर के लेखक इन "एजेंटिक" (Agentic) AI सिस्टम को प्रशिक्षित करने का एक नया तरीका प्रस्तावित करते हैं। वे इसे StepPO (स्टेप-अलाइन्ड पॉलिसी ऑप्टिमाइज़ेशन) कहते हैं।
रोबोट की उंगलियों की हरकत देखने के बजाय, StepPO रोबोट के निर्णयों को देखता है।
- चरण 1: रोबोट एक बंद दरवाजा देखता है।
- चरण 2: रोबोट निर्णय लेता है कि "चाबी की तलाश करनी है।"
- चरण 3: रोबोट चाबी ढूंढ लेता है और दरवाजा खोल देता है।
- चरण 4: रोबोट को इनाम (पॉइंट्स) मिलता है।
StepPO कहता है: "रोबोट को 'चाबी की तलाश करें' कहने के लिए लिखे गए विशिष्ट अक्षरों के लिए दोष न दें। चाबी खोजने के निर्णय के लिए उसे जिम्मेदार ठहराएं।"
तीन प्रमुख बदलाव (कैसे करें - "How-To")
यह पेपर तर्क देता है कि इसे सफल बनाने के लिए, हमें AI को प्रशिक्षित करने के तरीके में तीन चीजें बदलने की आवश्यकता है, जिसे घर बनाने के सरल उदाहरण से समझा जा सकता है।
1. ब्लूप्रिंट (MDP फॉर्मूलेशन)
- पुराना तरीका (टोकन-लेवल): ब्लूप्रिंट हर एक ईंट की सूची है जो रखी गई है। "ईंट 1, ईंट 2, ईंट 3..." यदि आप ईंट 42 में गलती करते हैं, तो पूरी योजना भ्रमित करने वाली हो जाती है।
- नया तरीका (स्टेप-लेवल): ब्लूप्रिंट कार्यों (tasks) की एक सूची है। "नींव रखें," "दीवारें बनाएं," "छत डालें।"
- उदाहरण: StepPO में, "एक्शन" केवल एक शब्द टाइप करना नहीं है; यह एक पूरा इंटरैक्शन राउंड पूरा करना है। क्या रोबोट ने सफलतापूर्वक एक टूल (tool) को कॉल किया? क्या उसने सफलतापूर्वक एक प्रश्न पूछा? वह पूरा हिस्सा एक "स्टेप" (चरण) है।
2. स्कोरकार्ड (क्रेडिट असाइनमेंट)
- पुराना तरीका: यदि अंत में घर ढह जाता है, तो पुराना सिस्टम यह पता लगाने की कोशिश करता है कि किस एक अकेली ईंट के कारण ढह गया। यह दोष (या श्रेय) हजारों छोटी ईंटों में फैला देता है। यह अव्यवस्थित और अक्सर गलत होता है।
- नया तरीका: यदि घर ढह जाता है, तो हम कार्यों को देखते हैं। "नींव कमजोर थी," या "छत बहुत जल्दी बना दी गई थी।"
- उदाहरण: StepPO "इनाम" (पॉइंट्स) उस स्टेप को देता है जिसने अंतर पैदा किया। यदि रोबोट ने स्टेप 2 में चाबी ढूंढी, और उससे स्टेप 10 में गेम जीतने में मदद मिली, तो StepPO कहता है, "स्टेप 2 के लिए बहुत बढ़िया!" यह इनाम को उन यादृच्छिक शब्दों से जोड़ता है जो उस निर्णय के दौरान टाइप किए गए थे, बजाय इसके कि वह केवल शब्दों पर ध्यान दे।
3. निर्माण स्थल (ट्रेनिंग सिस्टम)
- पुराना तरीका: निर्माण दल एक अराजक लाइन में काम करता है। वे कागज के एक लंबे स्क्रॉल पर सब कुछ लिखते हैं। यदि उन्हें कोई गलती सुधारनी पड़ती है, तो उन्हें पूरा स्क्रॉल फिर से लिखना पड़ता है।
- नया तरीका: निर्माण दल डिजिटल ब्लॉक्स का उपयोग करता है। प्रत्येक "स्टेप" एक स्वतंत्र ब्लॉक (स्टेट + एक्शन + रिवॉर्ड) है। यदि कोई ब्लॉक खराब है, तो आप बाकी घर को खराब किए बिना बस उस ब्लॉक को बदल सकते हैं।
- उदाहरण: पेपर में उल्लेख किया गया है कि वास्तविक दुनिया के AI प्रशिक्षण को इन ब्लॉक्स को स्टोर करने के लिए एक बेहतर "डेटाबेस" की आवश्यकता है। एक अव्यवस्थित टेक्स्ट फ़ाइल के बजाय, वे एक संरचित प्रणाली का उपयोग करते हैं जहाँ प्रत्येक "स्टेप" को पूरी तरह से सहेजा जाता है, ताकि AI अव्यवस्थित डेटा से भ्रमित हुए बिना अपनी गलतियों से सीख सके।
यह क्यों मायने रखता है? (परिणाम)
लेखकों ने इसका परीक्षण HotpotQA नामक एक कठिन प्रश्न-उत्तर खेल पर किया (जहाँ AI को उत्तर खोजने के लिए कई दस्तावेजों में खोज करनी पड़ती है)।
- परिणाम: StepPO के साथ प्रशिक्षित AI ने पुराने "अक्षर-दर-अक्षर" तरीके से प्रशिक्षित AI की तुलना में बहुत तेजी से सीखा और बेहतर स्कोर प्राप्त किया।
- क्यों? क्योंकि AI ने केवल अगले अक्षर का सही अनुमान लगाने के बजाय बेहतर निर्णय (जैसे "मुझे इस विशिष्ट तथ्य को खोजना चाहिए") लेना सीख लिया।
एक वाक्य में सारांश
StepPO प्रशिक्षण का एक नया तरीका है जो AI को शब्द टाइप करना सिखाना बंद करता है और उसे निर्णय लेना सिखाना शुरू करता है, क्योंकि यह हर इंटरैक्शन को अक्षरों की एक लंबी स्ट्रिंग के बजाय एक एकल, पूर्ण "स्टेप" के रूप में देखता है।
"टेकअवे" मेटाफर (सीखने योग्य बात)
कल्पना कीजिए कि आप एक बच्चे को साइकिल चलाना सिखा रहे हैं।
- टोकन-लेवल ट्रेनिंग: आप उनके पास खड़े होते हैं और चिल्लाते हैं, "ज़ोर से पैडल मारो! बाईं ओर झुको! हैंडल को दाईं ओर घुमाओ! ज़ोर से पैडल मारो!" यह बहुत अधिक और भ्रमित करने वाला है।
- StepPO ट्रेनिंग: आप उनके एक चक्कर पूरा करने तक प्रतीक्षा करते हैं। फिर आप कहते हैं, "कोने पर मुड़ने के लिए बहुत अच्छा! अगली बार, पहाड़ी से पहले थोड़ा तेज़ पैडल मारने की कोशिश करना।" आप मांसपेशियों की गतिविधियों (टोकन) के बजाय माइलस्टोन्स (स्टेप्स) पर ध्यान केंद्रित करते हैं।
यह पेपर तर्क देता है कि AI के एक वास्तविक "एजेंट" बनने के लिए, हमें सिखाने के StepPO तरीके पर स्विच करना होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।