EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning
मूल लेखक: Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
मूल लेखक: Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: ENVRL - एजेंटिक सुदृढीकरण शिक्षण (Reinforcement Learning) में परिवेश गतिशीलता (Environment Dynamics) से सीखें
1. समस्या विवरण
सुदृढीकरण शिक्षण (RL), बड़े भाषा मॉडल (LLMs) को जटिल, दीर्घ-अवधि वाले कार्यों (जैसे वेब नेविगेशन, सॉफ्टवेयर इंटरेक्शन) को संभालने में सक्षम स्वायत्त एजेंटों के रूप में प्रशिक्षित करने के लिए एक मानक प्रतिमान बन गया है। हालाँकि, प्रचलित एजेंटिक RL एल्गोरिदम (जैसे GRPO और RLOO) मुख्य रूप से परिणाम-आधारित पुरस्कारों (outcome-based rewards) पर निर्भर करते हैं, जहाँ वातावरण एपिसोड के पूरा होने पर ही बाइनरी फीडबैक प्रदान करता है।
दीर्घ-अवधि (long-horizon), बहु-चरण (multi-turn) संदर्भों में, यह विरल फीडबैक (sparse feedback) एक गंभीर सीखने की चुनौती पेश करता है। लेखक तर्क देते हैं कि यह दृष्टिकोण रोलआउट इंटरेक्शन ट्राजेक्टरीज (rollout interaction trajectories) में निहित समृद्ध परिवेश गतिशीलता सूचना (environment dynamics information) की अनदेखी करता है। जबकि एजेंट वातावरण के साथ अंतःक्रिया करता है, वह ऐसे अनुभव उत्पन्न करता है जो स्पष्ट रूप से उन संकेतों को वहन करते हैं जो बताते हैं कि कार्यों के जवाब में वातावरण कैसे विकसित होता है और अंतर्निहित संक्रमण तंत्र (transition mechanisms) को प्रकट करते हैं। मौजूदा विधियाँ इस अंतर्निहित पर्यवेक्षण (implicit supervision) का लाभ उठाने में विफल रहती हैं, जिससे एजेंट की वातावरण का सटीक आंतरिक मॉडल बनाने और मजबूत निर्णय लेने की क्षमता सीमित हो जाती है।
2. कार्यप्रणाली: ENVRL ढांचा (Framework)
यह शोध पत्र ENVRL का प्रस्ताव करता है, जो एजेंटिक RL में परिवेश गतिशीलता शिक्षण को शामिल करने के लिए डिज़ाइन किया गया एक ढांचा है। मुख्य विचार इंटरेक्शन अनुभवों को स्व-पर्यवेक्षित संकेतों (self-supervised signals) में बदलना है जो प्राथमिक RL उद्देश्य के पूरक हों। ENVRL दो सहायक उद्देश्यों को पेश करता है:
A. अवस्था भविष्यवाणी (State Prediction - SP)
यह उद्देश्य फॉरवर्ड एनवायरनमेंट डायनेमिक्स को मॉडल करता है। वर्तमान अवस्था st और चुने गए कार्य at को देखते हुए, एजेंट को अगली परिवेश अवस्था st+1 की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है।
- तंत्र: पाठ्य-आधारित वातावरणों में, st+1 अगली-चरण की पाठ्य अवलोकन (textual observation) है। उद्देश्य अनुमानित और वास्तविक अगली अवस्था के बीच क्रॉस-एन्ट्रॉपी लॉस को कम करता है:
LSP(θ)=−E(st,at,st+1)∼Dπθ[logpθ(st+1∣st,at)] - लक्ष्य: एजेंट को यह आत्मसात करने के लिए प्रोत्साहित करना कि उसके कार्य आगामी अवलोकनों को कैसे आकार देते हैं।
B. व्युत्क्रम गतिशीलता (Inverse Dynamics - ID)
यह उद्देश्य बैकवर्ड कॉजालिटी (backward causality) को मॉडल करता है। दो क्रमिक अवस्थाओं (st,st+1) को देखते हुए, एजेंट को उस कार्य at का अनुमान लगाने के लिए प्रशिक्षित किया जाता है जिसने संक्रमण (transition) को प्रेरित किया।
- तंत्र: उद्देश्य कार्य को पुनः प्राप्त करने के लिए क्रॉस-एन्ट्रॉपी लॉस को कम करता है:
LID(θ)=−E(st,at,st+1)∼Dπθ[logpθ(at∣st,st+1)] - लक्ष्य: व्यवहार और पर्यावरणीय परिवर्तनों के बीच एजेंट की कारण संबंध (causal link) की समझ को मजबूत करना, जिससे उसे बाहरी अवलोकन विवरणों को फ़िल्टर करने में मदद मिलती है।
C. क्षय (Decay) के साथ संयुक्त ऑनलाइन अनुकूलन
कुल शिक्षण उद्देश्य प्राथमिक RL लॉस (LRL) को सहायक लॉस (LSP और LID) के साथ जोड़ता है:
L(θ;t)=LRL(θ)+λSP(t)LSP(θ)+λID(t)LID(θ)
प्रारंभिक गतिशीलता शिक्षण और देर-चरण के पुरस्कार अधिकतमकरण (reward maximization) की आवश्यकता के बीच संतुलन बनाने के लिए, लेखक एक गुणांक क्षय तंत्र (coefficient decay mechanism) का उपयोग करते हैं। भार λSP(t) और λID(t) एक कोसाइन डिके शेड्यूल (cosine decay schedule) का पालन करते हैं, जो उच्च मान से शुरू होकर प्रशिक्षण के आगे बढ़ने के साथ धीरे-धीरे शून्य तक कम हो जाता है। यह सुनिश्चित करता है कि एजेंट को शुरुआत में गतिशीलता पर सघन पर्यवेक्षण मिले, और फिर धीरे-धीरे प्राथमिक कार्य पुरस्कार पर ध्यान केंद्रित किया जाए।
कंप्यूटेशनल दक्षता: ENVRL मानक RL प्रक्रिया के दौरान उत्पन्न रोलआउट डेटा का पुन: उपयोग करता है। सहायक लॉस की गणना के लिए इसे प्रति अपडेट केवल एक अतिरिक्त फॉरवर्ड पास की आवश्यकता होती है, जिससे नगण्य कंप्यूटेशनल ओवरहेड उत्पन्न होता है।
3. प्रमुख योगदान
- ढांचा प्रस्ताव: ENVRL का परिचय, जो एक हल्का ढांचा है जो सहायक उद्देश्यों के रूप में स्टेट प्रेडिक्शन और इनवर्स डायनेमिक्स को एजेंटिक RL में एकीकृत करता है।
- अंतर्निहित पर्यवेक्षण का उपयोग: इंटरेक्शन अनुभव को सघन पर्यवेक्षण संकेतों के एक स्वतंत्र स्रोत के रूप में उपयोग करने का एक नया दृष्टिकोण, जो दीर्घ-अवधि के कार्यों में परिणाम-आधारित पुरस्कारों की विरलता (sparsity) को संबोधित करता है।
- क्षय तंत्र (Decay Mechanism): एक समय-निर्भर गुणांक शेड्यूल जो परिवेश की गतिशीलता सीखने और कार्य पुरस्कारों के अनुकूलन के बीच गतिशील रूप से संतुलन बनाता है।
- दक्षता: यह प्रदर्शन कि ये सुधार बिना किसी अतिरिक्त सैंपलिंग या अलग मॉडल प्रशिक्षण के, मौजूदा रोलआउट ट्राजेक्टरीज का पुन: उपयोग करके प्राप्त किए गए हैं।
4. प्रयोगात्मक परिणाम
लेखकों ने दो दीर्घ-अवधि एजेंटिक बेंचमार्क पर ENVRL का मूल्यांकन किया: ALFWorld (टेक्स्ट-आधारित घरेलू कार्य) और WebShop (ई-कॉमर्स उत्पाद खोज)। प्रयोग Qwen2.5 मॉडल (1.5B और 7B) के साथ GRPO और GiGPO बेसलाइन का उपयोग करके किए गए।
- प्रदर्शन लाभ:
- ALFWorld (1.5B, GRPO): सफलता दर 72.8% से बढ़कर 77.4% (+4.6 अंक) हो गई।
- WebShop (1.5B, GRPO): सफलता दर 56.8% से बढ़कर 67.0% (+10.2 अंक) हो गई।
- 7B मॉडल: GRPO और अधिक शक्तिशाली GiGPO बेसलाइन दोनों के साथ निरंतर सुधार देखे गए (जैसे, GiGPO + ENVRL ने ALFWorld पर 94.5% प्राप्त किया)।
- नमूना दक्षता (Sample Efficiency): ENVRL ने औसतन कुल प्रशिक्षण चरणों के लगभग 68.5% का उपयोग करके RL बेसलाइन के अंतिम प्रदर्शन स्तर को प्राप्त कर लिया, जो तेज़ अभिसरण (convergence) का संकेत देता है।
- व्यवहार संबंधी सुधार: सफल एपिसोड के लिए कम इंटरेक्शन टर्न और कम रिस्पॉन्स लंबाई की आवश्यकता हुई, जो अधिक सटीक निर्णय लेने और कम अनावश्यक अन्वेषण (exploration) का सुझाव देती है।
- सामान्यीकरण (Generalization): मानक कार्यों पर प्रशिक्षित ENVRL मॉडल ने नवीन रूम कॉन्फ़िगरेशन और अनदेखे ऑब्जेक्ट प्रकारों वाले आउट-ऑफ-डिस्ट्रीब्यूशन (OOD) टेस्ट सेट पर बेहतर मजबूती दिखाई।
- एब्लेशन अध्ययन (Ablation Studies):
- SP या ID में से किसी एक को हटाने से प्रदर्शन में गिरावट आई, जो फॉरवर्ड और बैकवर्ड डायनेमिक्स मॉडलिंग की पूरक प्रकृति की पुष्टि करता है।
- क्षय तंत्र (decay mechanism) को हटाने से प्रदर्शन में गिरावट आई, जो समय के साथ डायनेमिक्स से रिवॉर्ड की ओर ध्यान केंद्रित करने की आवश्यकता को रेखांकित करता है।
- सहायक प्रशिक्षण के लिए उपयोग किए जाने वाले अनुभव डेटा के अंश के साथ प्रदर्शन सकारात्मक रूप से स्केल होता है।
5. महत्व और दावे
शोध पत्र का दावा है कि ENVRL, LLM एजेंटों के लिए परिवेश की गतिशीलता से सीखने के लिए एक सामान्य और हल्का (lightweight) दृष्टिकोण प्रदान करता है। स्व-पर्यवेक्षित उद्देश्यों के माध्यम से वातावरण के संक्रमण तंत्र को आत्मसात करके, एजेंट दीर्घ-अवधि के कार्यों में अधिक प्रभावी निर्णय ले सकते हैं जहाँ परिणाम पुरस्कार विरल होते हैं।
लेखक अपने कार्य को सूक्ष्म क्रेडिट असाइनमेंट (credit assignment) या मध्यवर्ती रिवॉर्ड शेपिंग (reward shaping) पर ध्यान केंद्रित करने वाली मौजूदा विधियों के ऑर्थोगोनल (orthogonal) के रूप में प्रस्तुत करते हैं। इसके बजाय, ENVRL इंटरेक्शन अनुभव को एक समृद्ध, स्वतंत्र सूचना स्रोत के रूप में मानता है। इस ढांचे को एक पूरक रणनीति के रूप में प्रस्तुत किया गया है जिसे महत्वपूर्ण कंप्यूटेशनल लागत के बिना नमूना दक्षता और सामान्यीकरण को बढ़ाने के लिए विभिन्न पॉलिसी ऑप्टिमाइज़ेशन एल्गोरिदम (जैसे GRPO या GiGPO) के साथ एकीकृत किया जा सकता है। यह कार्य एजेंटिक RL मैकेनिक्स के लिए एक नया दृष्टिकोण प्रदान करने का लक्ष्य रखता है, जो अधिक मजबूत और स्वायत्त एजेंटों के विकास में योगदान देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।
हर हफ़्ते machine learning के बेहतरीन पेपर पाएँ।
Stanford, Cambridge और French Academy of Sciences के रिसर्चर हम पर भरोसा करते हैं।
अपना सब्सक्रिप्शन पक्का करने के लिए इनबॉक्स देखें।
कुछ गड़बड़ हो गई। फिर से कोशिश करें?
कोई स्पैम नहीं, कभी भी अनसब्सक्राइब करें।