SAPO: Single-Rollout Autoregressive Policy Optimization for Agentic Reinforcement Learning
यह शोध पत्र SAPO को प्रस्तुत करता है, जो एजेंटिक सुदृढीकरण शिक्षण (agentic reinforcement learning) के लिए एक मेमोरी-कुशल और कंप्यूट-अनुकूलित फ्रेमवर्क है, जो नीति (policy) और मूल्य कार्यों (value functions) के लिए एक साझा ऑटोरेग्रेसिव बैकबोन का उपयोग करता है ताकि PPO और GRPO जैसी मौजूदा विधियों की तुलना में बेहतर प्रदर्शन और स्थिरता प्राप्त की जा सके और एक अलग क्रिटिक मॉडल की आवश्यकता को समाप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, एक नया क्षितिज उभरा है जहाँ कंप्यूटर प्रोग्राम अब केवल निष्क्रिय टेक्स्ट जनरेटर नहीं रह गए हैं, बल्कि सक्रिय एजेंट बन गए हैं जो तर्क करने, वेब खोजने और कई चरणों में जटिल समस्याओं को हल करने में सक्षम हैं। यह क्षेत्र, जिसे 'एजेंटिक रीइन्फोर्समेंट लर्निंग' (agentic reinforcement learning) के रूप में जाना जाता है, इन डिजिटल सहायकों को एक सिम्युलेटेड वातावरण में प्रयास करने और परिणामों से सीखने की अनुमति देकर उन्हें प्रशिक्षित करता है। एक छात्र की कल्पना करें जो परीक्षा दे रहा है: यदि उसे सही उत्तर मिलता है, तो वह अच्छा महसूस करता है; यदि वह असफल होता है, तो वह यह समझने की कोशिश करता है कि क्या गलत हुआ। एक AI के लिए, यह सीखने की प्रक्रिया एक ऐसी प्रणाली पर निर्भर करती है जो निर्णयों की एक लंबी श्रृंखला को पीछे मुड़कर देख सके और यह निर्धारित कर सके कि किस विशिष्ट चरण ने सफलता या विफलता की ओर ले जाने का निर्णय लिया। पारंपरिक रूप से, इसके लिए एक भारी, दो-भाग वाली प्रणाली की आवश्यकता होती थी: एक भाग अगला कदम उठाने का निर्णय लेने के लिए, और एक अलग, विशाल "क्रिटिक" (critic) भाग जो वर्तमान स्थिति कितनी अच्छी है इसका मूल्यांकन करे। यह अलगाव अच्छा काम करता है लेकिन अत्यधिक कंप्यूटिंग शक्ति और मेमोरी की मांग करता है, जिससे अक्सर सीखने की प्रक्रिया धीमी हो जाती है या इसे मानक हार्डवेयर पर चलाना बहुत महंगा हो जाता है।
शोधकर्ताओं ने हाल ही में पाया है कि कई AI एजेंट तब संघर्ष करते हैं जब उन्हें मिलने वाला फीडबैक विरल (sparse) या विलंबित होता है, जैसे कि किसी लंबे कार्य के अंत तक यह जानने के लिए इंतजार करना कि वे सफल हुए या नहीं। मौजूदा तरीके जो इस प्रक्रिया को सरल बनाने के लिए एक अलग क्रिटिक को हटाने का प्रयास करते हैं, अक्सर अस्थिर शिक्षण या खराब प्रदर्शन के साथ समाप्त होते हैं क्योंकि उनमें एक लंबी श्रृंखला में व्यक्तिगत चरणों को श्रेय देने का स्पष्ट तरीका नहीं होता है। इस समस्या को हल करने के लिए, ज़ियामेन यूनिवर्सिटी और नानयांग टेक्नोलॉजिकल यूनिवर्सिटी के वैज्ञानिकों की एक टीम ने एक नया फ्रेमवर्क विकसित किया है जिसे SAPO कहा जाता है, जिसका अर्थ है 'सिंगल-रोलआउट ऑटोरेग्रेसिव पॉलिसी ऑप्टिमाइज़ेशन' (Single-Rollout Autoregressive Policy Optimization)। एक अलग मॉडल का उपयोग करने या एक कार्य से सीखने के लिए दर्जनों अलग-अलग प्रयास उत्पन्न करने की आवश्यकता के बजाय, SAPO एक एकल भाषा मॉडल को एक साथ सब कुछ करने के लिए प्रशिक्षित करता है। यह क्रिया का निर्णय लेने, क्रिया से पहले की स्थिति का मूल्यांकन करने और स्वयं क्रिया के मूल्य का निर्णय लेने के लिए भाषा उत्पादन के प्राकृतिक प्रवाह का उपयोग करता है, और यह सब एक निरंतर विचार धारा (stream of thought) के भीतर होता है।
SAPO का मुख्य नवाचार यह है कि यह AI के मस्तिष्क के भीतर सूचना को कैसे व्यवस्थित करता है। एक मानक बातचीत या कार्य में, AI एक प्रॉम्प्ट पढ़ता है, सोचता है, और फिर एक प्रतिक्रिया लिखता है। शोधकर्ताओं ने महसूस किया कि AI द्वारा प्रतिक्रिया लिखना शुरू करने से ठीक पहले का क्षण यह पूछने के लिए सबसे उपयुक्त समय है कि, "यह स्थिति कितनी अच्छी है?" और प्रतिक्रिया समाप्त होने के ठीक बाद का क्षण यह पूछने के लिए सबसे उपयुक्त समय है कि, "वह विशिष्ट क्रिया कितनी अच्छी थी?" इन दोनों प्रश्नों को टेक्स्ट जनरेशन प्रक्रिया में विशिष्ट, निश्चित बिंदुओं पर रखकर, मॉडल बिना किसी अलग मूल्यांकनकर्ता की आवश्यकता के दोनों का उत्तर देने में सक्षम हो सकता है। यह डिज़ाइन AI को एक कार्य के केवल एक प्रयास से सीखने की अनुमति देता है, न कि एक बड़े समूह के विविधताओं को एक दूसरे के विरुद्ध तुलना करने के लिए उत्पन्न करने की आवश्यकता होती है। यह प्रणाली प्रभावी रूप से विभिन्न स्थितियों में अपने 'वैल्यू' (value) की समझ को सामान्य बनाने के बारे में सीखती है, यह सुनिश्चित करती है कि वह केवल सफलता के एक विशिष्ट पथ को याद नहीं करती है, बल्कि इस तर्क को भी समझती है कि कोई चाल क्यों अच्छी या बुरी थी।
इस दृष्टिकोण का परीक्षण करने के लिए, टीम ने AI को दो चुनौतीपूर्ण वातावरणों पर प्रशिक्षित किया: एक सिम्युलेटेड घरेलू वातावरण जहाँ एजेंट को सफाई करने या वस्तुओं को गर्म करने जैसे भौतिक कार्य पूरे करने होते हैं, और एक जटिल वेब शॉपिंग परिदृश्य जहाँ एजेंट को विशिष्ट उत्पादों को खोजने के लिए वेबसाइटों को नेविगेट करना होता है। उन्होंने दो अलग-अलग आकार के भाषा मॉडल का उपयोग किया, एक 1.5 बिलियन पैरामीटर्स वाला और दूसरा 7 बिलियन वाला, यह देखने के लिए कि क्या यह विधि विभिन्न पैमानों पर कायम रहती है। परिणाम आश्चर्यजनक थे। घरेलू कार्यों में, नई विधि ने मानक विधि (जो एक अलग क्रिटिक का उपयोग करती है) की तुलना में सफलता दर में 15 प्रतिशत अंक से अधिक और उस अग्रणी विधि की तुलना में 12 प्रतिशत अंक से अधिक सुधार किया जो क्रिटिक का उपयोग करने से बचने का प्रयास करती है। वेब शॉपिंग कार्यों में, सुधार समान रूप से महत्वपूर्ण थे, जहाँ AI ने उच्च स्कोर प्राप्त किया और अधिक कार्यों को सफलतापूर्वक पूरा किया। सबसे महत्वपूर्ण बात यह है कि इस नए तरीके ने काफी कम मेमोरी का उपयोग किया और पारंपरिक दृष्टिकोण की तुलना में प्रति प्रशिक्षण चरण लगभग 33 प्रतिशत तेजी से काम किया, क्योंकि इसने प्रदर्शन का मूल्यांकन करने के लिए दूसरे, अलग मॉडल को चलाने की आवश्यकता को समाप्त कर दिया।
इस फ्रेमवर्क की सफलता यह सुझाव देती है कि बड़े भाषा मॉडलों द्वारा सूचना को स्वाभाविक रूप से संसाधित करने के तरीके का उपयोग AI एजेंटों को प्रशिक्षित करने की कुछ सबसे कठिन समस्याओं को हल करने के लिए किया जा सकता है। भाषा उत्पादन की प्राकृतिक संरचना के साथ सीखने की प्रक्रिया को संरेखित करके, शोधकर्ताओं ने दिखाया है कि निर्णय लेने और मूल्यांकन के लिए अलग-अलग प्रणालियों को बनाए रखने की भारी कम्प्यूटेशनल लागत के बिना उच्च-स्तरीय प्रदर्शन प्राप्त करना संभव है। यह दृष्टिकोण न केवल प्रशिक्षण को अधिक कुशल बनाता है, बल्कि इसे अधिक स्थिर भी बनाता है, जिससे एजेंटों को उनके कार्यों के लिए मिलने वाले पुरस्कार विलंबित या दुर्लभ होने पर भी प्रभावी ढंग से सीखने की अनुमति मिलती है। जैसे-जैसे आर्टिफिशियल इंटेलिजेंस का क्षेत्र अधिक स्वायत्त और सक्षम एजेंट बनाने की ओर बढ़ रहा है, इस तरह के तरीके एक व्यावहारिक मार्ग प्रदान करते हैं, जो यह सिद्ध करते हैं कि दक्षता और उच्च प्रदर्शन, जटिल, दीर्घकालिक इंटरैक्शन से सीखने की क्षमता से समझौता किए बिना, साथ-साथ चल सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।