Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks
यह शोधपत्र SINKFLEX-RL को प्रस्तुत करता है, जो एक मॉड्यूलर प्रशिक्षण प्रणाली है जो एनवायरनमेंट इंटरफेस, RL डेटाफ्लो और एक सिंक-अवेयर (sink-aware) FlexAttention पाथ को एकीकृत करती है ताकि टूल-इस्तेमाल करने वाले एजेंटों के लिए मेमोरी-कुशल, लॉन्ग-होरिज़न सुदृढीकरण शिक्षण (reinforcement learning) को सक्षम बनाया जा सके, जो प्रारंभिक बेंचमार्क में बेहतर वैलिडेशन रिवार्ड्स और महत्वपूर्ण VRAM कटौती का प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को एक बहुत ही जटिल, कई दिनों तक चलने वाले बोर्ड गेम को खेलना सिखा रहे हैं। यह ऐसा खेल नहीं है जहाँ आप बस पासा फेंकते हैं और अपनी गोटी आगे बढ़ाते हैं; यह एक ऐसा खेल है जहाँ रोबोट को अन्य खिलाड़ियों से बात करनी होगी, विशेष गैजेट्स के टूलबॉक्स का उपयोग करना होगा, एक सख्त नियम पुस्तिका का पालन करना होगा, और यह जानने के लिए दिनों तक इंतजार करना होगा कि उसने वास्तव में जीत हासिल की है या नहीं। यह "एजेंटिक एआई" (Agentic AI) की दुनिया है, जहाँ कंप्यूटर प्रोग्राम डिजिटल दुनिया में कदम उठाने वाले छोटे एजेंटों की तरह कार्य करते हैं। बड़ी समस्या यह है कि ये खेल इतने लंबे और जटिल हो जाते हैं कि रोबोट का मस्तिष्क (उसकी स्मृति) ओवरफ्लो होने लगता है। यह एक 10 घंटे की बातचीत का हर एक शब्द याद रखने और साथ ही गणित करने जैसा है; अंततः, आपके पास सोचने के लिए जगह खत्म हो जाती है। वैज्ञानिक यह पता लगाने की कोशिश कर रहे हैं कि इन रोबोटों को इन लंबे खेलों में बेहतर होने के लिए कैसे प्रशिक्षित किया जाए, बिना उनके दिमाग को सूचना के भारी बोझ से पिघलने दिए।
यह शोध पत्र एक नया प्रशिक्षण तंत्र पेश करता है जिसे SINKFLEX-RL कहा जाता है, जो एक चतुर ट्रिक की तरह है जो रोबोट को एक बड़ा मस्तिष्क बनाए बिना खेल के सबसे महत्वपूर्ण हिस्सों को याद रखने में मदद करता है। शोधकर्ताओं ने एक प्रणाली बनाई है जो एक मानक गेम इंटरफेस, गलतियों से सीखने के एक स्मार्ट तरीके (जिसे "ग्रुप-रिलेटिव पॉलिसी ऑप्टिमाइजेशन" या "GRPO" कहा जाता है), और रोबोट के अटेंशन (ध्यान) के लिए एक विशेष मेमोरी-बचाने वाली तकनीक को जोड़ती है। बातचीत के पिछले 8,000 स्टेप्स के हर एक विवरण को याद रखने के बजाय, यह प्रणाली एक "सिंक" (sink) तंत्र का उपयोग करती है। इसे रोबोट के मन में एक जादुई स्पंज की तरह समझें: यह पुरानी जानकारी के भारी शोर को सोख लेता है लेकिन उन आवश्यक "सिंक्स" (शुरुआती बिंदुओं) को बनाए रखता है जो रोबोट को स्थिर रहने में मदद करते हैं। इस स्पंज का उपयोग करके, रोबोट अतीत के भार से कुचले बिना वर्तमान चाल पर ध्यान केंद्रित कर सकता है।
टीम ने एक सिम्युलेटेड रिटेल स्टोर वातावरण में इस प्रणाली का परीक्षण किया जहाँ रोबोट को एक ग्राहक की मदद करनी होती है, इन्वेंट्री चेक करने के लिए टूल्स का उपयोग करना होता है, और स्टोर की नीतियों का पालन करना होता है। इन शुरुआती परीक्षणों में, रोबोट का प्रदर्शन स्कोर बढ़ गया, जो सीखते समय 0.25 से बढ़कर 0.44 हो गया। लेकिन असली जादू तब हुआ जब उन्होंने परीक्षण किया कि इस प्रणाली को कितने कंप्यूटर मेमोरी (VRAM) की आवश्यकता थी। जब बातचीत बहुत लंबी (8,192 टोकन) हो गई, तो पुराना, मानक तरीका मेमोरी की कमी के कारण क्रैश हो गया। हालाँकि, नया SINKFLEX-RL सिस्टम चलता रहा, जिसने केवल 25.53 GB मेमोरी का उपयोग किया। यहाँ तक कि थोड़ी छोटी लंबाई 4,096 टोकन पर भी, नए सिस्टम ने पुराने तरीके की तुलना में 19.7% मेमोरी बचाई। लेखक सुझाव देते हैं कि यह साबित करता है कि बिना बहुत महंगे हार्डवेयर के इन लॉन्ग-होरिजन एजेंटों को प्रशिक्षित करना संभव है, हालांकि वे यह भी नोट करते हैं कि यह केवल एक प्रारंभिक दृष्टिकोण है और अंतिम, पूर्ण समाधान नहीं है।
समस्या: रोबोट का मेमोरी लीक
कल्पना कीजिए कि आप इस कहानी में रोबोट हैं। आप एक खेल खेल रहे हैं जहाँ आपको एक ग्राहक को शर्ट खरीदने में मदद करनी है। आप उनसे उनका साइज पूछते हैं, वे बताते हैं, आप इन्वेंट्री चेक करते हैं, वे फिर से एक अलग रंग मांगते हैं, आप फिर से चेक करते हैं, इत्यादि। 50 टर्न के बाद, आपको सबसे पहली बात याद रखनी होगी जो उन्होंने कही थी ताकि आप सुनिश्चित कर सकें कि आप उनका साइज नहीं भूले हैं।
AI की दुनिया में, इसे "लॉन्ग-होरिजन" (long-horizon) कार्य कहा जाता है। समस्या यह है कि जैसे-जैसे बातचीत लंबी होती जाती है, कंप्यूटर को उन सभी शब्दों को रखने के लिए आवश्यक मेमोरी की मात्रा अविश्वसनीय रूप से तेजी से बढ़ती है। यह एक बैकपैक ले जाने जैसा है जो हर कदम पर भारी होता जाता है। यदि बातचीत बहुत लंबी हो जाती है (जैसे 8,000 शब्द), तो बैकपैक इतना भारी हो जाता है कि रोबोट ढह जाता है। इसे "VRAM" (वीडियो रैंडम एक्सेस मेमोरी) खत्म होना कहा जाता है, जो वह हाई-स्पीड मेमोरी है जिसका उपयोग कंप्यूटर सोचने के लिए करता है।
शोधकर्ताओं ने देखा कि इन रोबोटों को प्रशिक्षित करने के पारंपरिक तरीके एक "मेमोरी वॉल" से टकरा रहे थे। रोबोट इसलिए अटक रहे थे क्योंकि वे सब कुछ स्पष्ट रूप से याद करने की कोशिश कर रहे थे, जो बहुत महंगा है। उन्हें कुशल होने के लिए एक तरीके की आवश्यकता थी बिना तर्क करने की क्षमता खोए।
समाधान: जादुई स्पंज और टीम की बैठक
शोध पत्र इस मेमोरी लीक को ठीक करने के लिए तीन-भागों वाला समाधान प्रस्तावित करता है, जिसे वे SINKFLEX-RL कहते हैं।
1. द जिमनासियम रैपर (द यूनिवर्सल रिमोट)
सबसे पहले, उन्होंने एक मानक इंटरफेस बनाया, एक यूनिवर्सल रिमोट कंट्रोल की तरह, जो रोबोट को विभिन्न गेम वातावरणों से बात करने की अनुमति देता है। चाहे रोबोट स्टोर में हो, बैंक में हो, या ट्रैवल एजेंसी में, यह रैपर यह सुनिश्चित करता है कि रोबोट मदद मांगना, टूल्स का उपयोग करना और फीडबैक प्राप्त करना जानता हो। यह रोबोट को नियमों का एक मानक सेट देने जैसा है ताकि उसे हर खेल के लिए नई भाषा न सीखनी पड़े।
2. द ग्रुप हडल (GRPO)
इसके बाद, उन्होंने रोबोट के सीखने के तरीके को बदला। आमतौर पर, सीखने के लिए, एक रोबोट को एक अलग "कोच" (वैल्यू मॉडल) की आवश्यकता हो सकती है जो उसे बताए कि एक चाल कितनी अच्छी थी। लेकिन वह कोच अतिरिक्त मेमोरी लेता है। इसके बजाय, यह प्रणाली ग्रुप-रिलेटिव पॉलिसी ऑप्टिमाइजेशन (GRPO) नामक विधि का उपयोग करती है।
कल्पना कीजिए कि रोबोट एक ही गेम को 10 बार लगातार खेलता है, लेकिन हर बार थोड़े अलग विकल्पों के साथ। एक कोच से पूछने के बजाय, रोबोट अपने ही 10 संस्करणों को देखता है। वह कहता है, "हे, संस्करण 3 ने संस्करण 1 की तुलना में बेहतर स्कोर किया, इसलिए मैं संस्करण 3 की चालों की नकल करूँगा।" वह यह समझने के लिए कि क्या काम किया, अपने ही समूह के साथ अपनी तुलना करता है। यह एक स्टडी ग्रुप की तरह है जहाँ छात्र अपने उत्तरों की तुलना करते हैं ताकि देख सकें कि किसने सही किया, बिना किसी शिक्षक द्वारा हर एक पेपर को ग्रेड किए। यह बहुत सारी मेमोरी बचाता है क्योंकि उन्हें एक अलग कोच को प्रशिक्षित करने की आवश्यकता नहीं होती है।
3. द मैजिक स्पंज (सिंक-अवेयर फ्लेक्स-अटेंशन)
यह सबसे रचनात्मक हिस्सा है। रोबोट का "अटेंशन" (ध्यान) यह तय करता है कि बातचीत के कौन से शब्द महत्वपूर्ण हैं। एक लंबी बातचीत में, रोबोट आमतौर पर हर एक शब्द को देखने की कोशिश करता है, जो धीमा और मेमोरी-भारी होता है।
शोधकर्ताओं ने महसूस किया कि लंबी बातचीत में, चैट की शुरुआत एक "सिंक" (sink) के रूप में कार्य करती है—एक ऐसी जगह जहाँ रोबोट का ध्यान स्थिर रहने के लिए स्वाभाविक रूप से जमा होता है। उन्होंने एक विशेष गणितीय ट्रिक बनाई (जिसे FlexAttention कहा जाता है) जो रोबोट को इन "सिंक" शब्दों के साथ अलग तरह से व्यवहार करने देती है।
इसे ऐसे समझें: यदि आप 100 पन्नों की किताब पढ़ रहे हैं, तो आपको एक बार में पूरी किताब अपने हाथों में रखने की आवश्यकता नहीं है। आप पहला पन्ना (सिंक) और वर्तमान पन्ना जिसे आप पढ़ रहे हैं, उसे पकड़ सकते हैं, और बीच के पन्नों को तब तक धुंधला होने दे सकते हैं जब तक कि आपको उनकी आवश्यकता न हो। "सिंक" एक बुकमार्क की तरह है जो कहानी के संदर्भ को जीवित रखता है बिना पूरी किताब को ढोने के। सिस्टम एक "जीरो-वैल्यू सिंक" का उपयोग करता है, जो एक गणितीय तरीका है यह कहने का कि, "हमें पुराने शब्दों के वास्तविक डेटा को स्टोर करने की आवश्यकता नहीं है, हमें बस यह जानने की आवश्यकता है कि वे हमारे संतुलन को बनाए रखने के लिए वहां थे।" यह रोबोट को लंबी बातचीत (8,192 टोकन तक) संभालने की अनुमति देता है बिना मेमोरी खत्म हुए।
परिणाम: क्या यह काम करता है?
टीम ने एक सिम्युलेटेड रिटेल स्टोर वातावरण में इस नए सिस्टम का परीक्षण किया। उन्होंने एक अवधि के दौरान रोबोट को सीखते हुए देखा।
सीखने की प्रगति: प्रशिक्षण की शुरुआत में, ग्राहकों की मदद करने के लिए रोबोट का स्कोर 0.25 था। देखे गए प्रशिक्षण विंडो के अंत तक, स्कोर बढ़कर 0.44 हो गया। टीम ने यह भी देखा कि "ट्रेनिंग स्कोर" और "ट्रैजेक्टरी रिवॉर्ड" (जो आंतरिक चेकमार्क की तरह हैं कि रोबोट कितना अच्छा कर रहा है) क्रमशः 0.18 से 0.40 और 0.39 तक बढ़ गए। इससे पता चलता है कि रोबोट वास्तव में सीख रहा है और बेहतर हो रहा है, हालांकि लेखक सावधानी बरतते हुए कहते हैं कि यह केवल एक प्रारंभिक दृष्टिकोण है और यह अंतिम प्रमाण नहीं है कि यह तरीका पूर्ण है।
मेमोरी बचत: सबसे रोमांचक परिणाम मेमोरी के बारे में था। उन्होंने अलग-अलग बातचीत की लंबाई के साथ सिस्टम का परीक्षण किया:
- 4,096 टोकन पर, पुराने तरीके को 28.06 GB मेमोरी की आवश्यकता थी। नए SINKFLEX-RL सिस्टम को केवल 22.52 GB की आवश्यकता थी। यह 5.54 GB की बचत है, यानी 19.7%।
- 8,192 टोकन पर, पुराना तरीका पूरी तरह से क्रैश हो गया (मेमोरी खत्म हो गई, या "OOM")। हालाँकि, नया सिस्टम चलता रहा और इसने केवल 25.53 GB मेमोरी का उपयोग किया।
इसका क्या अर्थ है (और क्या नहीं है)
यह शोध पत्र दिखाता है कि एक मानक गेम इंटरफेस, एक स्मार्ट ग्रुप-लर्निंग मेथड और एक मेमोरी-बचाने वाली अटेंशन ट्रिक को जोड़कर, बिना सुपरकंप्यूटर की आवश्यकता के रोबोट को बहुत लंबे, जटिल कार्यों के लिए प्रशिक्षित करना संभव है। "सिंक" ट्रिक एक स्पंज की तरह काम करती है, जो मेमोरी के दबाव को सोख लेती है ताकि रोबोट आगे बढ़ सके।
हालाँकि, लेखक इस बात को लेकर बहुत ईमानदार हैं कि उन्होंने अभी तक क्या सिद्ध नहीं किया है। उन्होंने यह परीक्षण नहीं किया कि क्या यह सीखने का सबसे अच्छा तरीका है, या क्या यह हर एक प्रकार के रोबोट के लिए काम करता है। उन्होंने यह भी नहीं मापा कि रोबोट कितनी तेज़ी से सीखता है, केवल यह कि यह बिना क्रैश हुए सीख सकता है। उन्होंने यह भी नोट किया कि यह एक "प्रूफ ऑफ कॉन्सेप्ट" है—एक सफल परीक्षण जो दिखाता है कि विचार काम करता है, लेकिन यह एक तैयार उत्पाद नहीं है।
संक्षेप में, SINKFLEX-RL एक आशाजनक नया उपकरण है जो AI एजेंटों को बिना उनके दिमाग को फटने दिए लंबी बातचीत को याद रखने में मदद करता है। यह सुझाव देता है कि सही ट्रिक्स के साथ, हम रोबानों को जटिल, कई दिनों के कार्यों को संभालने के लिए स्मार्ट बना सकते हैं, जब तक कि हम उन्हें अपनी मेमोरी प्रबंधित करने का एक तरीका दे सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।