← नवीनतम पेपर
🤖 machine learning

SEAR: Sample Efficient Action Chunking Reinforcement Learning

यह शोध पत्र SEAR को प्रस्तुत करता है, जो एक सैंपल-एफिशिएंट ऑफ-पॉलिसी रिइन्फोर्समेंट लर्निंग एल्गोरिदम है जो चुनौतीपूर्ण मैनिपुलेशन कार्यों पर अत्याधुनिक तरीकों से बेहतर प्रदर्शन करने के लिए मल्टी-होराइजन टारगेट्स और एक रिसीडिंग होराइजन रिप्लानिंग रणनीति के साथ एक कॉज़ल ट्रांसफॉर्मर क्रिटिक का लाभ उठाता है ताकि एक्शन चंक्स के साथ प्रभावी ऑनलाइन लर्निंग को सक्षम बनाया जा सके।

मूल लेखक: C. F. Maximilian Nagy, Onur Celik, Emiliyan Gospodinov, Florian Seligmann, Weiran Liao, Aryan Kaushik, Gerhard Neumann

प्रकाशित 2026-08-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: C. F. Maximilian Nagy, Onur Celik, Emiliyan Gospodinov, Florian Seligmann, Weiran Liao, Aryan Kaushik, Gerhard Neumann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल वीडियो गेम खेलना सिखा रहे हैं, जैसे कि एक भूलभुलैया जहाँ उसे चाबियाँ उठानी हैं, दरवाजे खोलने हैं और पहेलियाँ सुलझानी हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कहा जाता है। यह एक कुत्ते को प्रशिक्षित करने जैसा है: जब वह कुछ सही करता है तो आप उसे एक इनाम (पुरस्कार) देते हैं और वह उस व्यवहार को दोहराना सीख जाता है। लेकिन यहाँ पेचीदा बात यह है कि यदि खेल बहुत लंबा है, तो कुत्ता यह भूल सकता है कि अंत में मिला इनाम उसके सबसे पहले किए गए काम के कारण था। उसे शुरुआत और अंत के बीच के संबंध को जोड़ना होगा।

रोबोट को तेज़ी से सीखने में मदद करने के लिए, वैज्ञानिक एक्शन चंकिंग (Action Chunking) नामक एक तरकीकी उपाय का उपयोग करते हैं। रोबोट को एक-एक छोटा कदम बताने के बजाय, जैसे कि "अपना हाथ बाईं ओर ले जाओ," फिर "अपना हाथ ऊपर ले जाओ," फिर "कप पकड़ो," वे कहते हैं: "यहाँ एक पूरा क्रम है: बाईं ओर जाओ, ऊपर जाओ और पकड़ो।" यह एक पियानो वादक को एक बार में एक नोट के बजाय संगीत के एक पूरे हिस्से (मेज़र) को सिखाने जैसा है। इससे रोबोट को बड़ी तस्वीर देखने और बेहतर योजना बनाने में मदद मिलती है। हालाँकि, इसमें एक पेंच है। यदि आप रोबोट को संगीत बजाते समय सुनने की अनुमति दिए बिना पूरा संगीत का हिस्सा बजाने के लिए कहते हैं, तो वह गलत नोट बजने पर भटक सकता है। उसे लगातार रुकने, सुनने और अपनी योजना को समायोजित करने में सक्षम होना चाहिए। यह शोध पत्र इस समस्या पर काम करता है कि कैसे रोबोट को इन बड़े "चंक्स" (टुकड़ों) के माध्यम से सिखाया जाए बिना उसे धीमा या अनाड़ी बनाए, ताकि वह चीजें गलत होने पर प्रतिक्रिया दे सके।


मिलिए SEAR (सैंपल एफिशिएंट एक्शन चंकिंग रीइन्फोर्समेंट लर्निंग) से, जो एक नया तरीका है जिसे रोबोट को धैर्य न खोए बिना आगे की योजना बनाना सिखाने के लिए डिज़ाइन किया गया है। शोधकर्ताओं ने पाया कि जबकि रोबोट को एक साथ कई गतिविधियों का एक पूरा क्रम (एक "चंक") निष्पादित करने के लिए कहना सीखने के लिए बहुत अच्छा है, लेकिन पुराने तरीके से ऐसा करना अक्सर आपदा का कारण बनता है। यदि आप बस रोबलेट को 10 गतिविधियों की एक सूची थमा देते हैं और कहते हैं "जाओ," और वह तीसरी गतिविधि पर गलती कर देता है, तो वह सूची पूरी होने तक अंधाधुंध चलता रहता है। जब तक उसे एहसास होता है कि वह पटरी से उतर गया है, तब तक बहुत देर हो चुकी होती है।

लेखकों ने पाया कि पिछले तरीके मुख्य रूप से इसलिए विफल हुए क्योंकि उन्होंने रोबोट को योजना के छोटे हिस्सों पर पर्याप्त "अभ्यास" नहीं कराया। कल्पना कीजिए कि आप एक दिन में केवल एक बार पूरे 2 मिनट के गाने का अभ्यास करके नृत्य की दिनचर्या सीखना चाह रहे हैं। आप कभी भी व्यक्तिगत कदमों को सही नहीं कर पाएंगे। SEAR इसे एक विशेष प्रकार के शिक्षक का उपयोग करके ठीक करता है, जिसे कॉज़ल ट्रांसफार्मर क्रिटिक (Causal Transformer Critic) कहा जाता है। केवल पूरे नृत्य के अंतिम परिणाम के आधार पर ग्रेड देने के बजाय, यह शिक्षक हर एक कदम पर रोबोट को ग्रेड देता है। यह एक नृत्य प्रशिक्षक की तरह है जो हर चाल के बाद संगीत रोकता है और कहता है, "अच्छा फुटवर्क!" या "अपनी कोहनी पर ध्यान दें!" यह रोबोट को हर प्रयास से भारी मात्रा में फीडबैक देता है, जिससे वह बहुत तेज़ी से और कुशलता से सीखता है।

लेकिन बड़े चंक्स को सीखना तो केवल आधी लड़ाई है। रोबोट को तेज़ी से प्रतिक्रिया देने में भी सक्षम होना चाहिए। इसे हल करने के लिए, SEAR एक चतुर रणनीति का उपयोग करता है जिसे रैंडम रीप्लानिंग (Random Replanning) कहा जाता है। रोबोट को योजना की पूरी सूची निष्पादित करने के लिए मजबूर करने के बजाय, SEAR उसे सूची का केवल एक रैंडम हिस्सा निष्पादित करने के लिए कहता है—शायद केवल पहले तीन कदम—और फिर रुककर पूछता है, "ठीक है, अब क्या योजना है?" यह इस आधार पर तय होता है कि वह वास्तव में कहाँ है। यह एक ऐसे जीपीएस की तरह है जो आपको केवल पूरे सफर के लिए मार्ग नहीं देता और "ड्राइव करें" नहीं कहता, बल्कि ट्रैफिक जाम से बचने के लिए हर कुछ ब्लॉक के बाद आपके पथ की पुनर्गणना करता है। यह रोबोट के "स्टेट-एक्शन कवरेज" को उच्च रखता है, जिसका अर्थ है कि वह केवल उन स्थितियों को नहीं, बल्कि हर तरह की स्थितियों को संभालने के लिए सीखता है जो उसने योजना बनाई थी।

परिणाम प्रभावशाली हैं। जब मेटावर्ल्ड (Metaworld) बेंचमार्क पर परीक्षण किया गया, जो रोबोटिक हेरफेर के 20 बहुत कठिन कार्यों का एक संग्रह है (जैसे वस्तुओं को उठाना या बटन दबाना), तो SEAR ने 80% से अधिक की सफलता दर हासिल की। यह पिछले तरीकों की तुलना में एक बड़ी छलांग है, जो केवल 60% के आसपास ही पहुँच पाते थे। और भी दिलचस्प बात यह है कि शोधकर्ताओं ने पाया कि SEAR बड़े चंक्स का उपयोग करके प्रशिक्षण के दौरान सीख सकता है, लेकिन फिर वास्तविक परीक्षण के दौरान एकल-चरण (single-step) निर्णय लेने में स्विच कर सकता है, जिससे वह प्रभावी रूप से एक सुपर-फास्ट, सिंगल-स्टेप लर्नर बन जाता है जिसे बड़े चंक्स के बारे में सोचकर प्रशिक्षित किया गया था।

शोधकर्ताओं ने SEAR का परीक्षण "ऑफलाइन-टू-ऑनलाइन" सेटिंग में भी किया, जहाँ रोबोट पहले वीडियो के एक विशाल डेटासेट (ऑफलाइन) से सीखता है और फिर वास्तव में कार्य करके सुधार करने का प्रयास करता है (ऑनलाइन)। QC नामक मौजूदा विधि पर SEAR की तकनीकों को लागू करके, शोधकर्ताओं ने OGBench क्यूब-ट्रिपल कार्यों पर प्रदर्शन में महत्वपूर्ण वृद्धि देखी, जिससे यह सिद्ध हुआ कि ये विचार काम करते हैं भले ही रोबलेट को पिछले डेटा का शुरुआती लाभ प्राप्त हो।

हालाँकि, लेखक सावधानीपूर्वक नोट करते हैं कि यह हर रोबोट के लिए जादुई समाधान नहीं है। वे बताते हैं कि SEAR उन कार्यों के लिए सबसे अच्छा काम करता है जिनमें पूरा होने में समय लगता है और जिनमें पलक झपकते ही प्रतिक्रिया देने की आवश्यकता नहीं होती, जैसे फर्नीचर असेंबल करना या वस्तुओं को हिलाना। यह उन चीजों के लिए काम नहीं करेगा जिनमें तत्काल रिफ्लेक्स की आवश्यकता होती है, जैसे जंगल में दौड़ने वाला रोबोट कुत्ता, क्योंकि "चंकिंग" दृष्टिकोण से डेटा की गुणवत्ता गिर सकती है यदि रोबोट को बहुत तेज़ी से प्रतिक्रिया करने की आवश्यकता हो। लेकिन रोबोटिक मैनिपुलेशन के धीमे, विचारशील और जटिल कार्यों के लिए, SEAR मशीनों को आगे सोचने, तेज़ी से सीखने और सतर्क रहने का एक शक्तिशाली नया तरीका सुझाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →