← नवीनतम पेपर
🤖 machine learning

Recursive Value Learning for Long-Horizon Offline Goal-Conditioned RL

यह शोध पत्र DCRL (डिवाइड-एंड-कन्कर आरएल) का प्रस्ताव करता है, जो एक पुनरावर्ती ऑफलाइन गोल-कंडीशन्ड रिइन्फोर्समेंट लर्निंग पद्धति है जो बूटस्ट्रैप डेप्थ और त्रुटि संचय को कम करने के लिए प्रक्षेप पथों (ट्रैजेक्टरीज) को संतुलित बाइनरी ट्री में विभाजित करती है, जिससे यह लंबी अवधि के कार्यों (लॉन्ग-होराइजन टास्क) पर मौजूदा फ्लैट और पदानुक्रमित बेसलाइनों की तुलना में काफी बेहतर प्रदर्शन करती है।

मूल लेखक: Hyeonseong Jeon, Youngwoon Lee

प्रकाशित 2026-09-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyeonseong Jeon, Youngwoon Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक विशिष्ट चुनौती है जिसे 'गोल-कंडीशन्ड लर्निंग' (लक्ष्य-आधारित शिक्षण) के रूप में जाना जाता है। कल्पना कीजिए कि आप एक रोबोट को केवल चलना नहीं सिखा रहे हैं, बल्कि उसे एक विशिष्ट कुर्सी, या एक विशिष्ट दरवाजे, या एक विशिष्ट लाइट स्विच तक चलना सिखा रहे हैं, और वह भी अन्य रोबोटों के घूमने-फिरने के पुराने वीडियो के पुस्तकालय का उपयोग करके। रोबोट को इन पुराने रिकॉर्डिंगों को देखना होगा, यह समझना होगा कि बिंदु A से बिंदु B तक कैसे पहुँचा जाए, और फिर उसे इसे स्वयं करने का प्रयास करना होगा। यह छोटी यात्राओं के लिए अच्छा काम करता है। यदि लक्ष्य कुछ ही कदमों की दूरी पर है, तो रोबोट आसानी से कड़ियों को जोड़ सकता है। लेकिन जब यात्रा लंबी हो—जिसमें दूर के गंतव्य तक पहुँचने के लिए सैकड़ों या हजारों कदमों की आवश्यकता हो—तो रोबोट अक्सर भटक जाता है। वह लक्ष्य तक पहुँचने के लिए योजना बनाने की कोशिश करते समय पथ की शुरुआत को याद रखने में संघर्ष करता है, और छोटे कदमों की उसकी स्मृति में होने वाली छोटी गलतियाँ लक्ष्य तक पहुँचते-पहुँचते विशाल त्रुटियों में बदल जाती हैं।

यह समस्या तब और कठिन हो जाती है जब रोबोट वास्तविक दुनिया में चीज़ों को आज़माकर नहीं सीख सकता। कई वास्तविक परिदृश्यों में, जैसे भारी मशीनरी चलाने या एक जटिल कारखाने में नेविगेट करने में, गलतियाँ करना बहुत खतरनाक या महंगा हो सकता है। रोबोट को पूरी तरह से पिछले अनुभवों के एक निश्चित डेटासेट से सीखना होगा, जिसे 'ऑफलाइन रिइन्फोर्समेंट लर्निंग' कहा जाता है। शोधकर्ता लंबे समय से जानते हैं कि एक लंबी यात्रा को हल करने के लिए, आपको उन छोटे खंडों को समझना होगा जिनसे मिलकर वह बनी है। हालाँकि, स्थिर डेटासेट से रोबोटों को सिखाने के विधियों के मानक तरीके अक्सर पूरी यात्रा को एक साथ सीखने की कोशिश करते हैं, या वे छोटे और लंबे खंडों के बीच रैंडम क्रम (scrambled order) में कूदते रहते हैं; यह दृष्टिकोण एक किताब को रैंडम पन्नों को पलटकर पढ़ने जैसा है; रोबोट एक ऐसे वाक्य के आधार पर एक लंबे अध्याय का अर्थ समझने की कोशिश करता है जिसे उसने अभी तक पूरी तरह से नहीं समझा है, जिससे भ्रम और विफलता होती है।

योनसेइ यूनिवर्सिटी और सियोल नेशनल यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इन रोबोटों को सिखाने का एक नया तरीका प्रस्तावित किया है, जिसे DCRL कहा जाता है। पूरे पथ का एक बार में अनुमान लगाने के बजाय, उनकी विधि हर लंबी यात्रा को एक संरचित, चरण-दर-चरण पदानुक्रम (hierarchy) में विभाजित करती है, ठीक वैसे ही जैसे एक बड़े कार्य को पहले सबसे छोटे टुकड़ों में महारत हासिल करके और फिर उन्हें संयोजित करके व्यवस्थित किया जाता है। शोधकर्ताओं ने डेटासेट से एक लंबा रास्ता लिया और उसे ठीक आधा कर दिया, फिर उन आधे हिस्सों को फिर से आधा किया, और इस प्रक्रिया को तब तक जारी रखा जब तक कि वे एकल चरणों तक नहीं पहुँच गए। फिर उन्होंने रोबोट को इन सूक्ष्म, एकल-चरण वाली गतिविधियों को समझने के लिए प्रशिक्षित किया। एक बार जब रोबोट इन छोटे कदमों के बारे में आश्वस्त हो गया, तो उसने उस ज्ञान का उपयोग थोड़े लंबे खंडों को समझने के लिए किया, और फिर लंबे खंडों के लिए, और इस प्रकार उसने ज़मीन से ऊपर की ओर अपने ज्ञान का निर्माण किया। यह "विभाजित करो और जीतो" (divide and conquer) की रणनीति सुनिश्चित करती है कि रोबोट कभी भी एक लंबा, जटिल मार्ग सीखने की कोशिश न करे जब तक कि उसने पहले से ही उन छोटे मार्गों में महारत हासिल न कर ली हो जिनसे वह बना है।

शोधकर्ताओं ने पाया कि इस संरचित दृष्टिकोण ने दो प्रमुख समस्याओं को हल किया जो पिछले तरीकों को परेशान करती थीं। पहला, इसने रोबोट को आशावादी अनुमान लगाने से रोका। पुराने तरीके अक्सर कई संभावित मध्यवर्ती बिंदुओं को देखते थे और उस एक को चुनते थे जो सबसे अच्छा दिखता था, इस उम्मीद में कि कोई शॉर्टकट मिल जाएगा। लेकिन क्योंकि डेटा सीमित था, रोबोट अक्सर एक ऐसे बिंदु को चुन लेता था जो अपनी स्मृति की गलती के कारण अच्छा दिखता था, और फिर वह अपनी इस त्रुटि पर अपना पूरा प्लान बना लेता था। नया तरीका बिना अनुमान लगाए, डेटा में दिखाए गए वास्तविक पथ का सख्ती से पालन करके और उसे ठीक बीच से विभाजित करके इस समस्या से बचता है। दूसरा, इस विधि ने त्रुटियों के प्रभाव को नियंत्रित करने में मदद की। पुराने तरीके में, एक एकल कदम की गलती सैकड़ों कदमों में फैल सकती थी, जिससे अंतिम योजना विकृत हो जाती थी। नए तरीके में, क्योंकि रोबोट एक संतुलित, पेड़ जैसी संरचना में सीखता है, किसी भी एकल गलती का प्रभाव सीमित रहता है।

विभिन्न कठिन कार्यों पर परीक्षण करने पर, जिसमें एक विशाल मानव रूपी (humanoid) रोबोट को भूलभुलैया के माध्यम से नेविगेट करना और जटिल पहेलियाँ सुलझाना शामिल था, इस नई विधि ने सभी पिछले दृष्टिकोणों को पछाड़ दिया। उनके बेंचमार्क में उपलब्ध पांच सबसे चुनौतीपूर्ण लंबी-अवधि वाले कार्यों पर, इस नई विधि ने औसत सफलता स्कोर को 55 से बढ़ाकर 64 कर दिया, जो उन जटिल पदानुक्रमित प्रणालियों से भी आगे निकल गया जिन्हें पहले अत्याधुनिक (state-of-the-art) माना जाता था। एक विशिष्ट परीक्षण में, जिसमें एक विशाल भूलभुलैया में एक ह्यूमनॉइड रोबोट शामिल था, इस नई विधि ने 93 प्रतिशत की सफलता दर हासिल की, जबकि अगली सर्वश्रेष्ठ विधि केवल 79 प्रतिशत तक ही पहुँच पाई। इसके अलावा, CALVIN बेंचमार्क पर भी इसने शानदार प्रदर्शन किया, जहाँ इसने लगातार चार उप-कार्यों (subtasks) को सफलतापूर्वक पूरा करने में सफलता प्राप्त की। शायद सबसे प्रभावशाली बात यह है कि एक क्यूब (घन) से जुड़े कार्य में, जिसके लिए आठ अलग-अलग चालों की आवश्यकता थी, यह नई विधि एकमात्र ऐसी थी जो कार्य को सफलतापूर्वक पूरा कर सकी, जिसने 5 प्रतिशत की सफलता दर हासिल की जबकि अन्य सभी विधियाँ पूरी तरह विफल रहीं।

शोधकर्ताओं ने यह भी पाया कि रोबोट किस क्रम में सीखता है, यह विधि के समान ही महत्वपूर्ण था। उन्होंने परीक्षण किया कि क्या होगा यदि रोबोट लंबे मार्गों को छोटे मार्गों से पहले सीखता है। हर उस मामले में जहाँ सीखने का क्रम उल्टा था, प्रदर्शन में भारी गिरावट आई, जिससे पुष्टि हुई कि "नीचे से ऊपर" (bottom-up) वाला दृष्टिकोण अनिवार्य है। यह अध्ययन सुझाव देता है कि लंबी यात्राओं की छोटी कदमों पर निर्भरता का सम्मान करके, और सीखने की प्रक्रिया को इस निर्भरता को प्रतिबिंबित करने के लिए व्यवस्थित करके, रोबोट पहले से कहीं अधिक लंबे और जटिल पथों को नेविगेट करना सीख सकते हैं। यह कार्य केवल एक एल्गोरिदम पेश नहीं करता है; यह यह भी स्पष्ट करता है कि कृत्रिम बुद्धिमत्ता को उन लंबी, जटिल कार्यों को संभालने के लिए कैसे स्केल किया जाए जो वास्तविक दुनिया को परिभाषित करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →