Scalable Maximum Entropy Reinforcement Learning for Diffusion Policies via Adjoint Matching
यह शोध पत्र एडजॉइंट मैचिंग (adjoint matching) का लाभ उठाकर डिफ्यूजन पॉलिसीज़ को ऑनलाइन सुदृढीकरण लर्निंग (reinforcement learning) में प्रशिक्षित करने के लिए एक कुशल, सिम्युलेशन-मुक्त एल्गोरिदम पेश करता है ताकि मानक स्कोर मैचिंग की सीमाओं को दूर किया जा सके और लागतपूर्ण लाइकलीहुड एस्टीमेशन (likelihood estimation) या डिफ्यूजन प्रक्रिया के माध्यम से बैकप्रोपैगेशन की आवश्यकता को समाप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को चलना, नाचना या वीडियो गेम खेलना सिखा रहे हैं। रोबोट को यह सीखने की आवश्यकता है कि सबसे अच्छा स्कोर (पुरस्कार/रिवॉर्ड्स) पाने के लिए कौन से कार्य करने चाहिए। अतीत में, रोबोट अक्सर सरल, "बेल-कर्व" (घंटी के आकार वाले) स्टाइल के कार्यों का अनुमान लगाकर सीखते थे (जैसे थोड़ा बाएं या थोड़ा दाएं हिलना)। लेकिन वास्तविक जीवन अव्यवस्थित है; कभी-कभी सबसे अच्छा कदम एक जटिल, बहु-चरणीय नृत्य होता है जो एक सरल वक्र (कर्व) में फिट नहीं बैठता।
डिफ्यूजन पॉलिसीज (Diffusion Policies) के बारे में सोचें। इन्हें ऐसे समझें जैसे एक रोबोट जो एक अराजक, शोर भरे ढेर (noisy mess) से शुरुआत करके और धीरे-धीरे उस शोर को हटाकर (denoising) एक आदर्श, जटिल चाल खोज लेता है। यह एक धुंधली फोटो को स्टेप-बाय-स्टेप साफ करने जैसा है जब तक कि तस्वीर स्पष्ट न हो जाए।
हालाँकि, इस रोबोट को वास्तविक समय में सिखाना (ऑनलाइन रिइन्फोर्समेंट लर्निंग) दो मुख्य कारणों से एक दुस्वप्न रहा है:
- मेमोरी की समस्या: सीखने के लिए, रोबोट को आमतौर पर अपनी हर गलती को सुधारने के लिए अपने दिमाग में अपनी पूरी "डिनोइजिंग" प्रक्रिया को बार-बार दोहराना पड़ता है। यह एक फिल्म के हर एक फ्रेम को याद रखने की कोशिश करने जैसा है ताकि केवल एक दृश्य को ठीक किया जा सके। यह इतनी मेमोरी लेता है कि रोबोट क्रैश हो जाता है या बहुत धीमी गति से सीखता है।
- "नो ग्राउंड ट्रुथ" (कोई ज्ञात उत्तर नहीं) की समस्या: एक क्लासरूम में, आपके पास एक उत्तर कुंजी (answer key) होती है। वास्तविक समय में सीखने में, रोबोट को पहले से नहीं पता होता कि "परफेक्ट" मूव क्या है; उसे केवल बाद में रिवॉर्ड के माध्यम से पता चलता है। मानक शिक्षण विधियाँ जो ज्ञात उत्तरों के साथ अनुमानों की तुलना करती हैं, यहाँ काम नहीं करतीं।
समाधान: AMDP (एडजॉइंट मैचिंग डिफ्यूजन पॉलिसी)
इस शोध के लेखकों ने एक नया तरीका पेश किया जिसे AMDP कहा जाता है। यहाँ उन्होंने कुछ चतुर युक्तियों का उपयोग करके इन समस्याओं को कैसे हल किया, इसका विवरण दिया गया है:
1. "रिवर्स मूवी" ट्रिक (सिमुलेशन-फ्री ट्रेनिंग)
कल्पना कीजिए कि आप केक बनाना सीख रहे हैं। आमतौर पर, आपको पूरा केक बनाना पड़ता है, उसे चखना पड़ता है, और फिर यह पता लगाने की कोशिश करनी पड़ती है कि आपने ठीक किस सेकंड में चीनी डाली थी ताकि इसे ठीक किया जा सके। यह कठिन है।
AMDP अलग है। पूरी बेकिंग प्रक्रिया को दोबारा चलाने के बजाय, यह एडजॉइंट मैचिंग (Adjoint Matching) नामक एक गणितीय शॉर्टकट का उपयोग करता है।
- उपमा: इसे तैयार केक को देखने जैसा समझें (अंतिम क्रिया) और तुरंत यह जानना कि, "यदि मैंने इस विशिष्ट क्षण पर चीनी डाली होती, तो केक एकदम सही होता।"
- परिणाम: रोबोट को सीखने के लिए पूरी शोर भरी प्रक्रिया को पीछे की ओर (backward) सिम्युलेट करने की आवश्यकता नहीं है। वह बस अंतिम चाल को देखता है, "स्कोर" (Q-स्कोर) की गणना करता है, और अपने मस्तिष्क को अपडेट करता है। इससे कंप्यूटर की बहुत सारी मेमोरी बचती है और प्रशिक्षण बहुत तेज़ हो जाता है।
2. "स्क्वैश" फंक्शन (कार्यों को सुरक्षित रखना)
रोबोट की अक्सर सीमाएं होती हैं। एक रोबोटिक हाथ अनंत ऋणात्मक (negative infinity) तक नहीं जा सकता; उसकी एक भौतिक सीमा होती है (जैसे, -1 और 1 के बीच)।
- समस्या: डिफ्यूजन के पीछे का गणित अक्सर ऐसी संख्याएँ उत्पन्न करता है जो बहुत बड़ी या बहुत छोटी होती हैं, जिससे रोबोट की सीमाएं टूट जाती हैं।
- समाधान: लेखकों ने एक विशेष गणितीय "स्क्वैश" फंक्शन (एरर फंक्शन या erf पर आधारित) का उपयोग किया। इसे एक स्प्रिंग की तरह समझें जो खींचने पर और अधिक सख्त होता जाता है, और अंततः एक कठोर दीवार पर रुक जाता है। यह सुनिश्चित करता है कि रोबोट की आंतरिक गणित कितनी भी अजीब क्यों न हो, अंतिम क्रिया हमेशा सुरक्षित और उसकी भौतिक सीमाओं के भीतर रहे। उन्होंने पाया कि यह विशिष्ट "स्क्वैश" पुराने तरीकों की तुलना में बहुत अधिक स्थिर है।
3. "ट्रस्ट रीजन" (अति-प्रतिक्रिया न दें)
सीखते समय, यदि रोबोट को बुरा स्कोर मिलता है, तो वह घबरा सकता है और रातों-रात अपना पूरा व्यक्तित्व बदल सकता है, जिससे वह वह सब कुछ भूल सकता है जो उसने पहले सीखा था।
- समाधान: लेखकों ने एक "ट्रस्ट रीजन" नियम जोड़ा। यह एक सुरक्षा पट्टे (safety leash) की तरह है। यह रोबोट को बताता है: "आप इस नए अनुभव से सीख सकते हैं, लेकिन अपने व्यवहार को बहुत अधिक नाटकीय रूप से न बदलें। जो आप पहले कर रहे थे उसके करीब रहें।" यह सीखने की प्रक्रिया को स्थिर रखता है और रोबोट को पागल होने से रोकता है।
उन्होंने क्या पाया?
टीम ने 63 विभिन्न वातावरणों में इस नई विधि का परीक्षण किया, जिसमें साधारण संतुलन कार्यों से लेकर जटिल ह्यूमनायड रोबोटों का चलना और वस्तुओं को संभालना शामिल था।
- गति: AMDP सबसे सरल, सबसे कुशल तरीकों (जैसे गॉसियन पॉलिसी) की तरह लगभग उतनी ही तेज़ी से प्रशिक्षित होता है, लेकिन यह बहुत अधिक जटिल गतिविधियों को भी संभाल सकता है।
- प्रदर्शन: इसने कई मौजूदा उन्नत तरीकों से बेहतर तरीके से चलना और वस्तुओं को संभालना सीखा। कुछ जटिल परीक्षणों में, यह स्पष्ट विजेता था।
- दक्षता: क्योंकि इसे रोबोट की विचार प्रक्रिया की पूरी "मूवी" को दोबारा चलाने की आवश्यकता नहीं है, इसलिए यह बहुत कम कंप्यूटर पावर का उपयोग करता है। उन्होंने दिखाया कि एक विशाल, जटिल रोबोट मॉडल के साथ भी, प्रशिक्षण का समय सरल तरीकों की तुलना में केवल लगभग 10% बढ़ा, जबकि पुराने जटिल तरीकों को 70 से 80 गुना अधिक समय लगता।
संक्षेप में
यह शोध पत्र एक तरीका प्रस्तुत करता है जिससे रोबोट को उनके कंप्यूटर क्रैश किए बिना जटिल, बहु-चरणीय गतिविधियाँ सिखाई जा सकें। उन्होंने यह एक गणितीय शॉर्टकट का आविष्कार करके किया जो रोबोट को पूरी हिस्ट्री को दोबारा चलाने के बिना अंतिम परिणाम से सीखने की अनुमति देता है, सीखने को स्थिर रखने के लिए एक "सुरक्षा पट्टा" जोड़ता है, और कार्यों को सुरक्षित सीमाओं के भीतर रखने के लिए एक विशेष "स्क्वैश" टूल का उपयोग करता है। परिणाम यह है कि एक रोबोट जटिल कौशल तेजी से, कुशलता से और बिना गणित में खोए सीखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।