← नवीनतम पेपर
🤖 AI

What Matters for Simulation to Online Reinforcement Learning on Real Robots

तीन रोबोटिक प्लेटफॉर्म्स के माध्यम से 100 वास्तविक दुनिया के प्रशिक्षण दौरों वाले एक बड़े पैमाने के अनुभवजन्य अध्ययन के माध्यम से, यह शोध पत्र विशिष्ट, सुदृढ़ डिज़ाइन विकल्पों की पहचान करता है जो भौतिक रोबोटों पर स्थिर ऑनलाइन सुदृढीकरण लर्निंग (reinforcement learning) को सक्षम करते हैं और कुछ व्यापक रूप से उपयोग किए जाने वाले डिफ़ॉल्ट्स की प्रभावशीलता को खारिज करता है।

मूल लेखक: Yarden As, Dhruva Tirumala, René Zurbrügg, Chenhao Li, Stelian Coros, Andreas Krause, Markus Wulfmeier

प्रकाशित 2026-07-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yarden As, Dhruva Tirumala, René Zurbrügg, Chenhao Li, Stelian Coros, Andreas Krause, Markus Wulfmeier

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना, एक कप उठाना या कार चलाना सिखा रहे हैं। लंबे समय से, वैज्ञानिक इसे करने के लिए रोबोट को एक वीडियो गेम की दुनिया के भीतर लाखों बार अभ्यास करने देने की कोशिश कर रहे हैं—एक आदर्श, डिजिटल सिम्युलेटर। यह एक पायलट द्वारा फ्लाइट सिम्युलेटर में प्रशिक्षण लेने जैसा है: सुरक्षित, तेज़ और सस्ता। लेकिन इसमें एक पेंच है। वास्तविक दुनिया अव्यवस्थपूर्ण है। फर्श पूरी तरह से चिकना नहीं होता, टायर उन तरीकों से फिसलते हैं जिनकी कंप्यूटर ने भविष्यवाणी नहीं की थी, और कैमरे डिजिटल रेंडरर की तुलना में चीजों को अलग तरह से देखते हैं। जब आप एक "परफेक्ट" गेम में प्रशिक्षित रोबोट को वास्तविक फर्श पर ले जाते हैं, तो वह अक्सर लड़खड़ा जाता है, चीजें गिरा देता है या टकरा जाता है। "परफेक्ट" गेम और "अव्यवस्थित" वास्तविकता के बीच का यह अंतर रोबोटिक्स में सबसे बड़ी बाधा है।

इसे ठीक करने के लिए, शोधकर्ता 'रीइन्फोर्समेंट लर्निंग' (RL) नामक तकनीक का उपयोग करते हैं। RL को एक बहुत ही दृढ़ निश्चयी छात्र के रूप में सोचें जो परीक्षण और त्रुटि (trial and error) के माध्यम से सीखता है। रोबोट एक क्रिया करता है, उसे एक "पुरस्कार" (सफलता के लिए एक अंक जैसा) या एक "दंड" (एक दुर्घटना जैसा) मिलता है, और अगली बार बेहतर करने के लिए वह अपने मस्तिष्क को समायोजित करता है। बड़ा सवाल यह है: क्या हम इस रोबोट को वास्तव में वास्तविक फर्श पर चलते हुए सीखना दे सकते हैं, न कि केवल गेम के अंदर? इसे "ऑनलाइन लर्निंग" कहा जाता है। यह 'होली ग्रेल' (सर्वश्रेष्ठ लक्ष्य) है क्योंकि इसका मतलब है कि रोबोट नई स्थितियों में तुरंत ढल सकता है, जैसे कि एक इंसान एक ऊबड़-खाबड़ रास्ते पर साइकिल चलाने के बाद केवल एक चिकने रास्ते पर अभ्यास करने के बाद सीखता है। लेकिन अब तक, वास्तविक हार्डवेयर पर इस तरह से रोबोट को सिखाना जोखिम भरा, अस्थिर और अक्सर समय और पैसे की बर्बादी रहा है।

ETH ज्यूरिख और गूगल डीपमाइंड के शोधकर्ताओं द्वारा लिखा गया यह शोध पत्र एक बहुत ही व्यावहारिक प्रश्न पूछता है: "यदि हमारे पास पहले से ही एक रोबोट है जिसने सिम्युलेटर में सीखा है, तो हमें वास्तविक दुनिया में सुरक्षित और सफलतापूर्वक सीखने के लिए किन विशिष्ट सेटिंग्स को बदलने की आवश्यकता है?" उन्होंने कोई नया, जादुई एल्गोरिदम नहीं बनाया। इसके बजाय, उन्होंने मैकेनिक की तरह काम किया, मानक, उपलब्ध टूल्स (off-the-shelf learning tools) को लिया और तीन बहुत अलग रोबोटों पर 100 से अधिक विभिन्न प्रशिक्षण रन का परीक्षण किया: एक रोबोटिक आर्म (फ्रंका एमिका पांडा), एक चार पैरों वाला कुत्ता रोब रोबोट (यूनिट्री गो1), और एक रिमोट-कंट्रोल रेस कार।

उन्होंने पाया कि इन सीखने वाले रोबोटों के लिए सामान्य "डिफ़ॉल्ट" सेटिंग्स वास्तव में सिमुलेशन से वास्तविकता में जाने पर खतरनाक होती हैं। यदि आप बस एक सिम्युलेटर-प्रशिक्षित मस्तिष्क को वास्तविक रोबोट में प्लग करते हैं और तुरंत सीखना शुरू करते हैं, तो रोबोट अक्सर वह सब कुछ भूल जाता है जो वह जानता था और अराजकता में बदल जाता है। लेखकों ने पाया कि ऐसा इसलिए होता है क्योंकि रोबोट का "क्रिटिक" (वह हिस्सा जो निर्णय लेता है कि कोई क्रिया कितनी अच्छी है) भौतिकी में अचानक आए बदलाव से भ्रमित हो जाता है। इसे रोकने के लिए, उन्होंने एक सरल, विश्वसनीय नुस्खा विकसित किया।

पहला, उन्होंने पाया कि आपको नए वास्तविक दुनिया के डेटा के साथ पुराने सिम्युलेटर डेटा का "मेमोरी" (स्मृति) मिला कर रखना चाहिए। यह अपना होमवर्क करते समय अपनी पाठ्यपुस्तक खुली रखने जैसा है; यदि आप पाठ्यपुस्तक को फेंक देते हैं जैसे ही आप शुरू करते हैं, तो आप बुनियादी नियम भूल सकते हैं। दूसरा, उन्होंने पाया कि रोबोट को एक "वार्म-अप" अवधि की आवश्यकता होती है जहाँ उसे अपना मन बदलने की अनुमति मिलने से पहले अपने पुराने सिम्युलेटर मस्तिष्क के साथ कुछ बार अभ्यास करना पड़ता है। अंत में, और सबसे महत्वपूर्ण बात, उन्होंने पाया कि रोबोट का "मस्तिष्क" (वह हिस्सा जो निर्णय लेता है कि क्या करना है) उसके "निर्णय" (गलतियों से सीखने वाले हिस्से) की तुलना में बहुत धीरे अपडेट होना चाहिए। यदि मस्तिष्क बहुत तेज़ी से बदलता है, तो वह वास्तविक दुनिया की अव्यवस्था से भ्रमित हो जाता है। मस्तिष्क के अपडेट को धीमा करके और निर्णय को स्थिर रखकर, रोबोट केवल कुछ मिनटों के वास्तविक दुनिया के प्रशिक्षण में क्यूब्स को पकड़ना, बिना गिरे चलना और एक रेस कार को उच्च सटीकता के साथ पार्क करना सीख सकता है।

यह पेपर दिखाता है कि इन विशिष्ट, सावधानीपूर्वक समायोजनों के साथ, मानक सीखने के तरीके वास्तविक हार्डवेयर पर विश्वसनीय रूप से काम कर सकते हैं। उन्होंने केवल इसे सिम्युलेट नहीं किया; उन्होंने वास्तविक मशीनों पर इसे चलाया, यह साबित करते हुए कि रोबोट को वास्तविक दुनिया में सीखने के लिए आपको किसी नए सुपर-एल्गोरिदम की आवश्यकता नहीं है—आपको बस इस बारे में अधिक स्मार्ट होने की आवश्यकता है कि आप उन्हें डेटा कैसे खिलाते हैं और उन्हें कितनी तेज़ी से बदलने की अनुमति देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →