← नवीनतम पेपर
💻 computer science

Continual Domain Randomization

यह शोध पत्र कॉन्टिनुअल डोमेन रैंडमाइजेशन (CDR) का प्रस्ताव करता है, जो एक नवीन दृष्टिकोण है जो डोमेन रैंडमाइजेशन को कॉन्टिनुअल लर्निंग के साथ जोड़ता है ताकि सिमुलेशन मापदंडों के उपसमुच्चयों पर सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) नीतियों को क्रमिक रूप से प्रशिक्षित किया जा सके, जिससे एक साथ किए जाने वाले रैंडमाइजेशन की उप-इष्टतमता (सब-ऑप्टिमैलिटी) को दूर किया जा सके और रोबोटिक कार्यों में सुदृढ़ सिम-टू-रियल ट्रांसफर प्राप्त किया जा सके।

मूल लेखक: Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Josip Josifovski, Sayantan Auddy, Mohammadhossein Malmir, Justus Piater, Alois Knoll, Nicolás Navarro-Guerrero

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कप उठाना सिखाने की कोशिश कर रहे हैं। इसे करने का सबसे समझदारी भरा तरीका आमतौर पर यह होता है कि रोबोट को पहले कंप्यूटर सिमुलेशन में लाखों बार अभ्यास करने दिया जाए, ताकि वह असली रोबोट को तोड़ न दे या किसी को चोट न पहुँचा दे। लेकिन यहाँ एक समस्या है: एक कंप्यूटर सिमुलेशन कभी भी वास्तविक दुनिया की तरह पूरी तरह से सटीक नहीं होता। असली रोबोट थोड़ा भारी हो सकता है, उसके मोटर थोड़े धीमे हो सकते हैं, या उसके सेंसर थोड़े "शोर वाले" (noisy) हो सकते हैं। इस अंतर को "रियलिटी गैप" (reality gap) कहा जाता है। यदि आप एक रोबोट को एक आदर्श सिमुलेशन में प्रशिक्षित करते हैं, तो जब आप उसे वास्तविक दुनिया में रखते हैं, तो वह बुरी तरह विफल हो जाता है क्योंकि उसने सिमुलेशन की पूर्णता पर भरोसा करना सीख लिया था।

इसे ठीक करने के लिए, वैज्ञानिक एक तरकीब का उपयोग करते हैं जिसे डोमेन रैंडमाइजेशन (Domain Randomization) कहा जाता है। सिमुलेशन को परफेक्ट बनाने के बजाय, वे जानबूझकर उसमें गड़बड़ी पैदा करते हैं। वे एक रन में रोबोट को भारी बनाते हैं, अगले में हल्का, नकली सेंसर शोर जोड़ते हैं, या कंट्रोल्स में देरी करते हैं। विचार यह है कि यदि रोबोट इन सभी "बदली हुई" स्थितियों को संभालना सीख जाता है, तो वह वास्तविक दुनिया को संभालने के लिए पर्याप्त मजबूत होगा, जो कि खुद "अव्यवस्थित" होने का एक और रूप है।

पुराने तरीके के साथ समस्या
पारंपरिक तरीका ऐसा है जैसे आप अपने पहले ही दिन तेज़ लहरों, भारी तूफ़ान और ठंडे पानी वाले तूफ़ानी समुद्र में कूदकर तैरना सीखने की कोशिश कर रहे हों। यह बहुत कठिन है! रोबोट अभिभूत (overwhelmed) हो जाता है, भ्रमित हो जाता है, और एक गलत रणनीति सीख लेता है (या कुछ भी सीखने में विफल रहता है) क्योंकि कार्य बहुत कठिन है।

नया समाधान: कॉन्टिनुअल डोमेन रैंडमाइजेशन (CDR)
इस शोध के लेखकों ने एक स्मार्ट तरीका प्रस्तावित किया है, जिसे वे कॉन्टिनुअल डोमेन रैंडमाइजेशन (CDR) कहते हैं। इसे कार चलाना सीखने जैसा समझें:

  1. आसान शुरुआत करें: पहले, आप एक खाली, आदर्श पार्किंग लॉट में गाड़ी चलाना सीखते हैं जहाँ न हवा है, न अन्य कारें और टायर एकदम परफेक्ट हैं। आप बुनियादी बातें सीख लेते हैं।
  2. एक बार में एक चुनौती जोड़ें: एक बार जब आप इसमें कुशल हो जाते हैं, तो आप अचानक आपको तूफान में नहीं फेंक देते। इसके बजाय, आप केवल एक नई चुनौती जोड़ते हैं। शायद आप बारिश में गाड़ी चलाते हैं। एक बार जब आप बारिश में महारत हासिल कर लेते हैं, तो आप हवा जोड़ते हैं। एक बार जब आप हवा में महारत हासिल कर लेते हैं, तो आप भारी ट्रैफिक जोड़ते हैं।
  3. सब कुछ याद रखें: पेचीदा हिस्सा यह है कि जब आप बारिश में गाड़ी चलाना सीखते हैं, तो आपको सूखी सड़क पर गाड़ी चलाने का तरीका भूलना नहीं चाहिए। यहीं पर "कॉन्टिनुअल लर्निंग" वाला हिस्सा आता है। रोबोट एक विशेष मेमोरी तकनीक (जिसे इलास्टिक वेट कंसोलिडेशन कहा जाता है) का उपयोग करता है जो एक "सुरक्षा जाल" (safety net) की तरह काम करती है। यह रोबोट को नए कौशल (जैसे बारिश को संभालना) सीखने की अनुमति देता है बिना पुराने कौशल (जैसे सूखी सड़क पर गाड़ी चलाना) को "भूलना" के।

उन्होंने इसका परीक्षण कैसे किया
शोधकर्ताओं ने इस विचार का दो कार्यों पर परीक्षण किया:

  • रीचिंग (Reaching): एक रोबोटिक आर्म जो एक विशिष्ट स्थान को छूने की कोशिश कर रहा है।
  • ग्रास्पिंग (Grasping): एक अधिक जटिल कार्य जहाँ एक रोबोटिक आर्म को एक बॉक्स ढूँढना होता है, अपने ग्रिपर को पूरी तरह से संरेखित (align) करना होता है, और उसे उठाना होता है।

उन्होंने अपने "चरण-दर-चरण" तरीके (CDR) की तुलना दो अन्य दृष्टिकोणों से की:

  • "परफेक्ट" सिम्युलेटर: केवल एक साफ, आदर्श दुनिया में प्रशिक्षण (जो वास्तविकता में विफल हो जाता है)।
  • "केओस" (Chaos) सिम्युलेटर: रोबोट पर सभी समस्याएँ (बारिश, हवा, ट्रैफिक) एक साथ डाल देना।
  • "भुलक्कड़" तरीका: समस्याओं को एक-एक करके जोड़ना लेकिन "मेमोरी सेफ्टी नेट" का उपयोग नहीं करना (जिससे रोबोट पिछले चरणों को भूल जाता है)।

परिणाम
परिणाम प्रभावशाली थे:

  • CDR के साथ प्रशिक्षित रोबोट ने सिमुलेशन में प्रभावी ढंग से सीखा।
  • जब वे रोबोट को वास्तविक दुनिया में ले गए, तो इसने "केओस" मोड में प्रशिक्षित रोबोट की तुलना में बेहतर या समान प्रदर्शन किया।
  • महत्वपूर्ण रूप से, CDR अधिक स्थिर था। इससे कोई फर्क नहीं पड़ता था कि उन्होंने चुनौतियों को किस क्रम में जोड़ा (पहले बारिश या पहले हवा); रोबोट ने अच्छी तरह से सीखा। "भुलक्कड़" तरीका, यदि चुनौतियों का क्रम बदल जाता है, तो संघर्ष करता है।

संक्षेप में
यह शोध पत्र दिखाता है कि रोबोट को एक साथ सभी रैंडम वेरिएबल्स के समुद्र में डुबोने के बजाय, उसे चरण-दर-चरण सिखाना बेहतर है, एक समय में एक कठिनाई जोड़ना और यह सुनिश्चित करना कि वह पिछले कार्यों को संभालना भी याद रखे। यह एक ऐसा रोबोट बनाता है जो प्रशिक्षण के दौरान वास्तविक दुनिया में परीक्षण की आवश्यकता के बिना, वास्तविक और अप्रत्याशित दुनिया के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →