← नवीनतम पेपर
💻 computer science

CycleRL: Sim-to-Real Deep Reinforcement Learning for Robust Autonomous Bicycle Control

यह शोध पत्र CycleRL प्रस्तुत करता है, जो एक सिम-टू-रियल डीप रिइन्फोर्समेंट लर्निंग फ्रेमवर्क है, जो NVIDIA Isaac Sim के भीतर प्रॉक्सिमल पॉलिसी ऑप्टिमाइज़ेशन और डोमेन रैंडमाइजेशन का उपयोग करता है ताकि एक मजबूत, उच्च-प्रदर्शन वाला स्वायत्त साइकिल नियंत्रण प्राप्त किया जा सके जो सिमुलेशन से वास्तविक दुनिया के हार्डवेयर में सफलतापूर्वक स्थानांतरित होता है।

मूल लेखक: Gelu Liu, Teng Wang, Zhijie Wu, Junliang Wu, Songyuan Li, Xiangwei Zhu

प्रकाशित 2026-06-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Gelu Liu, Teng Wang, Zhijie Wu, Junliang Wu, Songyuan Li, Xiangwei Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छोटे बच्चे को साइकिल चलाना सिखाने की कोशिश कर रहे हैं। यदि आप उसे संतुलन, घर्षण और संवेग (momentum) के जटिल भौतिक विज्ञान को समझाने के लिए एक पाठ्यपुस्तक का उपयोग करते हैं, तो बच्चा संभवतः भ्रमित हो जाएगा और गिर जाएगा। यही वह समस्या है जिसका सामना इंजीनियर पारंपरिक रोबोट साइकिलों के साथ करते हैं। वे यह लिखने की कोशिश करते हैं कि साइकिल को कैसे व्यवहार करना चाहिए इसके लिए सटीक गणितीय "पाठ्यपुस्तकें" (मॉडल), लेकिन वास्तविक दुनिया अव्यव्यस्त होती है, और वे पाठ्यपुस्तकें अक्सर तब विफल हो जाती हैं जब हवा चलती है या सड़क ऊबड़-खाबड़ हो जाती है।

यह शोध पत्र CycleRL पेश करता है, जो एक नया तरीका है जिससे एक रोबोट साइकिल को खुद चलाना सिखाया जाता है। इसे एक पाठ्यपुस्तक देने के बजाय, शोधकर्ताओं ने इसे परीक्षण और त्रुटि (trial and error) के माध्यम से सीखने दिया, ठीक एक मानव बच्चे की तरह, लेकिन सुपरह्यूमन गति से।

उन्होंने इसे कैसे किया, यहाँ सरल अवधारणाओं में दिया गया है:

1. "आभासी खेल का मैदान" (सिमुलेशन/Simulation)

आप एक रोबोट को एक मिलियन बार असली साइकिल गिराकर नहीं सिखा सकते; साइकिल टूट जाएगी और रोबोट सीखने में बहुत धीमा होगा।

  • उपमा: इसे एक वीडियो गेम की तरह समझें। शोधकर्ताओं ने एक अत्यंत यथार्थवादी आभासी दुनिया बनाई (NVIDIA Isaac Sim का उपयोग करके) जहाँ उन्होंने एक साइकिल का डिजिटल जुड़वां (digital twin) बनाया।
  • प्रक्रिया: इस वीडियो गेम में, AI "बच्चा" साइकिल चलाने की कोशिश करता है। हर बार जब वह गिरता है, तो उसे "गेम ओवर" मिलता है। हर बार जब वह सीधा रहता है और एक पथ का अनुसरण करता है, तो उसे अंक मिलते हैं।
  • सीखना: AI डीप रीइन्फोर्समेंट लर्निंग (Deep Reinforcement Learning) नामक विधि का उपयोग करता है। यह एक कुत्ते को करतब सिखाने जैसा है: यदि वह सही काम करता है (संतुलन बनाए रखता है), तो उसे इनाम (अंक) मिलता है। यदि वह गिर जाता है, तो उसे कोई इनाम नहीं मिलता। गेम में लाखों प्रयासों के माध्यम से, AI यह समझ जाता है कि सीधा रहने के लिए हैंडल को कैसे घुमाना है और अपना वजन कैसे बदलना है।

2. "प्रशिक्षण व्यवस्था" (डोमेन रैंडमाइजेशन/Domain Randomization)

वीडियो गेम के साथ एक बड़ी समस्या यह है कि जो आप गेम में सीखते हैं, वह हमेशा वास्तविक जीवन में काम नहीं आता है। हो सकता है कि आभासी घास बहुत फिसलन भरी हो, या आभासी हवा बहुत तेज हो।

  • उपमा: कल्पना कीजिए कि आप एक सॉकर खिलाड़ी को केवल एक पूरी तरह से समतल, सूखी ज़मीन पर प्रशिक्षित करते हैं। जब वे वास्तविक मैच में बारिश वाले, कीचड़ भरे मैदान पर जाते हैं, तो वे फिसल सकते हैं।
  • समाधान: इसे ठीक करने के लिए, शोधकर्ताओं ने डोमेन रैंडमाइजेशन (Domain Randomization) नामक तकनीक का उपयोग किया। उन्होंने केवल AI को एक आदर्श मैदान पर अभ्यास करने के लिए नहीं छोड़ा। उन्होंने आभासी दुनिया को अराजक और अप्रत्याशित बना दिया:
    • कभी-कभी साइकिल भारी थी; कभी-कभी हल्की थी।
    • कभी-कभी टायर चिपचिपे थे; कभी-कभी फिसलन भरे थे।
    • कभी-कभी हवा तेज़ चली; कभी-कभी सड़क ऊबड़-खाबड़ थी।
    • कभी-कभी साइकिल थोड़ी डगमगाते हुए शुरू हुई।
  • परिणाम: AI को हर संभव अजीब स्थिति में सीखने के लिए मजबूर करके, AI इतना मजबूत (robust) बन गया कि जब वह अंततः एक असली साइकिल पर चढ़ा, तो उसे अंतर की परवाह नहीं थी। उसने सिमुलेशन में पहले ही "सब कुछ देख लिया था"।

3. "स्कोरकार्ड" (रिवॉर्ड फंक्शन/Reward Function)

शोधकर्ताओं ने AI को यह कैसे बताया कि "अच्छा" चलाना कैसा दिखता है? उन्होंने पांच अलग-अलग नियमों के साथ एक जटिल स्कोरकार्ड बनाया:

  1. जीवित रहें: गिरें नहीं (सर्वाइवल रिवॉर्ड)।
  2. तेज़ चलें: जिस गति पर आपको कहा गया है, उसे बनाए रखें (वेलोसिटी रिवॉर्ड)।
  3. सीधे चलें: जिस दिशा में आपको कहा गया है, उसका पालन करें (हेडिंग रिवॉर्ड)।
  4. झटके न लें: हैंडल को सुचारू रूप से घुमाएं, हिंसक रूप से नहीं (एक्शन पेनल्टी)।
  5. कुशल बनें: बहुत अधिक ऊर्जा का उपयोग न करें (एक्शन मैग्नीट्यूड पेनल्टी)।

AI को एक साथ इन सभी नियमों को संतुलित करना था, यह सीखते हुए कि गिरना सबसे बुरा परिणाम है, लेकिन सुचारू रूप से चलाना अनियंत्रित होकर चलाने से बेहतर है।

4. वास्तविक दुनिया का परीक्षण (सिम-टू-रियल/Sim-to-Real)

जब AI ने आभासी दुनिया में महारत हासिल कर ली, तो उन्होंने इसे अपने लैब में बनी एक असली, भौतिक साइकिल पर लगाया।

  • हार्डवेयर: उन्होंने एक कस्टम बाइक बनाई जिसमें एक कंप्यूटर मस्तिष्क (NVIDIA Jetson), संतुलन महसूस करने के लिए सेंसर (IMU), और स्टीयरिंग और चलाने के लिए मोटर लगी थी।
  • परिणाम: AI, जिसने पहले कभी असली साइकिल को छुआ भी नहीं था, उस पर चढ़ा और चलाने लगा। उसने सफलतापूर्वक संतुलन बनाया, रास्तों का अनुसरण किया, और बजरी तथा रैंप जैसे विभिन्न इलाकों को संभाला।
  • आंकड़े: सिमुलेशन में, वह 99.9% समय सीधा रहा। असली साइकिल पर, वह 95% समय सीधा रहा। वह धक्का देने पर भी खुद को संभालने में सक्षम था, बिल्कुल एक कुशल मानव सवार की तरह।

यह क्यों महत्वपूर्ण है

पारंपरिक तरीके साइकिल की समस्या को कठोर गणितीय सूत्रों के साथ हल करने की कोशिश करते हैं। यदि गणित थोड़ा भी गलत है, तो साइकिल दुर्घटनाग्रस्त हो जाती है।
CycleRL अलग है। यह एक सवार को सिखाने जैसा है, जिसमें उन्हें एक अराजक, निरंतर बदलते बाधा दौड़ (obstacle course) में अभ्यास करने दिया जाता है जब तक कि वे विशेषज्ञ न बन जाएं। क्योंकि इसने कठोर नियमों के बजाय अनुभव के माध्यम से सीखा, इसलिए यह वास्तविक दुनिया की अप्रत्याशित प्रकृति को संभालने में बहुत बेहतर है।

संक्षेप में: शोधकर्ताओं ने एक रोबोट को साइकिल चलाना सिखाने के लिए उसे लाखों बार एक अराजक वीडियो गेम खेलने दिया, जिससे वह इतना सक्षम बन गया कि वह पहली बार में ही एक असली साइकिल को पूरी तरह से चला सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →