← नवीनतम पेपर
🤖 machine learning

Learning to Race in Minutes: Infoprop Dyna on the Mini Wheelbot

यह शोध पत्र प्रदर्शित करता है कि इन्फ्रोप्रॉप डायना (Infoprop Dyna) फ्रेमवर्क एक मिनी व्हीलबॉट रोबोट को वास्तविक दुनिया के ट्रैक पर केवल 11 मिनट के भीतर उच्च गति वाली रेसिंग सीखने में सक्षम बनाता है, जिससे सिम-टू-रियल ट्रांसफर के लिए आमतौर पर आवश्यक भौतिकी-आधारित सिमुलेटर और डोमेन रैंडमाइजेशन की आवश्यकता समाप्त हो जाती है।

मूल लेखक: Devdutt Subhasish, Henrik Hose, Sebastian Trimpe

प्रकाशित 2026-05-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Devdutt Subhasish, Henrik Hose, Sebastian Trimpe

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छोटे बच्चे को पतली रस्सी पर एक पहिये वाली साइकिल (unicycle) चलाना सिखाने की कोशिश कर रहे हैं। यदि आप उसे गिरने और फिर से उठने देकर सिखाने की कोशिश करेंगे, तो इसमें बहुत लंबा समय लगेगा और उसे चोट भी लग सकती है। आमतौर पर, इंजीनियर इस समस्या को हल करने के लिए एक आदर्श "आभासी दुनिया" (सिम्युलेटर) बनाने की कोशिश करते हैं जहाँ रोबोट बिना किसी खरोंच के लाखों बार गिरने का अभ्यास कर सके। फिर वे उम्मीद करते हैं कि वीडियो गेम में सीखी गई कुशलता वास्तविक जीवन में काम आएगी।

यह शोध पत्र कहता है: "वीडियो गेम का झंझट ही क्यों? चलिए रोबोट को वास्तविक दुनिया में ही सिखाते हैं, लेकिन इसे बहुत समझदारी से करते हैं।"

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं (analogies) का उपयोग करते हुए:

रोबोट: द "मिनी व्हीलबॉट" (Mini Wheelbot)

रोबोट को एक छोटे, एक पहिये वाले अनिसाइकिल के रूप में सोचें जो अविश्वसनीय रूप से डगमगाता रहता है। यह एक घूमते हुए लट्टू की तरह है जो दौड़ने की कोशिश कर रहा है। इसे नियंत्रित करना कठिन है क्योंकि:

  • यह अस्थिर (unstable) है: यदि आप इसे थोड़ा सा भी धकेलते हैं, तो यह पलट सकता है।
  • यह तेज़ है: यह पलक झपकते ही प्रतिक्रिया देता है।
  • यह फिसलन भरा (slippery) है: जब यह तेज़ चलता है, तो इसका पहिया ज़मीन पर इस तरह फिसलता है जिसे गणित के माध्यम से अनुमान लगाना बहुत कठिन होता है।

समस्या: "सिम्युलेटर ट्रैप" (The Simulator Trap)

अधिकांश रोबोट पहले कंप्यूटर सिमुलेशन में अभ्यास करके सीखते हैं। यह पायलटों के लिए फ्लाइट सिम्युलेटर की तरह है। लेकिन एक डगमगाते और फिसलते हुए अनिसाइकिल के लिए एक आदर्श सिम्युलेटर बनाना अविश्वसनीय रूप से कठिन है। यदि सिम्युलेटर सटीक नहीं है, तो रोबोट गलत तरीके सीख लेता है और वास्तविक ट्रैक पर पहुँचते ही विफल हो जाता है।

समाधान: "इन्फ्रोप्रॉप डायना" (Infoprop Dyna - द स्मार्ट ड्रीमर)

लेखकों ने Infoprop Dyna नामक एक नई विधि का उपयोग किया है। इसे ऐसे समझें जैसे रोबक एक बहुत कुशल सपने देखने वाला (efficient dreamer) है।

एक आदर्श वीडियो गेम की आवश्यकता के बजाय, रोबोट यह करता है:

  1. यह वास्तविक जीवन में कुछ प्रयास करता है (जैसे, बाएँ मुड़ना)।
  2. यह याद रखता है कि क्या हुआ (जैसे, "मैंने बाएँ मुड़ने की कोशिश की, लेकिन मैं थोड़ा फिसल गया")।
  3. यह अपने दिमाग में उस क्षण के हजारों बदलावों के बारे में "सपने" देखता है। यह कल्पना करता है, "क्या होगा अगर मैं थोड़ा और ज़ोर से मुड़ा होता? क्या होगा अगर ज़मीन थोड़ी और गीली होती?"
  4. यह सपनों से सीखता है। क्योंकि यह एक सेकंड के भीतर लाखों परिदृश्यों की कल्पना कर सकता है, इसलिए यह वास्तविक जीवन की दुर्घटनाओं का इंतज़ार करने की तुलना में बहुत तेज़ी से सीखता है।

इस विधि का "जादू" यह है कि यह जानता है कि इसके सपने पूरी तरह सटीक नहीं हैं। यह अपने सपनों की गलतियों (noise) को फ़िल्टर करने के लिए एक विशेष गणितीय तकनीक का उपयोग करता है ताकि यह अपने ही दिवास्वप्नों से भ्रमित न हो जाए।

दौड़: डगमगाते से प्रो बनने तक के 11 मिनट

टीम ने इस रोबोट को एक वास्तविक ट्रैक पर रखा और घड़ी चालू कर दी। यहाँ हुआ घटनाक्रम है:

  • मिनट 0–1: एक इंसान जॉयस्टिक से रोबोट को ट्रैक के चारों ओर चलाता है ताकि उसे "वॉर्म-अप" मिल सके और वह तुरंत क्रैश न हो जाए।
  • मिनट 1–5: रोबोट अपने आप सीखना शुरू करता है। यह अभी भी बहुत सतर्क है, जैसे कोई नया ड्राइवर टेस्ट ड्राइव ले रहा हो।
  • मिनट 6: पहली लैप! रोबोट सफलतापूर्वक ट्रैक के चारों ओर एक पूरा चक्कर पूरा करता है।
  • मिनट 7–8: यह अधिक सुचारू (smooth) हो जाता है, लेकिन तीखे मोड़ों पर अभी भी थोड़ा डगमगाता है।
  • मिनट 9–11: महारत (Mastery)। रोबोट एक गुप्त तकनीक खोज लेता है: नियंत्रित फिसलन (Controlled Slipping)।
    • उपमा: एक रेस कार ड्राइवर की कल्पना करें जो मोड़ पर जा रहा है। एक सामान्य ड्राइवर सावधानी से ब्रेक लगाता है और मुड़ता है। हालाँकि, यह रोबोट महसूस करता है कि उच्च गति पर, कोने को तेजी से काटने के लिए पिछले पहिये को थोड़ा फिसलने (ड्रिफ्ट करने) देना बेहतर है।
    • रोबोट ने यह "ड्रिफ्टिंग" रणनीति खुद खोजी, जो पूरी तरह से वास्तविक दुनिया के अनुभव से आई।

परिणाम

  • गति: रोबोट ने केवल 11 मिनट में अपनी औसत गति 0.15 m/s (धीमी चाल) से बढ़ाकर 0.5 m/s (तेज़ दौड़) कर ली।
  • दक्षता (Efficiency): इसने मानव-नियंत्रित रोबोट की तुलना में समान समय में तीन गुना से अधिक लैप पूरे किए।
  • कोई सिम्युलेटर नहीं: उन्होंने भौतिकी (physics) को सिम्युलेट करने के लिए एक भी लाइन का कोड इस्तेमाल नहीं किया। रोबोट ने पूरी तरह से वास्तविक फर्श और वास्तविक हवा के साथ बातचीत करके सीखा।

निचोड़ (The Bottom Line)

यह शोध पत्र दिखाता है कि रोबोट को दौड़ना सिखाने के लिए आपको एक आदर्श वीडियो गेम की आवश्यकता नहीं है। एक ऐसी विधि का उपयोग करके जो रोबोट को उसके अनुभवों के बारे में "सपने" देखने और अपनी गलतियों को फ़िल्टर करने की अनुमति देती है, एक डगमगाता हुआ, कठिन रोबोट कॉफी बनाने के समय में आक्रामक और सुरक्षित रूप से दौड़ना सीख सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →