← नवीनतम पेपर
💻 computer science

Learning Sidewalk Autopilot from Multi-Scale Imitation with Corrective Behavior Expansion

यह शोध पत्र एक सुदृढ़ फुटपाथ माइक्रोमोबिलिटी नियंत्रण ढांचे का प्रस्ताव करता है जो सुधार संबंधी व्यवहारों के साथ टेलीऑपरेशन डेटासेट को संवर्धित करके और जटिल शहरी वातावरण में त्रुटियों से उबरने तथा सामान्यीकरण करने के लिए एक बहु-स्तरीय आर्किटेक्चर का उपयोग करके इमिटेशन लर्निंग (अनुकरण शिक्षण) को उन्नत करता है।

मूल लेखक: Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बिल्कुल नए रोबोट को शहर के व्यस्त फुटपाथ पर खाना पहुँचाना सिखा रहे हैं। फुटपाथ एक अराजक जगह है: लोग बातें कर रहे हैं, कुत्ते दौड़ रहे हैं, स्ट्रीट वेंडर्स अपनी दुकानें लगा रहे हैं, और रास्ता घुमावदार है।

यदि आप केवल रोबोट को फुटपाथ पर चलते हुए एक इंसान का वीडियो दिखाएंगे, तो रोबोट उस सटीक चाल की नकल करना सीख जाएगा। लेकिन जैसे ही रोबोट थोड़ा लड़खड़ाता है, या कोई अजनबी उसके रास्ते में आता है, रोबोट घबरा जाता है। क्यों? क्योंकि उसने केवल तभी चलना सीखा जब सब कुछ एकदम सही था। उसने कभी यह नहीं सीखा कि सुधार कैसे किया जाए (recover) जब चीजें गलत हो जाएं।

यह पेपर एक नई प्रणाली पेश करता है जिसे MIMIC (मल्टी-स्केल इमिटेशन विद करेक्टिव एक्सपेंशन) कहा जाता है, जो रोबोट को न केवल सटीक रूप से चलना सिखाती है, बल्कि यह भी सिखाती है कि गलती होने पर गरिमा बनाए कैसे रखें

उन्होंने इसे कैसे किया, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "परफेक्ट स्टूडेंट" का जाल

अधिकांश AI रोबोट उन छात्रों की तरह प्रशिक्षित होते हैं जो केवल उस परीक्षा के उत्तर कुंजी का अध्ययन करते हैं जो वे पहले ही दे चुके हैं। वे "परफेक्ट" रास्ते को रट लेते हैं।

  • समस्या: वास्तविक दुनिया में, आप छोटी गलतियाँ करते हैं। यदि एक रोबोट एक छोटी सी गलती करता है और ट्रेनिंग डेटा उसे उस विशिष्ट गलती को ठीक करने का तरीका नहीं दिखाता है, तो रोबोट नियंत्रण से बाहर हो जाता है। यह उस ड्राइवर की तरह है जो खाली हाईवे पर गाड़ी चलाना जानता है लेकिन थोड़ा सा फिसलते ही दुर्घटनाग्रस्त हो जाता है क्योंकि उसने कभी फिसलन को सुधारने का अभ्यास नहीं किया था।

2. समाधान A: "क्या होगा अगर" सिम्युलेटर (करेक्टिव बिहेवियर एक्सपेंशन)

शोधकर्ताओं ने महसूस किया कि उन्हें रोबोट को अपनी गलतियों को सुधारना सिखाने की आवश्यकता है। लेकिन वे वास्तविक रोबोटों को हजारों बार क्रैश करके वह डेटा प्राप्त नहीं करना चाहते थे।

  • उपमा: कल्पना कीजिए कि आपके पास किसी के चलते हुए एक परफेक्ट वीडियो है। केवल उसे देखने के बजाय, आप एक जादुई एडिटिंग टूल का उपयोग करके एक गलती का नाटक (fake a mistake) करते हैं। आप डिजिटल रूप से उस व्यक्ति को रास्ते से थोड़ा धकेल देते हैं, जिससे वह घास पर कदम रखता है या किसी खंभे से टकरा जाता है। फिर, आप वीडियो को संपादित करते हैं ताकि उसे वापस कदम बढ़ाते हुए दिखाया जा सके और उसे वापस पटरी पर लाने के लिए सुधार किया जा सके।
  • परिणाम: रोबोट अब इन हजारों "नकली गलतियों" और "वास्तविक सुधारों" को देखता है। वह सीखता है: "ओह, अगर मैं बाईं ओर झुकता हूँ, तो मुझे वापस फुटपाथ पर आने के लिए दाईं ओर मुड़ना होगा।" यह रोबोट को बहुत अधिक मजबूत और अनुकूलन योग्य बनाता है।

3. समाधान B: "ज़ूम लेंस" रणनीति (मल्टी-स्केल इमिटेशन)

इंसान केवल अपने पैरों के ठीक सामने जमीन को नहीं देखते; हम यह देखने के लिए भी देखते हैं कि हम कहाँ जा रहे हैं।

  • समस्या: पुराने रोबोट दिमाग अक्सर या तो केवल अगले सेकंड पर ध्यान केंद्रित करते हैं (सामने खड़े व्यक्ति से बचने के लिए) या केवल मंजिल पर (सामने खड़े व्यक्ति को अनदेखा करते हुए)।
  • उपमा: रोबोट के दिमाग को एक ज़ूम लेंस वाले कैमरे के रूप में सोचें।
    • शॉर्ट ज़ूम (Short Zoom): यह तत्काल भविष्य (1-2 सेकंड आगे) को करीब से देखता है ताकि अचानक आने वाली बाधा से बचा जा सके।
    • वाइड ज़ूम (Wide Zoom): यह सड़क में काफी दूर (8+ सेकंड आगे) तक देखता है ताकि समग्र मार्ग की योजना बनाई जा सके।
  • नवाचार: MIMIC रोबोट को एक ही समय में दोनों को देखने के लिए मजबूर करता है। यह सीखता है कि वह रिएक्टिव (कुत्ते से बचना) होने के साथ-साथ दीर्घकालिक लक्ष्य (कॉफी शॉप तक पहुँचना) के प्रति सुसंगत रहे। यह रोबोट को "अल्पदृष्टि" वाले निर्णय लेने से रोकता है जो डेड एंड (बंद रास्ते) की ओर ले जाते हैं।

4. "लाइटिंग" ट्रिक (सेंसर ऑग्मेंटेशन)

वास्तविक दुनिया के वीडियो अक्सर उबाऊ होते हैं: धूप वाले दिन, साफ फुटपाथ। लेकिन रोबोट को रात में, बारिश में, या अजीब रोशनी में काम करने की आवश्यकता होती है।

  • उपमा: शोधकर्ताओं ने अपने धूप वाले फुटपाथ के वीडियो लिए और AI का उपयोग करके रोशनी को बदल दिया। उन्होंने इसे सूर्यास्त, बर्फीली रात, या धुंध भरी सुबह जैसा बना दिया, लेकिन उन्होंने वस्तुओं (लोग, पेड़, खंभे) को बिल्कुल वहीं रखा जहाँ वे थे।
  • परिणाम: रोबोट ने सीखा कि रोशनी बदलने पर भी "व्यक्ति" एक "व्यक्ति" ही रहता है। यह छाया या अंधेरे से भ्रमित होना बंद कर देता है।

बड़ी जीत

जब उन्होंने इस रोबोट का वास्तविक दुनिया में परीक्षण किया:

  • पुराने रोबots: फंस गए, लोगों से टकराए, या एक लंबी यात्रा के दौरान उन्हें 19 बार मानव नियंत्रण की आवश्यकता पड़ी।
  • MIMIC रोबोट: बिना किसी टक्कर के और केवल 4 बार मानव सहायता के साथ उसी यात्रा को सफलतापूर्वक पूरा किया। यह अपने लक्ष्य तक पहुँचने में बेहतर था और पैदल यात्रियों से बचने में भी बहुत बेहतर था।

संक्षेप में

यह पेपर रोबोट को लचीला (resilient) बनाना सिखाता है। केवल एक परफेक्ट डांस को रटने के बजाय, वे रोबोट को सिखाते हैं कि जब वह लड़खड़ाए तो कैसे सुधार करना है, कैसे अगले कदम और मंजिल दोनों को एक साथ देखना है, और कैसे विभिन्न मौसम की स्थितियों को संभालना है। यह एक ऐसे रोबोट और एक ऐसे रोबोट के बीच का अंतर है जो चीजें अस्त-व्यte होने पर टूट जाता है और एक ऐसा रोबोट जो डटा रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →