Curriculum Reinforcement Learning for Quadrotor Racing with Random Obstacles
यह शोध पत्र एक नवीन विज़न-आधारित करिकुलम रिइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तावित करता है जो मल्टी-स्टेज करिकुलम लर्निंग, डोमेन रैंडमाइजेशन और मल्टी-सीन अपडेटिंग को संयोजित करता है ताकि अनदेखे यादृच्छिक बाधाओं के माध्यम से सुदृढ़, उच्च-गति वाले क्वाड्रोटर रेसिंग को सक्षम बनाया जा सके, जो सिमुलेशन और वास्तविक दुनिया के प्रयोगों दोनों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छोटे बच्चे को साइकिल चलाना सिखा रहे हैं।
यदि आप उन्हें तुरंत कारों, पैदल चलने वालों और गड्ढों वाले व्यस्त शहर में साइकिल पर बिठा देंगे, तो वे संभवतः गिर जाएंगे। लेकिन यदि आप उन्हें एक खाली पार्किंग स्थल में शुरू करते हैं, फिर एक शांत गली (cul-de-sac) में ले जाते हैं, और अंत में कुछ धीरे चलने वाले लोगों वाले पार्क में ले जाते हैं, तो वे अंततः सुरक्षित और तेज़ी से साइकिल चलाना सीख जाएंगे।
यह शोध पत्र एक नन्ही, उड़ने वाली रोबोट (क्वाडरोटर ड्रोन) को एक अराजक, बाधाओं से भरे कोर्स में उच्च गति से रेस करना सिखाने के बारे में है, जो इसी "चरण-दर-चरण" तर्क का उपयोग करता है।
यहाँ उनके समाधान का सरल विवरण दिया गया है:
1. समस्या: "दोधारी तलवार"
ड्रोन रेसिंग में, लक्ष्य हुप्स (gates) की एक श्रृंखला के माध्यम से जितना संभव हो सके उतनी तेज़ी से उड़ना है।
- संघर्ष: तेज़ी से उड़ने के लिए, ड्रोन को सीधा और आक्रामक होना चाहिए। लेकिन यादृच्छिक बाधाओं (जैसे पेड़ या खंभे) से टकराने से बचने के लिए, इसे सतर्क रहना चाहिए और गति धीमी करनी चाहिए।
- ट्विस्ट: हुप्स स्वयं ड्रोन के कैमरे के लिए बाधाओं की तरह दिखते हैं। यदि ड्रोन बाधाओं से बहुत डर जाता है, तो वह हुप्स के माध्यम से जाने के बजाय उनके चारों ओर उड़ने लगेगा। यदि वह बहुत आक्रामक है, तो वह दीवारों से टकरा जाएगा।
- पुराना तरीका: पिछले AI तरीके उन छात्रों की तरह थे जिन्होंने एक विशिष्ट परीक्षा को रट लिया था। यदि परीक्षा थोड़ी भी बदल जाती (नई बाधाओं की स्थिति), तो वे विफल हो जाते थे। वे "वास्तविक दुनिया" को नहीं संभाल सकते थे।
2. समाधान: "करिकुलम लर्निंग" (स्कूल प्रणाली)
लेखकों ने ड्रोन को सीधे गहरे पानी में नहीं फेंका। उन्होंने तीन कठिनाई स्तरों वाला एक प्रशिक्षण स्कूल बनाया:
- स्तर 1 (खेल का मैदान): ड्रोन खाली हुप्स के माध्यम से उड़ना सीखता है। कोई बाधा नहीं। यह गति और स्टीयरिंग की बुनियादी बातें सीखता है।
- स्तर 2 (बाधा कोर्स): वे कुछ यादृच्छिक बाधाएं जोड़ते हैं, लेकिन ड्रोन धीरे उड़ता है। यह घबराए बिना चीजों से बचना सीखता है।
- स्तर 3 (प्रो लीग): वे गति की सीमा हटा देते हैं और कोर्स को घनी, यादृच्छिक बाधाओं से भर देते हैं। अब ड्रोन को सब कुछ मिलाना होगा: तेज़ी से उड़ना, हुप्स से गुजरना और अराजकता से बचना।
इसे करिकुलम रीइन्फोर्समेंट लर्निंग कहा जाता है। जैसे एक मानव एथलीट मैराथन दौड़ने से पहले ट्रेडमिल पर प्रशिक्षण लेता है, वैसे ही ड्रोन कठिन कार्यों से निपटने से पहले आसान कार्यों पर प्रशिक्षण लेता है।
3. गुप्त नुस्खा: "मल्टी-सीन" प्रशिक्षण
कल्पना कीजिए कि एक शिक्षक 100 छात्रों को पढ़ाने की कोशिश कर रहा है।
- पुराना तरीका: शिक्षक सभी 100 छात्रों को एक ही समय में एक ही गणित का सवाल दिखाता है। यदि छात्र उस एक सवाल को रट लेते हैं, तो वे फेल हो जाते हैं।
- इस शोध पत्र का तरीका: शिक्षक अपने 100 छात्रों को समूहों में विभाजित करता है। समूह A को एक कठिन समस्या मिलती है, समूह B को मध्यम और समूह C को एक आसान समस्या मिलती है। वे सभी अलग-अलग चीजें सीखते हैं और जो वे सीखते हैं उसे साझा करते हैं।
शोधकर्ताओं ने एक "मल्टी-सीन अपडेटिंग" रणनीति का उपयोग किया। उन्होंने कई अलग-अलग ट्रैक लेआउट पर एक साथ AI को प्रशिक्षित किया। इसने ड्रोन को एक विशिष्ट ट्रैक को रटने के लिए "चीटिंग" करने से रोका। इसके बजाय, इसने रेसिंग की अवधारणा सीखी, जिससे यह किसी भी नए ट्रैक को देखने पर अनुकूल बन गया।
4. "रिवॉर्ड सिस्टम" (स्कोरबोर्ड)
AI प्रशिक्षण में, ड्रोन अच्छे व्यवहार के लिए "पॉइंट्स" (पुरस्कार) प्राप्त करता है और बुरे व्यवहार के लिए पॉइंट्स खो देता है। पेचीदा हिस्सा स्कोर को संतुलित करना था:
- जाल: यदि आप केवल बाधाओं से बचने के लिए अंक देते हैं, तो ड्रोन बस एक सुरक्षित कोने में मंडराता रहेगा और कभी रेस नहीं करेगा। यदि आप केवल गति के लिए अंक देते हैं, तो यह टकरा जाएगा।
- सुधार: लेखकों ने एक जटिल स्कोरबोर्ड डिजाइन किया।
- अंक मिलते हैं: आगे बढ़ने, हुप्स के केंद्र से गुजरने और एक सुचारू उड़ान पथ बनाए रखने के लिए।
- जुर्माना मिलता है: दीवार से टकराने, वर्तमान स्थिति के लिए बहुत तेज़ उड़ने, या झटकेदार गतिविधियों के लिए।
- जादू: उन्होंने विशेष रूप से अंकों को इस तरह से ट्यून किया ताकि ड्रोन को समझ आए: "मैं तेज़ी से उड़ सकता हूँ, लेकिन मुझे उस खंभे से बचने के लिए थोड़ा मुड़ना होगा, फिर वापस हुप्स की ओर तेज़ी से जाना होगा।"
5. परिणाम: सिमुलेशन से वास्तविकता तक
उन्होंने पूरी तरह से कंप्यूटर सिमुलेशन (एक वीडियो गेम की दुनिया) में एक कैमरा का उपयोग करके ड्रोन को प्रशिक्षित किया जो गहराई देख सकता है (मानव आंखों की तरह)।
- "जीरो-शॉट" ट्रांसफर: आमतौर पर, गेम में प्रशिक्षित AI वास्तविक दुनिया में आने पर टकरा जाता है क्योंकि भौतिकी (physics) अलग होती है। लेकिन क्योंकि उन्होंने "डोमेन रैंडमाइजेशन" (प्रशिक्षण के दौरान रोशनी, ड्रोन का वजन और बाधाओं की स्थिति को यादृच्छिक रूप से बदलना) का उपयोग किया, इसलिए ड्रोन मजबूत बनना सीख गया।
- वास्तविक दुनिया का परीक्षण: उन्होंने एक असली ड्रोन से जुड़े एक छोटे कंप्यूटर (Raspberry Pi) पर AI को लगाया।
- गति: यह 8 मीटर प्रति सेकंड (लग लगभग 18 मील प्रति घंटा) की गति से उड़ा।
- सफलता दर: इसने बिना टकराए 100% रेस पूरी की, भले ही बाधाएं यादृच्छिक, अनदेखे स्थानों पर रखी गई थीं।
- तुलना: यह पिछले तरीकों की तुलना में काफी तेज़ और अधिक विश्वसनीय था।
बड़ी तस्वीर
इस शोध पत्र को एक फॉर्मूला 1 ड्राइवर जो एक निंजा भी है, सिखाने के रूप में सोचें।
- फॉर्मूला 1 वाला हिस्सा: इसे अविश्वसनीय रूप से तेज़ और सटीक होना चाहिए।
- निंजा वाला हिस्सा: इसे बिना नक्शा देखे उड़ते हुए शूरिकेंस (बाधाओं) से बचना होगा।
चरण-दर-चरण प्रशिक्षण पाठ्यक्रम और एक स्मार्ट रिवॉर्ड सिस्टम का उपयोग करके, लेखकों ने ड्रोन को दोनों बनने के लिए प्रशिक्षित किया। यह उन ड्रोनों की दिशा में एक बड़ा कदम है जो बिना मानवीय सहायता के, अस्त-व्यस्त और अप्रत्याशित वातावरण में स्वायत्त रूप से रेस कर सकते हैं, पैकेज डिलीवर कर सकते हैं, या खोज और बचाव मिशन कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।