← नवीनतम पेपर
💻 computer science

Curriculum Reinforcement Learning for Quadrotor Racing with Random Obstacles

यह शोध पत्र एक नवीन विज़न-आधारित करिकुलम रिइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तावित करता है जो मल्टी-स्टेज करिकुलम लर्निंग, डोमेन रैंडमाइजेशन और मल्टी-सीन अपडेटिंग को संयोजित करता है ताकि अनदेखे यादृच्छिक बाधाओं के माध्यम से सुदृढ़, उच्च-गति वाले क्वाड्रोटर रेसिंग को सक्षम बनाया जा सके, जो सिमुलेशन और वास्तविक दुनिया के प्रयोगों दोनों में मौजूदा विधियों से बेहतर प्रदर्शन करता है।

मूल लेखक: Fangyu Sun, Fanxing Li, Yu Hu, Linzuo Zhang, Yueqian Liu, Wenxian Yu, Danping Zou

प्रकाशित 2026-03-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fangyu Sun, Fanxing Li, Yu Hu, Linzuo Zhang, Yueqian Liu, Wenxian Yu, Danping Zou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छोटे बच्चे को साइकिल चलाना सिखा रहे हैं।

यदि आप उन्हें तुरंत कारों, पैदल चलने वालों और गड्ढों वाले व्यस्त शहर में साइकिल पर बिठा देंगे, तो वे संभवतः गिर जाएंगे। लेकिन यदि आप उन्हें एक खाली पार्किंग स्थल में शुरू करते हैं, फिर एक शांत गली (cul-de-sac) में ले जाते हैं, और अंत में कुछ धीरे चलने वाले लोगों वाले पार्क में ले जाते हैं, तो वे अंततः सुरक्षित और तेज़ी से साइकिल चलाना सीख जाएंगे।

यह शोध पत्र एक नन्ही, उड़ने वाली रोबोट (क्वाडरोटर ड्रोन) को एक अराजक, बाधाओं से भरे कोर्स में उच्च गति से रेस करना सिखाने के बारे में है, जो इसी "चरण-दर-चरण" तर्क का उपयोग करता है।

यहाँ उनके समाधान का सरल विवरण दिया गया है:

1. समस्या: "दोधारी तलवार"

ड्रोन रेसिंग में, लक्ष्य हुप्स (gates) की एक श्रृंखला के माध्यम से जितना संभव हो सके उतनी तेज़ी से उड़ना है।

  • संघर्ष: तेज़ी से उड़ने के लिए, ड्रोन को सीधा और आक्रामक होना चाहिए। लेकिन यादृच्छिक बाधाओं (जैसे पेड़ या खंभे) से टकराने से बचने के लिए, इसे सतर्क रहना चाहिए और गति धीमी करनी चाहिए।
  • ट्विस्ट: हुप्स स्वयं ड्रोन के कैमरे के लिए बाधाओं की तरह दिखते हैं। यदि ड्रोन बाधाओं से बहुत डर जाता है, तो वह हुप्स के माध्यम से जाने के बजाय उनके चारों ओर उड़ने लगेगा। यदि वह बहुत आक्रामक है, तो वह दीवारों से टकरा जाएगा।
  • पुराना तरीका: पिछले AI तरीके उन छात्रों की तरह थे जिन्होंने एक विशिष्ट परीक्षा को रट लिया था। यदि परीक्षा थोड़ी भी बदल जाती (नई बाधाओं की स्थिति), तो वे विफल हो जाते थे। वे "वास्तविक दुनिया" को नहीं संभाल सकते थे।

2. समाधान: "करिकुलम लर्निंग" (स्कूल प्रणाली)

लेखकों ने ड्रोन को सीधे गहरे पानी में नहीं फेंका। उन्होंने तीन कठिनाई स्तरों वाला एक प्रशिक्षण स्कूल बनाया:

  • स्तर 1 (खेल का मैदान): ड्रोन खाली हुप्स के माध्यम से उड़ना सीखता है। कोई बाधा नहीं। यह गति और स्टीयरिंग की बुनियादी बातें सीखता है।
  • स्तर 2 (बाधा कोर्स): वे कुछ यादृच्छिक बाधाएं जोड़ते हैं, लेकिन ड्रोन धीरे उड़ता है। यह घबराए बिना चीजों से बचना सीखता है।
  • स्तर 3 (प्रो लीग): वे गति की सीमा हटा देते हैं और कोर्स को घनी, यादृच्छिक बाधाओं से भर देते हैं। अब ड्रोन को सब कुछ मिलाना होगा: तेज़ी से उड़ना, हुप्स से गुजरना और अराजकता से बचना।

इसे करिकुलम रीइन्फोर्समेंट लर्निंग कहा जाता है। जैसे एक मानव एथलीट मैराथन दौड़ने से पहले ट्रेडमिल पर प्रशिक्षण लेता है, वैसे ही ड्रोन कठिन कार्यों से निपटने से पहले आसान कार्यों पर प्रशिक्षण लेता है।

3. गुप्त नुस्खा: "मल्टी-सीन" प्रशिक्षण

कल्पना कीजिए कि एक शिक्षक 100 छात्रों को पढ़ाने की कोशिश कर रहा है।

  • पुराना तरीका: शिक्षक सभी 100 छात्रों को एक ही समय में एक ही गणित का सवाल दिखाता है। यदि छात्र उस एक सवाल को रट लेते हैं, तो वे फेल हो जाते हैं।
  • इस शोध पत्र का तरीका: शिक्षक अपने 100 छात्रों को समूहों में विभाजित करता है। समूह A को एक कठिन समस्या मिलती है, समूह B को मध्यम और समूह C को एक आसान समस्या मिलती है। वे सभी अलग-अलग चीजें सीखते हैं और जो वे सीखते हैं उसे साझा करते हैं।

शोधकर्ताओं ने एक "मल्टी-सीन अपडेटिंग" रणनीति का उपयोग किया। उन्होंने कई अलग-अलग ट्रैक लेआउट पर एक साथ AI को प्रशिक्षित किया। इसने ड्रोन को एक विशिष्ट ट्रैक को रटने के लिए "चीटिंग" करने से रोका। इसके बजाय, इसने रेसिंग की अवधारणा सीखी, जिससे यह किसी भी नए ट्रैक को देखने पर अनुकूल बन गया।

4. "रिवॉर्ड सिस्टम" (स्कोरबोर्ड)

AI प्रशिक्षण में, ड्रोन अच्छे व्यवहार के लिए "पॉइंट्स" (पुरस्कार) प्राप्त करता है और बुरे व्यवहार के लिए पॉइंट्स खो देता है। पेचीदा हिस्सा स्कोर को संतुलित करना था:

  • जाल: यदि आप केवल बाधाओं से बचने के लिए अंक देते हैं, तो ड्रोन बस एक सुरक्षित कोने में मंडराता रहेगा और कभी रेस नहीं करेगा। यदि आप केवल गति के लिए अंक देते हैं, तो यह टकरा जाएगा।
  • सुधार: लेखकों ने एक जटिल स्कोरबोर्ड डिजाइन किया।
    • अंक मिलते हैं: आगे बढ़ने, हुप्स के केंद्र से गुजरने और एक सुचारू उड़ान पथ बनाए रखने के लिए।
    • जुर्माना मिलता है: दीवार से टकराने, वर्तमान स्थिति के लिए बहुत तेज़ उड़ने, या झटकेदार गतिविधियों के लिए।
    • जादू: उन्होंने विशेष रूप से अंकों को इस तरह से ट्यून किया ताकि ड्रोन को समझ आए: "मैं तेज़ी से उड़ सकता हूँ, लेकिन मुझे उस खंभे से बचने के लिए थोड़ा मुड़ना होगा, फिर वापस हुप्स की ओर तेज़ी से जाना होगा।"

5. परिणाम: सिमुलेशन से वास्तविकता तक

उन्होंने पूरी तरह से कंप्यूटर सिमुलेशन (एक वीडियो गेम की दुनिया) में एक कैमरा का उपयोग करके ड्रोन को प्रशिक्षित किया जो गहराई देख सकता है (मानव आंखों की तरह)।

  • "जीरो-शॉट" ट्रांसफर: आमतौर पर, गेम में प्रशिक्षित AI वास्तविक दुनिया में आने पर टकरा जाता है क्योंकि भौतिकी (physics) अलग होती है। लेकिन क्योंकि उन्होंने "डोमेन रैंडमाइजेशन" (प्रशिक्षण के दौरान रोशनी, ड्रोन का वजन और बाधाओं की स्थिति को यादृच्छिक रूप से बदलना) का उपयोग किया, इसलिए ड्रोन मजबूत बनना सीख गया।
  • वास्तविक दुनिया का परीक्षण: उन्होंने एक असली ड्रोन से जुड़े एक छोटे कंप्यूटर (Raspberry Pi) पर AI को लगाया।
    • गति: यह 8 मीटर प्रति सेकंड (लग लगभग 18 मील प्रति घंटा) की गति से उड़ा।
    • सफलता दर: इसने बिना टकराए 100% रेस पूरी की, भले ही बाधाएं यादृच्छिक, अनदेखे स्थानों पर रखी गई थीं।
    • तुलना: यह पिछले तरीकों की तुलना में काफी तेज़ और अधिक विश्वसनीय था।

बड़ी तस्वीर

इस शोध पत्र को एक फॉर्मूला 1 ड्राइवर जो एक निंजा भी है, सिखाने के रूप में सोचें।

  • फॉर्मूला 1 वाला हिस्सा: इसे अविश्वसनीय रूप से तेज़ और सटीक होना चाहिए।
  • निंजा वाला हिस्सा: इसे बिना नक्शा देखे उड़ते हुए शूरिकेंस (बाधाओं) से बचना होगा।

चरण-दर-चरण प्रशिक्षण पाठ्यक्रम और एक स्मार्ट रिवॉर्ड सिस्टम का उपयोग करके, लेखकों ने ड्रोन को दोनों बनने के लिए प्रशिक्षित किया। यह उन ड्रोनों की दिशा में एक बड़ा कदम है जो बिना मानवीय सहायता के, अस्त-व्यस्त और अप्रत्याशित वातावरण में स्वायत्त रूप से रेस कर सकते हैं, पैकेज डिलीवर कर सकते हैं, या खोज और बचाव मिशन कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →