← नवीनतम पेपर
💻 computer science

Calibrate Once, Fly Any Team: Residual-Grounded Low-Fidelity Training for Cooperative Drone Swarms

यह शोध पत्र सहकारी ड्रोन झुंडों (ड्रोन स्वार्म्स) के लिए एक गणनात्मक रूप से कुशल प्रशिक्षण ढांचे का प्रस्ताव करता है जो एक लो-फिडेलिटी सिम्युलेटर में एक साझा विकेंद्रीकृत नीति को अनुकूलित करता है और इसे अलग-थलग हाई-फिडेलिटी उड़ानों से कैलिब्रेट किए गए एक एकल ऑफलाइन रेसिडुअल एनसेम्बल के साथ सुधारता है, जिससे विभिन्न टीम आकारों में लगभग-इष्टतम प्रदर्शन प्राप्त होता है और प्रत्यक्ष हाई-फिडेलिटी प्रशिक्षण की उच्च क्रैश दरों और गणनात्मक लागतों से बचा जा सकता है।

मूल लेखक: Maxim Mednikov, Oren Gal

प्रकाशित 2026-09-16
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maxim Mednikov, Oren Gal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

ड्रोन स्वार्म्स (ड्रोन झुंडों) का सपना—जहाँ सैकड़ों छोटी मशीनें एक ही मस्तिष्क की तरह मिलकर संरचनाएं बनाने, आपूर्ति पहुंचाने या आपदा क्षेत्रों का मानचित्रण करने के लिए चलती हैं—लंबे समय से भौतिकी और समय की एक जिद्दी समस्या के कारण रुका हुआ है। एक एकल ड्रोन को उड़ना सिखाने के लिए, इंजीनियर अक्सर कंप्यूटर सिमुलेशन का उपयोग करते हैं जो वास्तविक दुनिया की नकल करते हैं। हालांकि, गति और सटीकता के बीच एक निरंतर समझौता बना रहता है। एक सरल, तेज़ सिमुलेशन ड्रोन को केवल वजन के एक बिंदु की तरह मानता है, यह नजरअंदाज करते हुए कि उसके रोटर कैसे घूमते हैं, उसका शरीर कैसे झुकता है, और हवा उस पर कैसे दबाव डालती है। यह गति शोधकर्ताओं को सेकंडों में हजारों अभ्यास उड़ानें चलाने की अनुमति देती है, लेकिन इससे सीखे गए सबक अक्सर वास्तविक मशीन पर लागू होने में विफल हो जाते हैं क्योंकि सरल मॉडल वास्तविक दुनिया की सूक्ष्म देरी और बलों को मिस कर देता है। इसके विपरीत, एक अत्यधिक सटीक सिमुलेशन जो हर भौतिक विवरण को ध्यान में रखता है, अविश्वसनीय रूप से धीमा होता है। जब शोधकर्ता एक पूरी टीम के ड्रोन को ऐसे सटीक वातावरण में सिखाने की कोशिश करते हैं, तो कंप्यूटर चोक हो जाता है। हर बार जब दो ड्रोन करीब आते हैं, तो सॉफ्टवेयर को उनके संभावित टकराव की जटिल भौतिकी की गणना करनी पड़ती है, जो अधिक ड्रोन जोड़े जाने पर तेजी से कठिन होती जाती है। इसका परिणाम अक्सर एक 'डिजिटल क्रैश' होता है, जिससे सीखने की प्रक्रिया को फिर से शुरू करने के लिए मजबूर होना पड़ता है, जिससे बड़े समूहों को कुशलतापूर्वक प्रशिक्षित करना लगभग असंभव हो जाता है।

हैइफा विश्वविद्यालय के शोधकर्ता मैक्स मेडनिकोव और ओरेन गाल ने इस बाधा को पूरी तरह से दूर करने का तरीका खोज लिया है। कंप्यूटर को एक धीमी, पूर्ण दुनिया में शून्य से सीखने के लिए मजबूर करने के बजाय, या एक तेज़ लेकिन त्रुटिपूर्ण दुनिया पर निर्भर रहने के बजाय, उन्होंने एक ऐसा तरीका बनाया है जो बिना किसी अतिरिक्त लागत के दोनों का सर्वश्रेष्ठ संयोजन करता है। उनका दृष्टिकोण, जिसे कंप्यूटर सिमुलेशन में परखा गया, एक टीम को ड्रोन को एक तेज़, सरल मॉडल का उपयोग करके जटिल सहकारी कार्यों को सीखने की अनुमति देता है, जबकि एक छोटा, पूर्व-निर्धारित सुधार यह सुनिश्चित करता है कि व्यवहार वास्तविक दुनिया के लिए पर्याप्त सटीक रहे। मुख्य अंतर्दृष्टि यह है कि सरल मॉडल और जटिल वास्तविकता के बीच के अंतर को केवल एक ड्रोन का उपयोग करके एक बार सीखा जा सकता है, और फिर इसे ड्रोनों की संख्या कितनी भी बड़ी क्यों न हो, उस पर लागू किया जा सकता है।

प्रक्रिया एक सरल, तेज़ सिमुलेशन के साथ शुरू होती है जहाँ ड्रोन को द्रव्यमान के एक बिंदु के रूप में माना जाता है। शोधकर्ता पहले एक बुनियादी कंट्रोलर को इस सरल ड्रोन को एक विशिष्ट पथ पर उड़ाने देते हैं। फिर वे उसी सटीक पथ को लेते हैं और उसे एक बहुत अधिक विस्तृत, उच्च-फिडेलिटी सिमुलेशन में उड़ाते हैं जिसमें हवा के प्रतिरोध और शरीर के घूर्णन जैसी सभी वास्तविक दुनिया की जटिल भौतिकी शामिल होती है। यह देखते हुए कि सरल मॉडल कैसे चला बनाम विस्तृत मॉडल वास्तव में कैसे चला, वे अंतर की गणना करते हैं। यह अंतर, या "रेसिड्यूअल" (residual), त्रुटियों का एक छोटा नक्शा है जो सिस्टम को बताता है कि सरल मॉडल को जटिल मॉडल के अनुरूप कैसे समायोजित किया जाए। महत्वपूर्ण बात यह है कि यह अंशांकन (calibration) केवल एक बार, ऑफलाइन, एक अलग एकल ड्रोन का उपयोग करके किया जाता है। शोधकर्ता इन अंतरों के लिए एक छोटा गणितीय मॉडल तैयार करते हैं और फिर इसे फ्रीज कर देते हैं, यानी सुधारों को लॉक कर देते हैं ताकि वे बदल न सकें।

एक बार जब यह सुधार मानचित्र तैयार हो जाता है, तो वास्तविक सीखना शुरू होता है। शोधकर्ता पूरे स्वार्म के लिए एक साझा पॉलिसी को तेज़, सरल सिम्युलेटर के भीतर प्रशिक्षित करते हैं, लेकिन एक ट्विस्ट के साथ: उड़ान के हर क्षण में, फ्रीज किया गया सुधार ड्रोन की गति पर लागू किया जाता है। इसका मतलब है कि ड्रोन ऐसे उड़ना सीखते हैं जैसे वे जटिल, वास्तविक दुनिया में हों, लेकिन कंप्यूटर वास्तव में तेज़, सरल भौतिकी चला रहा होता है। क्योंकि सुधार केवल एक व्यक्तिगत ड्रोन की स्थिति पर निर्भर करता है न कि उसके साथियों पर, शोधकर्ताओं को प्रशिक्षण चरण के दौरान दो ड्रोनों को एक साथ उड़ाने की आवश्यकता नहीं होती है। वे तीन ड्रोनों की टीम या अठारह ड्रोनों की टीम को उसी मात्रा में अंशांकन डेटा का उपयोग करके प्रशिक्षित कर सकते हैं, जो एकल-ड्रोन उड़ानों से एकत्र किया गया था। यह प्रशिक्षण के दौरान डिजिटल क्रैश के जोखिम को समाप्त करता है, जो पूर्णतः यथार्थवादी सिमुलेशन में टीम का आकार बढ़ने के साथ तेजी से बढ़ता है।

इस पद्धति के परिणामों को चार अलग-अलग सहकारी कार्यों में परखा गया, जिसमें फॉर्मेशन बनाए रखने से लेकर फिगर-एट पैटर्न में उड़ने तक के कार्य शामिल थे, और टीम का आकार तीन से अठारह ड्रोन तक भिन्न था। प्रत्येक परिदृश्य में, इस हाइब्रिड पद्धति से प्रशिक्षित टीम ने केवल सरल, बिना सुधारा गया मॉडल वाले मॉडल से बेहतर प्रदर्शन किया। इससे भी अधिक प्रभावशाली बात यह है कि इसने बाईस में से चौबीस परीक्षण मामलों में, धीमी, वास्तविक सिमुलेशन में शून्य से प्रशिक्षित टीमों को भी पीछे छोड़ दिया। हालांकि बहुत छोटे समूहों के लिए यह विधि वास्तविक सिमुलेशन में प्रशिक्षित टीमों की तुलना में थोड़ी कम प्रभावी थी, लेकिन टीम के बड़े होने के साथ यह अंतर तेजी से कम हो गया। अठारह ड्रोनों की सबसे बड़ी टीमों के लिए, हाइब्रिड पद्धति ने महंगी, वास्तविक प्रशिक्षण के लगभग समान प्रदर्शन हासिल किया, लेकिन इसने इसे बहुत कम समय में और बिना किसी प्रशिक्षण क्रैश के किया। वास्तविक प्रशिक्षण अक्सर बड़े समूहों के लिए साठ प्रतिशत से अधिक क्रैश दर का परिणाम देता था, जो प्रगति को रोक देता था, जबकि नया तरीका स्थिर और कुशल बना रहा।

शोधकर्ताओं ने यह भी पाया कि प्रारंभिक सुधार मानचित्र बनाने के लिए आवश्यक डेटा आश्चर्यजनक रूप से कम था। उन्होंने पाया कि केवल एक ड्रोन को कुछ मिनटों तक उड़ाकर लगभग बत्तीस लघु उड़ान पथों को एकत्र करना, किसी भी आकार की टीमों के लिए सिस्टम को कैलिब्रेट करने के लिए पर्याप्त था। यह डेटा आवश्यकता ड्रोनों की संख्या के साथ नहीं बढ़ी; अठारह ड्रोनों की टीम को तीन ड्रोनों की टीम के समान ही अंशांकन प्रयास की आवश्यकता थी। इसके अलावा, यह विधि ड्रोन के भौतिक गुणों में बदलाव, जैसे कि अतिरिक्त वजन या अतिरिक्त हवा के प्रतिरोध के खिलाफ भी मजबूत साबित हुई। नई स्थितियों के लिए एक संक्षिप्त, वार्म रीकैलिब्रेशन चलाकर, सिस्टम ने तेजी से अनुकूलन किया और बिना पूरे कार्य को फिर से सीखे, उच्च प्रदर्शन बनाए रखा।

यह कार्य प्रदर्शित करता है कि बड़े ड्रोन स्वार्म्स के लिए हाई-फिडेलिटी प्रशिक्षण के लिए वास्तविक समय में हर टकराव और संपर्क को सिम्युलेट करने की आवश्यकता नहीं है। एक एकल एजेंट से सीखे गए ऑफलाइन सुधार के साथ एक तेज़, सरल सिम्युलेटर को आधार बनाकर, शोधकर्ता जटिल, सहकारी व्यवहारों को प्रशिक्षित कर सकते हैं जो सटीक और कम्प्यूटेशनल रूप से व्यवहार्य दोनों हैं। हालांकि ये परिणाम वर्तमान में कंप्यूटर सिमुलेशन तक सीमित हैं, यह दृष्टिकोण वास्तविक दुनिया के अनुप्रयोगों के लिए एक स्केलेबल मार्ग प्रदान करता है, जो यह सुझाव देता है कि ड्रोन स्वार्म्स का भविष्य तेज़ कंप्यूटरों पर नहीं, बल्कि हमारे पास मौजूद कंप्यूटरों का स्मार्ट तरीके से उपयोग करने पर निर्भर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →