← नवीनतम पेपर
💻 computer science

CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking

CosFly-VLA एक स्थानिक रूप से जागरूक विजन-लैंग्वेज-एक्शन मॉडल है जो डेप्थ-अवेयर प्रीट्रेनिंग, करिकुलम-आधारित फाइन-ट्यूनिंग, चेन-ऑफ-थॉट रीजनिंग और क्लोज्ड-लूप रीइन्फोर्समेंट लर्निंग को एकीकृत करके जटिल, बाधित शहरी वातावरण में UAV लक्ष्य ट्रैकिंग को बढ़ाता है ताकि मौजूदा नीतियों की तुलना में विस्थापन त्रुटियों को काफी कम किया जा सके और सफलता दर में सुधार किया जा सके।

मूल लेखक: Ruilong Ren, Songsheng Cheng, Yunpeng Zhou, Hanxuan Chen, Xiangyue Wang, Tianle Zeng, Shuai Yuan, Binbo Li, Hanzhong Guo, Ji Pei, Da Zhang, Kangli Wang

प्रकाशित 2026-07-17
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ruilong Ren, Songsheng Cheng, Yunpeng Zhou, Hanxuan Chen, Xiangyue Wang, Tianle Zeng, Shuai Yuan, Binbo Li, Hanzhong Guo, Ji Pei, Da Zhang, Kangli Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छोटे, बेहद स्मार्ट ड्रोन के पायलट हैं, जो एक व्यस्त शहर में तेज़ी से उड़ रहे हैं। आपका काम एक विशिष्ट व्यक्ति का पीछा करना है जो सड़क पर चल रहा है। आमतौर पर, यह आसान होता है: आप उन्हें देखते हैं, उनकी ओर उड़ते हैं, और उन्हें अपने कैमरा लेंस में रखते हैं। लेकिन शहर पेचीदा होते हैं। अचानक, एक ऊँची इमारत, एक घना पेड़, या लोगों की भीड़ आपकी दृष्टि को बाधित कर देती है। वह व्यक्ति आपकी स्क्रीन से ओझल हो जाता है। एक सामान्य ड्रोन घबरा सकता है, गलत अनुमान लगा सकता है और दीवार से टकराकर दुर्घटनाग्रस्त हो सकता है क्योंकि उसने यह नहीं समझा कि व्यक्ति कहाँ गया। यह अनमैन्ड एरियल व्हीकल (UAV) ट्रैकिंग की दुनिया है, रोबोटिक्स का एक ऐसा क्षेत्र जहाँ मशीनें चलते हुए लक्ष्यों का पीछा करना सीखती हैं। बड़ी चुनौती केवल लक्ष्य को देखना नहीं है; बल्कि यह जानना है कि जब आप उन्हें देख नहीं पा रहे हों, तो क्या करना है। इसे हल करने के लिए, वैज्ञानिक विज़न-लैंग्वेज-एक्शन (VLA) मॉडल का उपयोग करते हैं। इन्हें एक रोबोट के मस्तिष्क के रूप में सोचें जो एक छवि को "देख" सकता है, "फॉलो द रनर" जैसे निर्देश को "पढ़" सकता है, और एक ही समय में अपने मोटरों को चलाने के लिए "कार्य" कर सकता है।

यहाँ CosFly-VLA है, एक नया, सुपर-स्मार्ट ड्रोन पायलट जिसे शोधकर्ताओं द्वारा इन "ब्लाइंड स्पॉट्स" (अंधे धब्बों) को संभालने के लिए डिज़ाइन किया गया है। केवल स्क्रीन को घूरने और लक्ष्य के वापस दिखने का इंतज़ार करने के बजाय, CosFly-VLA एक ऐसे जासूस की तरह काम करता है जिसकी कल्पना शक्ति बहुत तेज़ है। जब लक्ष्य किसी इमारत के पीछे ओझल हो जाता है, तो ड्रोन फ्रीज़ नहीं होता। यह शहर के लेआउट और व्यक्ति की अंतिम ज्ञात गति के ज्ञान का उपयोग करके यह अनुमान लगाता है कि वे संभवतः कहाँ होंगे। यह सोचता है, "ठीक है, वे दाईं ओर चल रहे थे, और वह इमारत बाईं ओर है, इसलिए वे दूसरी तरफ से बाहर निकल रहे होंगे।" फिर यह उनसे मिलने के लिए एक गणनात्मक पथ (calculated path) पर उड़ता है। शोधकर्ताओं ने इस ड्रोन को एक विशेष "रेसिपी" का उपयोग करके प्रशिक्षित किया जिसमें लंबे समय तक दृष्टिहीनता के दौर शामिल थे, जिससे इसे सिखाया गया कि जब आँखें विफल हो जाएं तो अपनी स्थानिक तर्कशक्ति (spatial reasoning) पर भरोसा करें। उन्होंने इसका परीक्षण CARLA नामक एक हाई-टेक वीडियो गेम की दुनिया में किया, जहाँ ड्रोन को जटिल शहर के मानचित्रों में पैदल यात्रियों का पीछा करना था। परिणाम बताते हैं कि यह नया दृष्टिकोण पुराने, अधिक बुनियादी ड्रोन मस्तिष्क की तुलना में लक्ष्य को दृष्टि में रखने और दुर्घटनाओं से बचने में बहुत बेहतर है, विशेष रूप से तब जब लक्ष्य लंबे समय तक छिपा रहता है।

डिटेक्टिव ड्रोन: CosFly-VLA कैसे काम करता है

इस शोध पत्र के पीछे का मुख्य विचार यह है कि शहर में चलते हुए लक्ष्य का पीछा करना "लुका-छिपी" के खेल जैसा है जहाँ खोजने वाले को तब भी चलते रहना पड़ता है जब वह छिपने वाले को देख नहीं पाता। शोधकर्ताओं ने, जिनका नेतृत्व ऑटेल रोबोटिक्स और कई विश्वविद्यालयों की एक टीम ने किया, महसूस किया कि अधिकांश मौजूदा ड्रोन सिस्टम "देखने और पीछा करने" में तो माहिर हैं लेकिन दृश्य बाधित होने पर "अनुमान लगाने और पुनः प्राप्त करने" में बहुत खराब हैं।

समस्या: "ब्लाइंड स्पॉट" का डर
कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ आपको एक पात्र का पीछा करना है। अचानक, एक दीवार स्क्रीन को ढक लेती है। यदि आपका पात्र बस रुक जाता है या बेतरतीब ढंग से उड़ता है, तो आप हार जाते हैं। वास्तविक दुनिया में, यदि कोई ड्रोन किसी व्यक्ति को खो देता है, तो वह गलत दिशा में उड़ सकता है, पेड़ से टकरा सकता है, या बस हार मान सकता है। शोध पत्र का तर्क है कि ड्रोन को प्रशिक्षित करने का पुराना तरीका—उन्हें चलते हुए लोगों की हज़ारों तस्वीरें दिखाना—उन्हें उन क्षणों को संभालने के लिए नहीं सिखाता है जब व्यक्ति दिखाई नहीं दे रहा होता है।

समाधान: एक मस्तिष्क जो 3D में सोचता है
CosFly-VLA एक "विज़न-लैंग्वेज-एक्शन" मॉडल है। आइए इसे एक सरल उपमा के साथ समझते:

  • विज़न (दृष्टि): इसके पास आँखें (कैमरे) हैं जो दुनिया को देखती हैं।
  • लैंग्वेज (भाषा): यह "लाल शर्ट वाले व्यक्ति का पीछा करें" जैसे निर्देशों को पढ़ सकता है।
  • एक्शन (कार्य): यह ऊपर, नीचे, बाएँ, दाएँ जाने और मुड़ने के लिए ड्रोन के मोटरों को नियंत्रित करता है।

लेकिन जो चीज़ CosFly-VLA को खास बनाती है वह है इसकी स्थानिक जागरूकता (Spatial Awareness)। जब लक्ष्य छिपा होता है, तो ड्रोन केवल अनुमान नहीं लगाता; वह एक "मानसिक परिकल्पना" बनाता है। वह खुद से पूछता है: "व्यक्ति आखिरी बार कहाँ था? इमारतें कहाँ हैं? यदि वे सीधे चलते रहे, तो वे अब कहाँ होंगे?" फिर वह उस स्थान पर उड़ता है, और जैसे ही वे दोबारा दिखाई देते हैं, उन्हें पकड़ने के लिए तैयार रहता है।

प्रशिक्षण की रेसिपी: छात्र से मास्टर तक
शोधकर्ताओं ने केवल ड्रोन को उड़ना ही नहीं सिखाया; उन्होंने इसे एक मास्टर ट्रैकर बनाने के लिए एक बहुत ही विशिष्ट, चार-चरणीय प्रशिक्षण पाठ्यक्रम दिया:

  1. "सिटी मैप" बूट कैंप (स्पेशियली ग्राउंडेड प्रीट्रेनिंग): पीछा करने से पहले, ड्रोन ने हज़ारों हवाई तस्वीरों और 3D पहेलियों का अध्ययन किया। इसने दूरियों, ऊंचाइयों और इमारतें दृश्यों को कैसे रोकती हैं, इसके बारे में सीखा। यह एक छात्र को खजाने की खोज पर भेजने से पहले उसे मानचित्र पढ़ना सिखाने जैसा है।
  2. "आसान से कठिन" स्कूल (करिकुलम लर्निंग): ड्रोन ने आसान रास्तों के साथ शुरुआत की जहाँ व्यक्ति हमेशा दिखाई देता था। फिर, शिक्षकों (शोधकर्ताओं) ने धीरे-धीरे इसे कठिन बनाया, जिसमें इमारतों के पीछे लंबे समय तक छिपे रहने के दौर पेश किए गए। इसने ड्रोन को अपने "अनुमान लगाने" के कौशल का अभ्यास करने के लिए मजबूर किया।
  3. "सोच कर बोलना" क्लास (चेन-ऑफ-थॉट): यह सबसे दिलचस्प हिस्सा है। ड्रोन को हिलने से पहले "ज़ोर से सोचने" के लिए सिखाया गया था। जब लक्ष्य गायब हो जाता, तो वह एक टेक्स्ट विवरण उत्पन्न करता जैसे: "लक्ष्य इमारत के पीछे है। वे दाईं ओर चल रहे थे, इसलिए मुझे दाईं ओर उड़ना चाहिए और प्रतीक्षा करनी चाहिए।" यह तर्क चरण ड्रोन को यह समझने में मदद करता था कि वह कोई कदम क्यों उठा रहा है, न कि केवल यह कि उसे क्या करना है।
  4. "लाइव फायर" ड्रिल (रीइन्फोर्समेंट लर्निंग): अंत में, ड्रोन एक सिम्युलेटेड शहर (CARLA गेम इंजन) में उड़ा और करके सीखा। यदि वह टकरा गया, तो उसे "कम स्कोर" मिला। यदि उसने लंबे समय तक छिपने के बाद सफलतापूर्वक व्यक्ति को ढूंढ लिया, तो उसे "अच्छा स्कोर" मिला। समय के साथ, इसने अधिक सुचारू और सुरक्षित रूप से उड़ना सीखा।

आंकड़े क्या कहते हैं
शोधकर्ताओं ने अपने नए ड्रोन का परीक्षण पुराने, मानक मॉडलों के विरुद्ध किया। उन्होंने दो प्रकार के परीक्षणों का उपयोग किया:

  • ओपन-लूप: ड्रोन एक वीडियो क्लिप देखता है और भविष्यवाणी करता है कि व्यक्ति कहाँ होगा, बिना वास्तव में उड़े।
  • क्लोज्ड-लूप: ड्रोन वास्तव में सिम्युलेटर में उड़ता है, और वास्तविक समय में निर्णय लेता है।

परिणाम उत्साहजनक थे। "ओपन-लूप" परीक्षणों में, CosFly-VLA ने मानक मॉडलों की तुलना में लक्ष्य के पथ की भविष्यवाणी करने में कम गलतियाँ कीं। विशेष रूप से, इसने परिचित मानचित्रों पर लक्ष्य की स्थिति की भविष्यवाणी करने में औसत त्रुटि को लगभग 34% और नए, अनदेखे मानचित्रों पर 35% कम कर दिया।

वास्तविक "क्लोज्ड-लूप" उड़ान परीक्षणों में, सफलता दर के लिए सुधार और भी नाटकीय था। परिचित मानचित्रों पर, नया ड्रोन मानक मॉडल की तुलना में 29.8% अधिक बार लक्ष्य को ट्रैक करने में सफल रहा (57% सफलता से बढ़कर 74% हो गया)। पूरी तरह से नए मानचित्रों पर, इसमें भी सुधार हुआ, हालांकि यह थोड़ा कम था (2.5%)। सबसे महत्वपूर्ण बात यह है कि नया ड्रोन कम बार दुर्घटनाग्रस्त हुआ और लक्ष्य से सुरक्षित दूरी बनाए रखी।

कमी: यह अभी भी एक सिमुलेशन है
हालाँकि परिणाम रोमांचक हैं, शोध पत्र इसकी सीमाओं के बारे में बहुत स्पष्ट है। ये सभी परीक्षण एक कंप्यूटर सिमुलेशन (CARLA गेम) के भीतर हुए। ड्रोन ने कभी वास्तविक हवा, वास्तविक बारिश या वास्तविक अप्रत्याशित लोगों के साथ वास्तविक दुनिया में उड़ान नहीं भरी है। शोधकर्ता स्वीकार करते हैं कि वास्तविक दुनिया का भौतिक विज्ञान (physics) गेम की तुलना में अधिक अव्यवस्थित हो सकता है। वे यह भी नोट करते हैं कि ड्रोन को शहर के मानचित्रों और पैदल यात्रियों के व्यवहार के एक विशिष्ट सेट पर प्रशिक्षित किया गया था, इसलिए इसे बहुत अलग वातावरण (जैसे घना जंगल या भीड़भाड़ वाला इनडोर मॉल) में संघर्ष करना पड़ सकता है जिसे इसने पहले नहीं देखा है।

मुख्य निष्कर्ष
CosFly-VLA यह सुझाव देता है कि जटिल शहरों में ड्रोनों के वास्तव में उपयोगी होने के लिए, उन्हें केवल जो वे देखते हैं उस पर "प्रतिक्रिया" देना बंद करना होगा और जो वे नहीं देखते उसके बारे में "तर्क" करना शुरू करना होगा। 3D स्पेस की मजबूत समझ के साथ चरण-दर-चरण तर्क प्रक्रिया को जोड़कर, ये ड्रोन ट्रैक पर बने रह सकते हैं भले ही लक्ष्य ओझल हो जाए। यह स्वायत्त ड्रोनों को एक ऐसे मानव पायलट जितना चतुर बनाने की दिशा में एक कदम है जो इलाके को जानता है, न कि केवल एक कैमरा जो एक बिंदु का पीछा करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →