← नवीनतम पेपर
💻 computer science

VLN-Pilot: Large Vision-Language Model as an Autonomous Indoor Drone Operator

यह शोध पत्र VLN-Pilot प्रस्तुत करता है, जो एक नवीन ढांचा है जो प्राकृतिक भाषा निर्देशों की व्याख्या करने और जटिल, संदर्भ-जागरूक उड़ान कार्यों के लिए दृश्य वातावरण के बारे में तर्क करने के माध्यम से स्वायत्त इनडोर ड्रोन नेविगेशन को सक्षम करने के लिए बड़े विजन-लैंग्वेज मॉडल्स का लाभ उठाता है।

मूल लेखक: Bessie Dominguez-Dager, Sergio Suescun-Ferrandiz, Felix Escalona, Francisco Gomez-Donoso, Miguel Cazorla

प्रकाशित 2026-02-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bessie Dominguez-Dager, Sergio Suescun-Ferrandiz, Felix Escalona, Francisco Gomez-Donoso, Miguel Cazorla

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक छोटा, रिमोट-कंट्रोल वाला ड्रोन है जो आपके घर के अंदर उड़ता रहता है। आमतौर पर, आपको एक इंसान की ज़रूरत होती है जो कंप्यूटर के सामने बैठा हो, वीडियो फीड देख रहा हो, और ड्रोन को बताने के लिए बटन दबा रहा हो कि उसे कहाँ जाना है। यदि इंसान का ध्यान भटक जाता है या उससे कोई गलती हो जाती है, तो ड्रोन किसी लैंप से टकरा सकता है या खो सकता है।

यह पेपर VLN-Pilot पेश करता है, जो बिना किसी इंसान द्वारा रिमोट पकड़े इन ड्रोनों को उड़ाने का एक नया तरीका है। एक इंसान के बजाय, वे एक "सुपर-स्मार्ट रोबोट दिमाग" (जिसे लार्ज विजन-लैंग्वेज मॉडल या VLLM कहा जाता है) का उपयोग पायलट के रूप में करते हैं।

यह कैसे काम करता है, इसे सरल भागों में यहाँ समझाया गया है:

1. "दिमाग" और "शरीर"

इस सिस्टम को दो अलग-अलग हिस्सों के रूप में समझें जो मिलकर काम करते हैं:

  • दिमाग (VLLM): यह एक स्मार्ट AI (जैसे GPT या Gemini) है। यह ड्रोन के कैमरे के माध्यम से देख सकता है कि ड्रोन क्या देख रहा है और आपके निर्देशों को "पढ़" सकता है (जैसे "बाथरूम में सिंक ढूँढो")। यह एक बुद्धिमान कप्तान की तरह काम करता है जो आदेश देता है।
  • शरीर (ड्रोन और कंट्रोलर): यह वास्तविक ड्रोन और एक सरल नियम-पुस्तिका (स्टेट मशीन) है जो भौतिक उड़ान को संभालती है। "शरीर" जानता है कि कैसे हवा में रुकना है (hover), आगे बढ़ना है, और दीवार से टकराने पर रुकना है, लेकिन वह यह नहीं जानता कि वह क्यों हिल रहा है।

"दिमाग" कमरे को देखता है, तय करता है कि आगे क्या करना है, और "शरीर" को बताता है कि कौन सा बटन दबाना है।

2. मिशन: "मैप का पीछा करने" का खेल

शोधकर्ताओं ने इसका परीक्षण एक सुसज्जित घर (जिसमें लिविंग रूम, बेडरूम और बाथरूम है) के वास्तविक कंप्यूटर सिमुलेशन में किया। उन्होंने ड्रोन को एक मिशन दिया, जैसे: "बेडरूम में जाओ और दर्पण (mirror) ढूँढो।"

ड्रोन के पास GPS सिग्नल नहीं है (जो घर के अंदर ठीक से काम नहीं करता), इसलिए उसे तस्वीरों को देखकर यह समझना होगा कि वह कहाँ है।

  • प्रक्रिया: ड्रोन एक तस्वीर लेता है, उसे "दिमाग" को भेजता है, और पूछता है, "मैं कहाँ हूँ? मुझे आगे क्या करना चाहिए?"
  • निर्णय: "दिमाग" तस्वीर को देखता है, घर के लेआउट (एक साधारण मैप कि कौन से कमरे आपस में जुड़े हैं) को याद रखता है, और कहता है, "ठीक है, हम लिविंग रूम में हैं। हमें बेडरूम में जाना है। वहाँ एक दरवाज़ा है। उस ओर उड़ो।"
  • क्रिया: "शरीर" उस हलचल को पूरा करता है। फिर यही चक्र दोहराया जाता है।

3. परीक्षण किए गए दो "दिमाग"

शोधकर्ताओं ने यह देखने के लिए दो अलग-अलग प्रकार के AI "दिमागों" का परीक्षण किया कि कौन सा बेहतर पायलट है:

  • दिमाग A (GPT): यह पायलट आत्मविश्वासी और निर्णायक था। जब इसने एक दरवाज़ा देखा, तो यह सीधे उसके पास गया और उसके अंदर चला गया। यह एक ऐसे ड्राइवर की तरह था जो हरा सिग्नल देखता है और बस निकल पड़ता है।
  • दिमाग B (Gemini): यह पायलट बहुत सावधान और पूर्णतावादी (perfectionist) था। जब इसने एक दरवाज़ा देखा, तो यह दूर ही हवा में मंडराता रहा, यह सुनिश्चित करने की कोशिश करता रहा कि दरवाज़ा उसकी दृष्टि में बिल्कुल बीच में हो, इससे पहले कि वह आगे बढ़े। यह एक ऐसे ड्राइवर की तरह था जो हरा सिग्नल देखता है लेकिन रियरव्यू मिरर को बार-बार चेक करता रहता है और सीटबेल्ट को एडजस्ट करता रहता है, और कभी भी एक्सीलेटर नहीं दबा पाता।

4. क्या हुआ? (परिणाम)

  • विजेता: GPT पायलट आम तौर पर बेहतर था। इसने अक्सर लक्षित कमरों तक सफलतापूर्वक रास्ता बनाया और कम टकराया। यह जानता था कि दरवाज़े के पास पहुँचने के लिए "काफी करीब" कब है ताकि वह अंदर जा सके।
  • संघर्ष: Gemini पायलट अक्सर एक लूप (चक्कर) में फंस जाता था। यह दरवाज़े पर खुद को पूरी तरह से केंद्रित करने की कोशिश करता, थोड़ा सा हिलता, महसूस करता कि यह अब भी पूरी तरह से केंद्र में नहीं है, वापस पीछे हटता, और यही प्रक्रिया दोहराता। इससे यह धीमा हो जाता था और कभी-कभी समय समाप्त होने के कारण रुक जाता था।
  • टकराव: जब शोधकर्ताओं ने Gemini पायलट को "बस करीब उड़ने" के लिए कहा, तो यह कभी-कभी दरवाज़े के फ्रेम से बहुत करीब चला गया और टकरा गया। ऐसा इसलिए हुआ क्योंकि AI ने दरवाज़े को "देखा" तो था लेकिन वह वास्तव में ड्रोन के भौतिक आकार को नहीं समझ पाया। उसे यह अहसास नहीं हुआ कि, "हे, मेरे प्रोपेलर इस गैप से ज़्यादा चौड़े हैं!"

5. निष्कर्ष (Bottom Line)

यह पेपर दिखाता है कि हम भाषा और दृष्टि को समझने वाले AI के साथ मानव ड्रोन पायलटों को बदल सकते हैं।

  • अच्छी खबर: AI जटिल निर्देशों का पालन कर सकता है जैसे "बेडरूम में जाओ और दर्पण ढूँढो" और यह लगभग अपने आप कर सकता है।
  • सावधानी: AI अभी भी भौतिक स्थान को समझने की प्रक्रिया में है। यह कभी-कभी सोच लेता है कि वह किसी दरवाज़े से गुजर सकता है जबकि वास्तव में वह नहीं जा सकता, जिससे टकराव होता है।

संक्षेप में, यह पेपर साबित करता है कि एक "स्मार्ट दिमाग" घर के अंदर ड्रोन उड़ा सकता है, लेकिन उसे अभी यह सीखने की ज़रूरत है कि ड्रोन के भौतिक आकार का सम्मान कैसे किया जाए ताकि वह चीजों से न टकराए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →