← नवीनतम पेपर
🤖 AI

Drones that Think on their Feet: Sudden Landing Decisions with Embodied AI

यह शोध पत्र प्रदर्शित करता है कि कैसे बड़े विजुअल लैंग्वेज मॉडल्स द्वारा संचालित एम्बॉडीड एआई (embodied AI), स्वायत्त ड्रोन्स को अपने परिवेश की गतिशील व्याख्या करने और अचानक होने वाली घटनाओं के जवाब में वास्तविक समय में, अनुकूल लैंडिंग निर्णय लेने में सक्षम बनाता है, जिससे पारंपरिक हैंड-कोडेड सुरक्षा नियमों की सीमाओं को पार किया जा सके।

मूल लेखक: Diego Ortiz Barbosa, Mohit Agrawal, Yash Malegaonkar, Luis Burbano, Axel Andersson, György Dán, Henrik Sandberg, Alvaro A. Cardenas

प्रकाशित 2026-02-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Diego Ortiz Barbosa, Mohit Agrawal, Yash Malegaonkar, Luis Burbano, Axel Andersson, György Dán, Henrik Sandberg, Alvaro A. Cardenas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त शहर के ऊपर एक रिमोट-कंट्रोल ड्रोन उड़ा रहे हैं। अचानक, आपका कंट्रोलर खराब हो जाता है, या कोई तूफान आ जाता है, या कोई आपके जीपीएस (GPS) सिग्नल को जैम कर देता है। आप अब अपना मिशन पूरा नहीं कर सकते; आपको ड्रोन को बचाने के लिए अभी के अभी लैंड करना होगा।

यह वह समस्या है जिसे यह शोध पत्र हल करता है: आप ड्रोन को "हाजिरजवाबी" कैसे सिखाएंगे ताकि वह सब कुछ गलत होने पर भी सुरक्षित रूप से लैंड करने के लिए एक सही जगह ढूंढ सके?

पुराना तरीका: स्क्रिप्ट वाला रोबोट

पारंपरिक रूप से, इंजीनियर ड्रोन को नियमों की एक लंबी सूची के साथ प्रोग्राम करते थे, जैसे कि एक स्क्रिप्ट।

  • यदि जीपीएस विफल हो जाता है, तो पूर्व-निर्धारित सुरक्षित क्षेत्र पर जाएं।
  • यदि बैटरी कम है, तो निकटतम समतल छत पर उतरें।

समस्या: वास्तविक दुनिया बहुत अव्यवस्थित है। क्या होगा अगर वह "सुरक्षित क्षेत्र" अचानक निर्माण उपकरणों (construction equipment) से भर जाए? क्या होगा अगर निकटतम छत वास्तव में एक ट्रैम्पोलिन या स्विमिंग पूल हो? पुराने स्क्रिप्ट बहुत कठोर होते हैं। वे आश्चर्यों को नहीं संभाल सकते।

नया तरीका: "दिमाग" वाला ड्रोन

लेखक एम्बॉडीड एआई (Embodied AI) और लार्ज विजुअल-लैंग्वेज मॉडल्स (LVLMs) का उपयोग करके एक नई प्रणाली का प्रस्ताव देते हैं। इसे एक ऐसे रोबोट के रूप में न सोचें जो स्क्रिप्ट का पालन कर रहा है, बल्कि एक ऐसे ड्रोन के रूप में सोचें जिसके पास खिड़की से बाहर देखने के लिए एक इंसान जैसा 'कॉमन सेंस' वाला सहायक है।

यहाँ बताया गया है कि उनका सिस्टम कैसे काम करता है, जिसे एक सरल कहानी में विभाजित किया गया है:

1. "आंखें" (सरफेस आईडी मॉड्यूल)

सबसे पहले, ड्रोन नीचे देखता है। यह समतल जगहों को खोजने के लिए एक कैमरे और कुछ गणित का उपयोग करता है। यह एक सुरक्षा गार्ड की तरह है जो पार्किंग स्थल को स्कैन कर रहा है और इशारा कर रहा है: "अरे, छत पर एक समतल जगह है, फुटपाथ पर एक समतल जगह है, और सड़क पर एक समतल जगह है।"

  • चुनौती: ड्रोन को यह नहीं पता कि सड़क सुरक्षित है या नहीं (गाड़ियाँ उसे टक्कर मार सकती हैं) या छत पर कोई बड़ा एसी (AC) यूनिट रास्ता रोक रहा है। वह बस "समतल" देखता है।

2. "दिमाग" (LVLM)

यहीं जादू होता है। ड्रोन उन समतल जगहों की तस्वीरें अपने एआई (AI) "दिमाग" को भेजता है।

  • उपमा: कल्पना कीजिए कि आप ड्रोन हैं। आप तीन विकल्प देखते हैं: एक कुत्ता है ऐसी समतल छत, बिना कारों वाली एक समतल सड़क, और एक खाली समतल पार्किंग लॉट।
  • पुराना रोबोट: जो पहली चीज़ देखेगा, उसे चुन लेगा।
  • नया एआई: तस्वीरों को देखता है और कहता है, "रुको, छत पर एक कुत्ता है (खतरा!)। सड़क खाली दिख रही है, लेकिन कारें किसी भी क्षण आ सकती हैं (जोखिम भरा!)। पार्किंग लॉट खाली और सुरक्षित है। चलो वहीं चलते हैं!"

एआई कॉमन सेंस (सामान्य समझ) का उपयोग करता है। वह समझता है कि "समतल" होने का मतलब हमेशा "सुरक्षित" होना नहीं होता। वह जानता है कि हाईवे खतरनाक है भले ही वह अभी खाली क्यों न हो, और वह जानता है कि एक बड़ी HVAC यूनिट वाली छत टक्कर का खतरा है।

3. "पैर" (मूवमेंट प्लानर)

एक बार जब एआई एक जगह चुन लेता है, तो वह ड्रोन के फ्लाइट कंट्रोलर (जो "पैर" की तरह है) को बताता है कि उसे ठीक कहाँ जाना है। ड्रोन वहां उड़कर जाता है।

4. "दोबारा जांच" (पुष्टि)

यह सबसे महत्वपूर्ण सुरक्षा फीचर है। जब तक ड्रोन चुने हुए स्थान के ऊपर पहुँचता है, तब तक दुनिया बदल सकती है (एक कार सड़क पर आ सकती है, या कोई छत पर चल सकता है)।

  • ड्रोन रुकता है, फिर से देखता है, और पूछता है: "क्या यह अभी भी सुरक्षित है?"
  • यदि एआई कहता है, "नहीं, एक कार अभी आई है," तो ड्रोन तुरंत वहां से उड़ जाता है और एक नया स्थान चुनता है।

प्रयोग: "सिटी सिम्युलेटर" में परीक्षण

शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने इस परीक्षण के लिए एक सुपर-रियलिस्टिक वीडियो गेम की दुनिया (Unreal Engine का उपयोग करके) बनाई। उन्होंने ऐसे परिदृश्य बनाए जहाँ:

  • छतों पर यादृच्छिक बाधाएं थीं (जैसे एयर कंडीशनर)।
  • मौसम बदलता था (बारिश और कोहरा)।
  • सड़कों पर ट्रैफिक चलता था।

उन्होंने क्या पाया:

  1. बड़े दिमाग बेहतर हैं: सबसे शक्तिशाली एआई मॉडल (जैसे GPT-5) खराब मौसम में भी सही जगह पहचानने में उत्कृष्ट थे। उन्होंने शायद ही कभी गलतियां कीं।
  2. छोटे दिमाग संघर्ष करते हैं: छोटे, तेज़ एआई मॉडल (जो ड्रोन पर ही चलने के लिए डिज़ाइन किए गए हैं) कभी-कभी भ्रमित हो जाते हैं। वे शायद यह सोच लें कि एक खुरदरी छत "बहुत ऊबड़-खाबड़" है या किसी पाइप को पक्षी समझ लें।
  3. संदर्भ मायने रखता है: छोटे मॉडलों को बेहतर निर्णय लेने में मदद करने के लिए उन्हें आसपास का व्यापक दृश्य (wider view) देने से मदद मिली।

मुख्य निष्कर्ष

यह शोध पत्र यह साबित करता है कि हम ऐसे ड्रोन बना सकते हैं जो केवल नियमों का पालन नहीं करते, बल्कि आपात स्थिति में तर्क (reasoning) करते हैं।

  • पुराने ड्रोन: "मेरे पास एक नियम है: निकटतम समतल चीज़ पर उतरें।" (कार से टकरा जाता है)।
  • नए ड्रोन: "मैं एक समतल चीज़ देख रहा हूँ, लेकिन मैं एक कार को आते देख रहा हूँ। मैं रुकूँगा और एक बेहतर जगह ढूँढूँगा।"

भविष्य:
अभी, "दिमाग" इतना बड़ा है कि वह एक छोटे ड्रोन के अंदर फिट नहीं हो सकता, इसलिए इसे क्लाउड या ज़मीन पर मौजूद कंप्यूटर से बात करनी पड़ती है। भविष्य का लक्ष्य इस दिमाग को इतना छोटा करना है कि ड्रोन अपने आप सोच सके, भले ही वह वाई-फाई से दूर हो, यह सुनिश्चित करते हुए कि जब चीजें गलत हों, तो ड्रोन खुद को बचा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →