← नवीनतम पेपर
💻 computer science

AIR-VLA+: Decoupling Movement and Manipulation via Cascaded Dual-Action Decoders with Asymmetric MoE for Aerial Robots

यह शोध पत्र AIR-VLA+ प्रस्तुत करता है, जो हवाई रोबोटों के लिए एक फ्लो मैचिंग आर्किटेक्चर है जो कैस्केडित डुअल-एक्शन डिकोडर्स और एक एसिमेट्रिक मिक्स्चर ऑफ एक्सपर्ट्स (MoE) डिज़ाइन के माध्यम से प्लेटफॉर्म मूवमेंट और एंड-इफेक्टर मैनिपुलेशन को अलग करता है, जो विषम नियंत्रण संघर्षों को प्रभावी ढंग से हल करके AIR-VLA बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Jianli Sun, Bin Tian, Qiyao Zhang, Zijian Liu, Yutong Wang, Zhiyong Cui, Bai Li, Yisheng Lv, Yonglin Tian

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianli Sun, Bin Tian, Qiyao Zhang, Zijian Liu, Yutong Wang, Zhiyong Cui, Bai Li, Yisheng Lv, Yonglin Tian

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ड्रोन है जिसके साथ एक रोबोटिक आर्म (यांत्रिक भुजा) जुड़ी हुई है। यह एक "कम्पोजिट रोबोट" है जिसे कप उठाने और उसे मेज तक ले जाने जैसे काम करने के लिए डिज़ाइन किया गया है। समस्या यह है कि ड्रोन (उड़ने वाला हिस्सा) और आर्म (पकड़ने वाला हिस्सा) बहुत अलग-अलग भाषाएं बोलते हैं और उनके काम भी बहुत अलग हैं।

  • ड्रोन एक बस ड्राइवर की तरह है। इसे बड़ी तस्वीर पर ध्यान देने की जरूरत है: "मैं कहाँ जा रहा हूँ? क्या मुझे बाएं मुड़ना चाहिए? क्या मुझे रुकना चाहिए?" यह बड़े आंदोलनों और स्थिति में बदलाव से निपटता है।
  • आर्म एक सर्जन की तरह है। इसे सूक्ष्म, सटीक विवरणों पर ध्यान देने की जरूरत है: "क्या मेरी उंगली कप को छू रही है? क्या पकड़ पर्याप्त मजबूत है?" यह सूक्ष्म समायोजनों से निपटता है।

समस्या: मस्तिष्क में ट्रैफिक जाम

पुराने रोबोट सिस्टम में, ड्रोन और आर्म एक ही "मस्तिष्क" (एक ही कंप्यूटर मॉडल) साझा करते थे ताकि यह तय किया जा सके कि क्या करना है। इससे एक ट्रैफिक जाम हो जाता था। बस ड्राइवर के निर्देश (5 मीटर बाएं चलें) और सर्जन के निर्देश (कलाई को 2 डिग्री घुमाएं) आपस में मिल जाते थे।

परिणामस्वरूप, ड्रोन भ्रमित हो जाता था, हिलने या डगमगाने लगता था, और आर्म वस्तु को पकड़ने में चूक जाता था। यह एक बस चलाने और साथ ही साथ एक नाजुक सर्जरी करने की कोशिश करने जैसा है; दोनों कार्य एक-दूसरे से लड़ते हैं, और न ही कोई काम ठीक से होता है।

समाधान: AIR-VLA+ (एक विशेषज्ञ टीम)

यह पेपर एक नया सिस्टम पेश करता है जिसे AIR-VLA+ कहा जाता है। ड्रोन और आर्म को एक ही मस्तिष्क साझा करने के लिए मजबूर करने के बजाय, यह सिस्टम उन्हें एक विशेषज्ञ टीम संरचना देता है जो उन्हें एक-दूसरे के रास्ते में आए बिना मिलकर काम करने की अनुमति देती है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:

1. "कैस्केडेड" हैंडऑफ (एकतरफा रास्ता)

एक रिले रेस की कल्पना करें जहाँ बैटन (छड़ी) लेकर दौड़ने वाला धावक (आर्म) अगले धावक (ड्रोन) को बैटन सौंपता है, लेकिन अगला धावक इसे वापस नहीं दे सकता।

  • आर्म तय करता है कि वह क्या करना चाहता है (जैसे, "मैं कप को पकड़ने जा रहा हूँ")।
  • वह यह योजना ड्रोन को बताता है।
  • ड्रोन सुनता है और आर्म की मदद करने के लिए अपनी उड़ान को समायोजित करता है (जैसे, "ठीक है, मैं स्थिर रहने के लिए हवा में रुकूँगा ताकि तुम पकड़ सको")।
  • महत्वपूर्ण बात: ड्रोन आर्म की योजना को बदल नहीं सकता। यह आर्म की सटीकता की रक्षा करता है। यदि ड्रोन घबरा जाता है और आर्म की गति को "ठीक करने" की कोशिश करता है, तो पूरा सिस्टम क्रैश हो जाता है। यह एकतरफा रास्ता आर्म को स्थिर रखता है।

2. "स्मार्ट चश्मा" (इनपुट फीचर एन्हांसमेंट)

ड्रोन को केवल यह जानने से कहीं अधिक की आवश्यकता है कि "कहाँ उड़ना है।" उसे यह भी जानना होगा कि अभी क्या हो रहा है।

  • सिस्टम ड्रोन को "स्मार्ट चश्मा" (एक इम्प्लिसिट विजुअल ग्रैस्प प्रोजेक्टर) देता है। ये चश्मे केवल कमरे को नहीं देखते; वे विशेष रूप से रोबोट के हाथ और वस्तु के बीच के अंतर को देखते हैं।
  • यह ड्रोन को एक "मिशन ब्रीफिंग" (कंप्रेस्ड ग्लोबल सिमेंटिक्स) भी देता है। यह ड्रोन को बड़े लक्ष्य की याद दिलाता है: "हम एक कप को प्लेट तक ले जा रहे हैं," ताकि वह उड़ते समय अपने कार्य को न भूले।

3. "विशेषज्ञ पैनल" (एसिमेट्रिक MoE)

यह सबसे रचनात्मक हिस्सा है। ड्रोन के पास उड़ने के लिए केवल एक "मस्तिष्क" नहीं है। उसके पास तीन अलग-अलग विशेषज्ञों (मिक्सचर ऑफ एक्सपर्ट्स) का एक पैनल है जो स्थिति के आधार पर बारी-बारी से बस चलाते हैं।

  • विशेषज्ञ 1 "अप्रोच स्पेशलिस्ट" है। वे किसी वस्तु की ओर सुचारू रूप से उड़ने में माहिर हैं।
  • विशेषज्ञ 2 "होवर स्पेशलिस्ट" है। वे आर्म द्वारा कुछ पकड़ने के दौरान ड्रोन को बिल्कुल स्थिर रखने में माहिर हैं।
  • विशेषज्ञ 3 "ट्रैवल स्पेशलिस्ट" है। वे अगली लोकेशन तक तेजी से उड़ने में माहिर हैं।

सिस्टम एक "रूटर" (ट्रैफिक कंट्रोलर की तरह) का उपयोग करता है यह तय करने के लिए कि किसी भी दिए गए सेकंड में कौन सा विशेषज्ञ प्रभारी है। वे सलाह को सुचारू रूप से मिलाते हैं। इसका मतलब यह है कि ड्रोन को "फ्लाइंग मोड" से "होवरिंग मोड" में अचानक स्विच करने की आवश्यकता नहीं होती है; यह बस सहजता से सही विशेषज्ञ की ओर बढ़ता है।

परिणाम: एक सुचारू उड़ान

जब शोधकर्ताओं ने इस नए सिस्टम का पुराने मॉडलों के मुकाबले परीक्षण किया:

  • पुराने मॉडल: ड्रोन हिलता था, डगमगाता था, या एक ऐसे लूप में फंस जाता था जहाँ वह उड़ने या स्थिर रहने के बीच निर्णय नहीं ले पाता था।
  • AIR-VLA+: ड्रोन सुचारू रूप से उड़ा, जरूरत पड़ने पर पूरी तरह स्थिर रहा, और आर्म ने वस्तुओं को सटीकता से पकड़ा।

पेपर का दावा है कि इस नए तरीके ने पिछले सर्वश्रेष्ठ सिंगल-ब्रेन मॉडल की तुलना में कार्यों की सफलता दर में 80.2% का सुधार किया है। इसने ड्रोन और आर्म को उनकी अपनी विशेषज्ञ भूमिकाएँ देते हुए, उन्हें पूरी तरह से समन्वित रखते हुए, "ट्रैफिक जाम" की समस्या को हल कर दिया।

संक्षेप में: AIR-VLA+ ड्रोन और आर्म को एक स्पष्ट कमांड चेन, क्या हो रहा है यह देखने के लिए विशेष उपकरण, और उड़ने के विशेषज्ञों की एक टीम देकर एक-दूसरे से लड़ने से रोकता है, जो ठीक जानते हैं कि स्टीयरिंग व्हील कब संभालना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →