← नवीनतम पेपर
💻 computer science

LiteVLA-H: Dual-Rate Vision-Language-Action Inference for Onboard Aerial Guidance and Semantic Perception

यह शोध पत्र LiteVLA-H को प्रस्तुत करता है, जो एक कॉम्पैक्ट 256M-पैरामीटर वाला विजन-लैंग्वेज-एक्शन मॉडल है जिसे NVIDIA Jetson AGX Orin पर ऑनबोर्ड हवाई तैनाती के लिए अनुकूलित किया गया है, जो एक विशेष ज्ञान-संरक्षण फाइन-ट्यूनिंग रणनीति के माध्यम से तेज़ रिएक्टिव गाइडेंस (50.65 ms) को धीमी सिमेंटिक नरेशन से अलग करके लो-लेटेंसी ड्यूल-रेट इन्फरेंस प्राप्त करता है।

मूल लेखक: Justn williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

प्रकाशित 2026-05-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Justn williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ड्रोन की कल्पना एक ऐसे पायलट के रूप में करें जो एक विमान उड़ा रहा है। इस पायलट के पास एक ही समय में दो बहुत अलग काम करने की जिम्मेदारी है:

  1. तुरंत प्रतिक्रिया देना (React instantly): किसी पेड़ या इमारत से टकराने से बचने के लिए (जैसे कि एक रिफ्लेक्स)।
  2. सोचना और वर्णन करना (Think and describe): अपने आस-पास जो हो रहा है उसे बताना, जैसे कि ग्राउंड क्रू को कहना, "मैं आगे एक लाल रनवे देख रहा हूँ, और बाईं ओर एक खतरा है" (जैसे कि एक बातचीत)।

लंबे समय तक, एक ही "दिमाग" (एक AI मॉडल) के साथ इन दोनों कामों को करने की कोशिश करना एक समस्या थी। AI या तो टकराने से बचने के लिए बहुत धीमा था (जिससे दुर्घटनाएं होती थीं) या विवरण समझने के लिए बहुत सरल था (जिससे ड्रोन बारीकियों के प्रति अंधा रह जाता था)।

यह पेपर LiteVLA-H पेश करता है, जो एक नया सिस्टम है जिसे एक "डुअल-मोड पायलट" की तरह काम करने के लिए डिज़ाइन किया गया है।

मुख्य समस्या: "दिमाग" की बाधा (The "Brain" Bottleneck)

AI मॉडल को रसोई में एक शेफ (रसोइया) की तरह समझें।

  • पुराना तरीका: हर बार जब शेफ को कोई ऑर्डर मिलता है, तो उन्हें पेंट्री (सामान रखने की जगह) तक जाना पड़ता है, सामग्री ढूंढनी पड़ती है, उसे काटना पड़ता है, और फिर खाना बनाना शुरू करना पड़ता है। यदि आप एक त्वरित स्नैक (एक एकल क्रिया) या एक पूरा भोज (एक लंबा वर्णन) मांगते हैं, तो शेफ को पहले वही लंबी पैदल यात्रा (पेंट्री तक जाना) करनी पड़ती है। इस "पेंट्री तक जाने" को पेपर में "प्री-फिल" (pre-fill) कहा गया है। यह अधिकांश समय ले लेता है।
  • समस्या: यदि शेफ हर बार तब खाना बनाने की कोशिश करता है जब पायलट को पेड़ से बचने की जरूरत होती है, तो पायलट दुर्घटनाग्रस्त हो जाएगा क्योंकि शेफ प्याज काटने में व्यस्त होगा।

समाधान: "डुअल-रेट" शेड्यूलर (The "Dual-Rate" Scheduler)

LiteVLA-H नियमों को बदल देता है। यह महसूस करता है कि ड्रोन के लिए, "पेंट्री तक जाना" (pre-fill) धीमा हिस्सा है, लेकिन एक बार सामग्री बाहर आ जाने के बाद, एक अकेला अंडा पकाना (एक त्वरित क्रिया) लगभग तुरंत होता है।

सिस्टम एक शेड्यूलर (ट्रैफिक मैनेजर) का उपयोग करता है जो काम को दो लेन में विभाजित करता है:

  1. फास्ट लेन (प्रतिक्रियात्मक मार्गदर्शन - Reactive Guidance):

    • यह क्या करता है: जब ड्रोन को कोई बाधा दिखती है, तो वह AI से "बाएं मुड़ें" या "ऊपर जाएं" जैसे त्वरित कमांड मांगता है।
    • कितना तेज़: यह यह काम प्रति सेकंड लगभग 20 बार (हर 50 मिलीसेकंड में) करता है।
    • चाल (The Trick): AI केवल एक छोटा सा "एक्शन टोकन" (एक शब्द जैसे "बाएं") उत्पन्न करता है। यह पूरा वाक्य लिखने का इंतज़ार नहीं करता। क्योंकि "पेंट्री तक जाने" का काम पहले ही हो चुका है, इसलिए यह अविश्वसनीय रूप से तेज़ होता है।
  2. स्लो लेन (सिमेंटिक परसेप्शन - Semantic Perception):

    • यह क्या करता है: हर कुछ सेकंड में, AI एक सांस लेता है और एक पूरा वाक्य बनाता है: "मैं एक रनवे के करीब पहुंच रहा हूं जिसमें बाईं ओर लाल बत्ती है।"
    • कितना तेज़: यह प्रति सेकंड लगभग 6 बार (हर 150 मिलीसेकंड में) करता है।
    • लाभ: यह मानव ऑपरेटर या ड्रोन के लॉग्स को दुनिया का एक समृद्ध विवरण देता है बिना फास्ट लेन को धीमा किए।

"किचन" एनालॉजी (उपमा) एक्शन में

कल्पមាន करें कि ड्रोन एक व्यस्त शहर से गुजर रहा है।

  • फास्ट लेन पायलट के हाथ की स्टिक पर नियंत्रण की तरह है। यदि कोई पक्षी सामने उड़कर आता है, तो पायलट का हाथ तुरंत हिल जाता है। AI बस कहता है "ऊपर!" और ड्रोन प्रतिक्रिया देता है।
  • स्लो लेन टावर से बात करने वाले पायलट की तरह है। "टावर, मैं एक निर्माण क्षेत्र देख रहा हूं, मैं चक्कर लगाकर निकल जाऊंगा।" इसे बोलने में कुछ सेकंड लगते हैं, लेकिन यह सुरक्षा और जागरूकता के लिए महत्वपूर्ण है।

LiteVLA-H साबित करता है कि आप दोनों रख सकते हैं। यह पायलट को पक्षी से बचने के लिए बात करना छोड़ने के लिए मजबूर नहीं करता, और न ही यह उसे कहानी सुनाने के लिए बचना छोड़ने के लिए मजबूर करता है।

उन्होंने AI को कैसे सिखाया

यह सुनिश्चित करने के लिए कि AI केवल बचने के लिए सीखने के कारण "मूर्ख" न हो जाए, शोधकर्ताओं ने एक विशेष ट्रेनिंग रेसिपी का उपयोग किया।

  • उन्होंने AI को केवल ड्रोन के टकराने और बचने के वीडियो नहीं दिखाए।
  • उन्होंने इसे सामान्य चित्र और विवरण भी दिखाए (जैसे कि "मैट पर एक बिल्ली" कैप्शन वाली बिल्ली की फोटो) और हवाई विवरण (जैसे कि "कोहरे के साथ एक रनवे")।
  • उन्होंने इन्हें आपस में मिला दिया ताकि AI एक अच्छा पायलट और एक अच्छा किस्सागो (storyteller) दोनों बन सके। इसे "नॉलेज-प्रिजर्विंग" (ज्ञान सुरक्षित रखना) कहा जाता है, जिसका अर्थ है कि AI ने उड़ना सीखने के चक्कर में बोलना नहीं भुलाया।

परिणाम

टीम ने इसे ड्रोन में लगे एक छोटे कंप्यूटर (NVIDIA Jetson AGX Orin) पर टेस्ट किया।

  • गति: "फास्ट लेन" 19.74 Hz (लगभग 20 बार प्रति सेकंड) पर काम करती है। यह ड्रोन को स्थिर और सुरक्षित रखने के लिए पर्याप्त तेज़ है।
  • जागरूकता: "स्लो लेन" 6.67 Hz पर काम करती है, जो विवरणों की एक निरंतर धारा प्रदान करती है।
  • तुलना: अन्य उन्नत AI सिस्टमों की तुलना में, LiteVLA-H "बचने" के कमांड देने में बहुत तेज़ था क्योंकि इसने हर बार एक पूरा निबंध लिखने की कोशिश करना बंद कर दिया जब एक पल के निर्णय की आवश्यकता थी।

निचोड़ (The Bottom Line)

पेपर का दावा है कि ड्रोन के लिए, पहली प्रतिक्रिया की गति सबसे महत्वपूर्ण चीज है। यह महसूस करते हुए कि "सेटअप समय" (pre-fill) सबसे बड़ी देरी है, उन्होंने एक ऐसा सिस्टम बनाया जो "रिफ्लेक्स" (प्रतिवर्त) को "बातचीत" से अलग करता है। यह एक छोटे, कॉम्पैक्ट AI को सुरक्षित रूप से ड्रोन उड़ाने और साथ ही मानव ऑपरेटर को दुनिया का वर्णन करने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →