← नवीनतम पेपर
💻 computer science

GRaD-Nav++: Vision-Language Model Enabled Visual Drone Navigation with Gaussian Radiance Fields and Differentiable Dynamics

GRaD-Nav++ एक हल्का, पूर्णतः ऑनबोर्ड विजन-लैंग्वेज-एक्शन फ्रेमवर्क है जो 3D गॉसियन स्प्लेटिंग सिमुलेशन, डिफरेंशिएबल रीइन्फोर्समेंट लर्निंग और मिक्स्चर-ऑफ-एक्सपर्ट्स आर्किटेक्चर का लाभ उठाता है ताकि स्वायत्त ड्रोन को उच्च सामान्यीकरण और वास्तविक समय के प्रदर्शन के साथ असंरचित वातावरण में प्राकृतिक भाषा नेविगेशन कमांड निष्पादित करने में सक्षम बनाया जा सके।

मूल लेखक: Qianzhong Chen, Naixiang Gao, Suning Huang, JunEn Low, Timothy Chen, Jiankai Sun, Mac Schwager

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qianzhong Chen, Naixiang Gao, Suning Huang, JunEn Low, Timothy Chen, Jiankai Sun, Mac Schwager

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ड्रोन को कमरे में उड़ना और आपके बोले गए निर्देशों का पालन करना सिखाना चाहते हैं, जैसे कि "बाएं गेट से होकर उड़ो, फिर लाल सीढ़ी के ऊपर मंडराओ (hover)।" आमतौर पर, एक रोबोट को यह सिखाना एक बच्चे को चलने के बारे में सिखाने जैसा है, जहाँ आप हर संभावित कदम, मांसपेशी की हरकत और संतुलन समायोजन पर 10,000 पन्नों का मैनुअल लिखते हैं। यह धीमा, महंगा है, और जब कमरा बदल जाता है तो रोबोट अक्सर भ्रमित हो जाता है।

यह पेपर GRaD-Nav++ पेश करता है, जो ड्रोन को सिखाने का एक नया तरीका है जो तेज़ है, स्मार्ट है, और पूरी तरह से ड्रोन के अपने कंप्यूटर पर चलता है (क्लाउड में किसी विशाल सर्वर की आवश्यकता नहीं है)। यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. "दिमाग": आँखों और कानों के लिए एक अनुवादक

अधिकांश रोबड़ों के पास भाषा समझने वाला एक "दिमाग" होता है और दृष्टि (vision) समझने वाला एक अलग "दिमाग" होता है। वे दोनों को जोड़ने में संघर्ष करते हैं।

  • उपमा: ड्रोन के दिमाग को एक अनुवादक के रूप में सोचें जो एक टूर गाइड भी है।
  • यह कैसे काम करता है: ड्रोन एक पूर्व-प्रशिक्षित "विज़न-लैंग्वेज मॉडल" (एक स्मार्ट अनुवादक की तरह) का उपयोग करता है। जब आप कहते हैं "सीढ़ी की ओर जाओ," तो अनुवादक तुरंत समझ जाता है कि "सीढ़ी" शब्द उस आकार से मेल खाता है जिसे वह अपने कैमरे के माध्यम से देख रहा है। इसे यह जानने के लिए मैन्युअल रूप से प्रोग्राम करने की आवश्यकता नहीं है कि सीढ़ी कैसी दिखती है; यह अपने प्रशिक्षण से पहले से ही "जानता" है। यह ड्रोन को हर संभव वस्तु के लिए एक विशिष्ट बटन की आवश्यकता के बिना जटिल, प्राकृतिक निर्देशों को समझने की अनुमति देता है।

2. "प्रशिक्षण मैदान": एक आदर्श, संपादन योग्य वीडियो गेम

सीखने के लिए, ड्रोन को लाखों बार अभ्यास करने की आवश्यकता होती है। आमतौर पर, इसमें बहुत समय लगता है या महंगे, धीमे सिमुलेशन की आवश्यकता होती है।

  • उपमा: एक पायलट को फ्लाइट सिम्युलेटर में प्रशिक्षित करने की कल्पना करें। अधिकांश सिम्युलेटर दानेदार, लो-रेज़ोल्यूशन वाले वीडियो गेम की तरह होते हैं। यह पेपर 3D Gaussian Splatting का उपयोग करता है, जो एक हाइपर-रियलिस्टिक, इंस्टेंट-रिप्ले वीडियो गेम की तरह है। यह दुनिया को इतनी सटीकता और तेज़ी से रेंडर करता है कि ड्रोन वास्तविक दुनिया के डिजिटल जुड़वां (digital twin) में बिना टकराए उड़ने का अभ्यास कर सकता है।
  • गुप्त नुस्खा (DiffRL): लेखक "डिफरेंशियल रिइन्फोर्समेंट लर्निंग" (Differentiable Reinforcement Learning) नामक तकनीक का उपयोग करते हैं।
    • सामान्य लर्निंग: यदि ड्रोन टकरा जाता है, तो उसे "थम्स डाउन" मिलता है और वह बाद में फिर से प्रयास करता है।
    • यह विधि: यह एक समय-यात्रा करने वाले कोच (time-traveling coach) की तरह है। जब ड्रोन कोई गलती करता है, तो कोच समय को पीछे घुमा सकता है, बिल्कुल यह देख सकता है कि गलती क्यों हुई, और ड्रोन के दिमाग को उस विशिष्ट त्रुटि को तुरंत ठीक करने के लिए प्रेरित कर सकता है। यह सीखने की प्रक्रिया को अविश्वसनीय रूप से तेज़ और कुशल बनाता है।

3. "निर्णय लेने वाला": विशेषज्ञों की एक टीम (MoE)

ड्र ड्रोन को उन चीज़ों को भूले बिना कई अलग-अलग कार्यों (बाएं उड़ना, दाएं उड़ना, बाधाओं से बचना) को संभालना चाहिए जिन्हें वह पहले से जानता है।

  • उपमा: एक रेस्टोरेंट किचन की कल्पना करें। एक ही शेफ द्वारा मेनू के हर व्यंजन को पकाने की कोशिश करने के बजाय (जिससे जला हुआ खाना और भ्रम पैदा होता है), आपके पास विशेषज्ञों की एक टीम है।
    • एक शेफ ग्रिलिंग में बहुत अच्छा है।
    • दूसरा बेकिंग में बहुत अच्छा है।
    • तीसरा काटने (chopping) में बहुत अच्छा है।
  • यह कैसे काम करता है: ड्रोन एक मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) सिस्टम का उपयोग करता है। जब ड्रोन एक गेट देखता है, तो वह उस विशेषज्ञ को "बुलाता" है जो गेट के बीच से उड़ने में माहिर है। जब वह एक सीढ़ी देखता है, तो वह मंडराने (hovering) में माहिर विशेषज्ञ को बुलाता है। एक स्मार्ट "मैनेजर" (राउटर) तय करता है कि वर्तमान स्थिति के लिए किस विशेषज्ञ का उपयोग किया जाए। यह ड्रोन को नए कौशल सीखते समय पुराने कौशल "भूलने" (जिसे कैटास्ट्रोफिक फॉरगेटिंग कहा जाता है) से बचाता है।

4. परिणाम: अपने आप उड़ना

टीम ने इस सिस्टम का परीक्षण दो तरीकों से किया:

  1. सिम्युलेटर में: ड्रोन ने डिजिटल दुनिया में निर्देशों का सफलतापूर्वक पालन किया, यहाँ तक कि उन कार्यों के लिए भी जिन्हें उसने पहले कभी नहीं देखा था (जैसे किसी विशिष्ट गेट से गुजरने के बाद एक विशिष्ट वस्तु को खोजना)। यह नए कार्यों पर लगभग 75% बार सफल रहा।
  2. वास्तविक हार्डवेयर पर: उन्होंने इस सॉफ़्टवेयर को एक छोटे कंप्यूटर (NVIDIA Jetson Orin Nano) और एक कैमरे वाले वास्तविक ड्रोन पर लगाया। बिना किसी इंटरनेट कनेक्शन या बाहरी मदद के, ड्रोन उड़ सकता था, निर्देशों का पालन कर सकता था और बाधाओं से बच सकता था। यह वास्तविक दुनिया के कार्यों में लगभग 50-67% बार सफल रहा।

यह क्यों महत्वपूर्ण है

  • यह आत्मनिर्भर है: ड्रोन को सोचने के लिए किसी ग्राउंड स्टेशन या सुपरकंप्यूटर की आवश्यकता नहीं है। यह अपने आप सोचता है।
  • यह लचीला है: यह निर्देशों के नए संयोजनों (जैसे, "बाएं जाओ, फिर कार्ट ढूँढो") को समझ सकता है बिना शून्य से पुन: प्रशिक्षित हुए।
  • यह कुशल है: "टाइम-ट्रैवलिंग कोच" (DiffRL) और "विशेषज्ञों की टीम" (MoE) का उपयोग करके, यह पिछले तरीकों की तुलना में बहुत तेज़ी से सीखता है।

संक्षेप में: लेखकों ने एक ऐसा ड्रोन बनाया है जो आपकी आवाज़ सुन सकता है, दुनिया को देख सकता है, और अपने आप अपने गंतव्य तक पहुँचने के लिए उड़ने का रास्ता निकाल सकता है, जो एक हाइपर-रियलिस्टिक वीडियो गेम में प्रशिक्षित डिजिटल विशेषज्ञों की एक स्मार्ट टीम का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →