← नवीनतम पेपर
💻 computer science

Multimodal embodiment-aware navigation transformer

यह शोध पत्र ViLiNT को प्रस्तुत करता है, जो एक मल्टीमॉडल ट्रांसफार्मर-आधारित नेविगेशन पॉलिसी है जो एक डिफ्यूजन मॉडल के माध्यम से टकराव-मुक्त प्रक्षेप पथों (ट्रैजेक्टरीज) को उत्पन्न करने और रैंक करने के लिए विजुअल, LiDAR और रोबोट एम्बॉडमेंट डेटा को फ्यूज करती है, जो विविध वातावरणों में स्टेट-ऑफ-द-आर्ट विजन-ओनली बेसलाइन्स की तुलना में ज़ीरो-शॉट रोबस्टनेस और सफलता दर में महत्वपूर्ण सुधार करती है।

मूल लेखक: Louis Dezons, Quentin Picard, Rémi Marsal, François Goulette, David Filliat

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Louis Dezons, Quentin Picard, Rémi Marsal, François Goulette, David Filliat

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कुत्ते को झाड़ियों, गड्ढों और खड़ी कारों से भरे एक बिखरे हुए पिछवाड़े में रास्ता खोजने के लिए सिखा रहे हैं। आप चाहते हैं कि वह बिना टकराए या गिरे, पीछे के दरवाजे से सामने के बरामदे तक पहुँच जाए, भले ही मौसम बदल जाए, घास लंबी हो जाए, या आप रोबोट कुत्ते की जगह एक थोड़ा बड़ा रोबोट बिल्ली रख दें।

यह पेपर ViLiNT पेश करता है, जो रोबोट्स के लिए एक नया "दिमाग" है जो उन्हें इस कार्य में बहुत बेहतर बनाता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

1. समस्या: "अंधा" रोबोट

आज के अधिकांश रोबोट उन ड्राइवरों की तरह हैं जो केवल विंडशील्ड (कैमरों) के माध्यम से देखते हैं। यदि कोहरा हो, या रोशनी के कारण कोई झाड़ी दीवार जैसी दिखने लगे, तो वे भ्रमित हो जाते हैं। इससे भी बुरा यह है कि यदि आप एक छोटी कार के लिए डिज़ाइन किए गए रोबट को एक विशाल ट्रक के लिए दिए गए निर्देश देते हैं, तो छोटी कार उस गैप से गुजरने की कोशिश कर सकती है जिससे ट्रक टकरा सकता है। वे वास्तव में अपने आकार या अपने शरीर के आकार को नहीं जानते।

2. समाधान: "सुपर-सेंस" दिमाग (ViLiNT)

लेखकों ने एक ऐसा सिस्टम बनाया है जो रोबोट को तीन सुपरपावर देता है:

  • मल्टी-सेंस फ्यूजन (एक "सर्व-द्रष्टा आँख"):
    सिर्फ कैमरे से देखने के बजाय, ViLiNT आंखों (RGB कैमरे) को स्पर्श करने वाले अंगों (LiDAR लेजर जो दूरी मापते हैं) के साथ जोड़ता है। यह एक ऐसे ड्राइवर की तरह है जो सड़क का रंग भी देख सकता है और साथ ही एक छड़ी से ऊबड़-खाबड़ रास्तों को महसूस भी कर सकता है। यह संवेदनाओं को एक एकल "विचार" में मिला देता है ताकि रोबोट समझ सके कि चीजें कैसी दिखती हैं और वे वास्तव में कितनी दूर हैं।

  • "अपने-आकार-को-जानने" वाला टोकन (शरीर की जागरूकता):
    यही इस पेपर का मुख्य आकर्षण (secret sauce) है। रोबोट को एक डिजिटल आईडी कार्ड दिया जाता है जो कहता है, "मैं 1 मीटर चौड़ा और 2 मीटर लंबा हूँ।" दिमाग इस जानकारी का उपयोग यह पूछने के लिए करता है: "क्या मैं उस गैप से गुजर सकता हूँ?"

    • उपमा: कल्पना कीजिए कि एक इंसान दरवाजे से गुजरने की कोशिश कर रहा है। यदि आप एक बच्चे हैं, तो आप सीधे निकल जाएंगे। यदि आप एक सुमो पहलवान हैं, तो आप जानते हैं कि आपको तिरछा होना पड़ेगा या बड़ा दरवाजा ढूंढना होगा। ViLiNT यह गणित तुरंत करता है। यदि रोबोट किसी रास्ते के लिए बहुत बड़ा है, तो वह उस रास्ते को विकल्प के रूप में भी नहीं चुनेगा।
  • "सपना देखने वाला" और "सुरक्षा निरीक्षक" (डिफ्यूजन + क्लीयरेंस हेड):
    रोबोट केवल एक रास्ता नहीं चुनता; वह एक साथ कई संभावित रास्तों के सपने देखता है (एक "डिफ्यूजन" मॉडल का उपयोग करके, जो AI द्वारा कला बनाने के समान है)।

    • सपना देखने वाला (The Dreamer): "ठीक है, मैं बाएं, दाएं या सीधा जा सकता हूँ।"
    • सुरक्षा निरीक्षक (The Safety Inspector): दिमाग का एक विशेष हिस्सा हर सपने में देखे गए रास्ते की जांच करता है। वह पूछता है, "यदि रोबट इस रास्ते पर जाता है, तो वह पेड़ के कितने करीब जाएगा?" वह सुरक्षा के आधार पर हर रास्ते को स्कोर देता है।
    • निर्णय: रोबोट उस रास्ते को चुनता है जो सुरक्षित भी है और उसे लक्ष्य तक पहुँचाता है। यदि सभी रास्ते खतरनाक दिखते हैं, तो वह रुक जाता है और बाहर निकलने के लिए एक नया, अधिक रचनात्मक रास्ता "सपना" देखने की कोशिश करता है।

3. इसने कैसे सीखा

रोबोट ने केवल एक पिछवाड़े में नहीं सीखा। इसे विभिन्न रोबोटों, भू-भागों और सेंसरों के "डेटा विश्वविद्यालय" पर प्रशिक्षित किया गया था।

  • उपमा: कल्पना कीजिए कि एक छात्र जिसने बर्फ, बारिश, रेगिस्तान और शहर की सड़कों में ड्राइविंग सीखी है, और साथ ही स्पोर्ट्स कार और ट्रक दोनों का उपयोग किया है। जब वे अंततः एक नए शहर में एक नई कार चलाते हैं, तो वे घबराते नहीं हैं क्योंकि उन्होंने सब कुछ पहले ही देख लिया है। इसे जीरो-शॉट ट्रांसफर (zero-shot transfer) कहा जाता है—रोबोट बिना पुन: प्रशिक्षित हुए नए स्थानों में काम करता है।

4. परिणाम

टीम ने सिमुलेशन और एक वास्तविक रोबोट (एक रोवर) के साथ बाधाओं से भरे क्षेत्रों में इसका परीक्षण किया।

  • स्कोर: पिछले सर्वश्रेष्ठ रोबोट (जिसने केवल कैमरों का उपयोग किया था) की तुलना में, ViLiNT टकराए बिना अपने लक्ष्य तक पहुँचने में 166% बेहतर था।
  • वास्तविक दुनिया: जब उन्होंने वास्तविक रोबोट को बाधाओं वाले मैदान में रखा, तो पुराना रोबोट लगातार टकरा गया या फंस गया। ViLiNT ने बाधाओं के बीच से रास्ता बनाया, सावधानी से सुरक्षित स्थानों के पास से गुजरा और बाधाओं से बचा, भले ही बाधाएं कठिन थीं।

सारांश

ViLiNT एक रोबोट को दुनिया का 3D मानचित्र, अपने शरीर के आकार को देखने के लिए एक दर्पण, और एक सुरक्षा निरीक्षक देने जैसा है जो कोई भी कदम उठाने से पहले हर संभावित चाल की जांच करता है। यह केवल लक्ष्य को देखने के बारे में नहीं है; यह यह जानने के बारे में है कि सुरक्षित रूप से वहां पहुँचने के लिए आपका शरीर दुनिया में ठीक से कैसे फिट होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →