← नवीनतम पेपर
💻 computer science

BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation

BIT-Nav एक मस्तिष्क-प्रेरित, कॉम्पैक्ट प्रक्षेपवक्र स्मृति (trajectory memory) को पेश करके विजन-लैंग्वेज नेविगेशन में स्पार्स फ्रेम चयन की सीमाओं को संबोधित करता है, जो एक Bi-GRU एनकोडर और कंट्रास्टिव लर्निंग के माध्यम से संरचित गति इतिहास को एक एकल टोकन में संकुचित करता है, जिससे टोकन लागत बढ़ाए बिना प्रभावी दीर्घ-क्षितिज तर्क (long-horizon reasoning) सक्षम होता है।

मूल लेखक: Rithvik Jonna, Aakash Gurram, Man Namgung, Wyatt Mackey, Tinoosh Mohsenin

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rithvik Jonna, Aakash Gurram, Man Namgung, Wyatt Mackey, Tinoosh Mohsenin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वॉकी-टॉकी के माध्यम से एक विशाल, अपरिचित भूलभुलैया में एक रोबोट का मार्गदर्शन करने की कोशिश कर रहे हैं। आप उसे निर्देश देते हैं जैसे, "आगे बढ़ो, बड़े लाल दरवाजे पर बाएं मुड़ो, फिर तब तक सीधे जाओ जब तक तुम्हें एक सोफा न दिख जाए।"

लंबे समय से, AI रोबोट शब्दों को समझने और अपने वर्तमान कमरे को देखने में बहुत अच्छे रहे हैं। लेकिन उनके पास एक बड़ी कमी है: वे भूल जाते हैं कि वे कहाँ से आए थे।

यदि आप एक रोबोट को 100 कदम चलने के लिए कहते हैं, तो अधिकांश वर्तमान सिस्टम पिछले कुछ कमरों के "फोटो एल्बम" को देखकर याद रखने की कोशिश करते हैं। लेकिन जैसे-जैसे यात्रा लंबी होती जाती है, यह फोटो एल्बम बहुत बड़ा होता जाता है, इसलिए उन्हें अधिकांश फोटो फेंकने पड़ते हैं। यदि वे केवल कुछ बिखरे हुए स्नैपशॉट रखते हैं, तो वे उस "प्रवाह" को खो देते हैं कि वे वहाँ कैसे पहुँचे। वे यह तो जान सकते हैं कि वे सोफे वाले कमरे में हैं, लेकिन उन्हें यह नहीं पता होगा कि वे वहाँ पहुँचने के लिए तीन बार बाएं मुड़े थे या वे एक घेरे में घूम रहे थे।

BIT-Nav एक नया सिस्टम है जिसे इस मेमोरी समस्या को ठीक करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "मानसिक मानचित्र" बनाम "फोटो एल्बम"

वर्तमान रोबोट अपनी यात्रा को याद रखने के लिए फोटो (विजुअल फ्रेम्स) सहेजकर कोशिश करते हैं। शोध का तर्क है कि लंबी यात्राओं के लिए फोटो खराब होते हैं क्योंकि वे बहुत अधिक जगह लेते हैं और गति के "प्रवाह" को मिस कर देते हैं।

BIT-Nav खेल बदल देता है। फोटो बचाने के बजाय, यह स्वयं गति का एक संक्षिप्त सारांश सहेजता है। इसे इस प्रकार सोचें:

  • पुराना तरीका: पेड़ों और चट्टानों के 100 रैंडम स्नैपशॉट देखकर 10 मील की पैदल यात्रा को याद रखने की कोशिश करना। आप यह मिस कर सकते हैं कि आपने एक बड़ा लूप (घेरा) बनाया था।
  • BIT-Nav का तरीका: अपनी जेब में एक छोटा सा नोट रखना जिसमें लिखा हो, "मैंने 10 मील की यात्रा की, 4 बार बाएं मुड़ा, और अब उत्तर की ओर देख रहा हूँ।"

2. "मस्तिष्क से प्रेरित" मेमोरी (BITE)

पेपर अपने मेमोरी मॉड्यूल को BITE (Bi-GRU Trajectory Encoder) कहता है। यह इस बात से प्रेरित है कि मानव मस्तिष्क (विशेष रूप से हिप्पोकैम्पस) कैसे काम करता है। जब आप कहीं चलते हैं, तो आपका मस्तिष्क आपके विज़न के हर एक पिक्सेल को रिकॉर्ड नहीं करता है; यह आपके पाथ इंटीग्रेशन (पथ एकीकरण) की गणना करता है। यह आपके कदमों, मोड़ों और दिशा को ट्रैक करता है ताकि एक मानसिक मानचित्र बना सके।

BIT-Nav रोबोट के लिए भी यही करता है:

  • यह रोबोट के कार्यों (आगे, बाएं मुड़ना, दाएं मुड़ना) को देखता है।
  • यह गणितीय रूप से रोबोट की स्थिति और दिशा की गणना करता है।
  • यह पूरी यात्रा के इतिहास को एक एकल "मेमोरी टोकन" में संकुचित (compress) कर देता है।

3. "बड़े दिमाग" के लिए "अनुवादक"

रोबोट निर्देशों को समझने के लिए एक बहुत ही स्मार्ट "बड़ा दिमाग" (Qwen3-VL-8B नामक एक विजन-लैंग्वेज मॉडल) का उपयोग करता है। यह बड़ा दिमाग पढ़ने और देखने में बहुत अच्छा है, लेकिन यह स्वाभाविक रूप से गणित या गति के इतिहास को नहीं समझता है।

BIT-Nav एक अनुवादक के रूप में कार्य करता है। यह उस छोटे से "गति सारांश" (मेमोरी टोकन) को लेता है और इसे उस भाषा में अनुवादित करता है जिसे बड़ा दिमाग समझ सके। फिर यह उस एकल टोकन को वर्तमान कैमरा दृश्य और निर्देश के साथ बड़े दिमाग को सौंप देता है।

4. यह क्यों मायने रखता है: "टोकन" की अर्थव्यवस्था

AI में, "टोकन" शब्दों या डेटा के टुकड़ों की तरह होते हैं जिन्हें कंप्यूटर को प्रोसेस करना होता है।

  • समस्या: यदि एक रोबोट लंबी यात्रा को याद रखने के लिए बड़े दिमाग को हर पिछले कार्य की सूची भेजता है (जैसे, "चरण 1: आगे, चरण 2: बाएं मुड़ें... चरण 100: आगे"), तो यह हजारों टोकन का उपयोग करता है। यह धीमा, महंगा है, और बड़े दिमाग को डेटा की भारी मात्रा से भ्रम हो जाता है।
  • BIT-Nav का समाधान: चाहे रोबोट ने 10 कदम चले हों या 1,000 कदम, BIT-Nav केवल एक एकल टोकन भेजता है। यह एक 1,000 पन्नों की डायरी भेजने के बजाय एक एकल, सटीक सारांश वाक्य भेजने जैसा है।

शोध में क्या पाया गया

शोधकर्ताओं ने एक सिम्युलेटेड वातावरण (Isaac Sim) में R2R डेटासेट (एक मानक रोबोट नेविगेशन टेस्ट) के साथ इसका परीक्षण किया।

  • बेहतर दिशा बोध: जब पूछा गया, "उन सभी मोड़ों के बाद, हम जहाँ से शुरू किए थे उसके मुकाबले बाएं या दाएं देख रहे हैं?", तो BIT-Nav रोबोट ने 83% बार सही उत्तर दिया। इस मेमोरी के बिना, रोबोट रैंडम अनुमान लगाता (लगभग 7% सटीकता)।
  • दक्षता (Efficiency): BIT-Nav रोबोट ने उन रोबोटों की तुलना में बहुत अधिक सटीकता प्राप्त की जो हर पिछले कदम की सूची बनाकर याद रखने की कोशिश करते थे, और इसने 22 गुना कम डेटा टोकन का उपयोग किया।
  • निर्देश ट्रैकिंग: रोबोट निर्देशों की एक लंबी सूची में बेहतर तरीके से समझ सका कि वह कहाँ था (जैसे, "मैंने पहला भाग कर लिया है, अब मुझे दूसरा भाग करना है") क्योंकि वह जानता था कि वहाँ पहुँचने के लिए उसने वास्तव में कैसे गति की थी।

सारांश

BIT-Nav रोबोट को पुराने फोटो देखकर यात्रा को याद रखने के बजाय, अपनी गति को समझकर याद रखना सिखाता है। एक लंबे, जटिल पथ को एक एकल, स्मार्ट "मेमोरी टोकन" में संकुचित करके, यह रोबोट को बिना रास्ता भटके या मेमोरी खत्म किए लंबी दूरी तय करने की अनुमति देता है, और यह सब उसके शक्तिशाली AI दिमाग की भाषा में ही करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →