← नवीनतम पेपर
💻 computer science

VISTA: Scale-Aware Visual Navigation via Action History Conditioning

VISTA एक विज़न-आधारित नेविगेशन फाउंडेशन मॉडल है जो स्केलिंग कमजोरियों को दूर करने के लिए सामान्यीकृत एक्शन हिस्ट्री (normalized action histories) पर आधारित होकर और बेहतर ज्यामितीय समझ के लिए DINOv3 एनकोडर का लाभ उठाकर विविध, दृष्टिगत रूप से दोहराव वाले वातावरणों में ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization) और सुरक्षा में सुधार करता है।

मूल लेखक: Maeva Guerrier, Koki Kobayashi, Simon Roy, Jana Pavlasek, Giovanni Beltrame

प्रकाशित 2026-06-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maeva Guerrier, Koki Kobayashi, Simon Roy, Jana Pavlasek, Giovanni Beltrame

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को जंगल, एक ऑफिस या एक खुले मैदान में चलना सिखा रहे हैं, बिना उसे कभी कोई नक्शा दिखाए या उस सटीक जगह के लिए कोई विशिष्ट निर्देश दिए। आप चाहते हैं कि रोबोट दूसरे रोबोट्स के चलने के वीडियो देखकर सीखे, ताकि वह खुद से "शुरुआत" (Start) से "अंत" (Finish) तक पहुँचने का तरीका समझ सके। इसे ही यह पेपर विजुअल नेविगेशन (Visual Navigation) कहता है।

शोधकर्ताओं ने एक नया सिस्टम बनाया है जिसे VISTA (स्केल-अवेयर विजुअल नेविगेशन वाया एक्शन हिस्ट्री कंडीशनिंग) कहा जाता है। यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

समस्या: "ज़ूम-इन" वाली उलझन

अधिकांश वर्तमान रोबोट नेविगेशन मॉडल उन छात्रों की तरह हैं जो केवल कागज के टुकड़े पर नक्शा बनाना सीखते हैं, लेकिन वे कभी यह नहीं सीखते कि वह कागज वास्तव में कितना बड़ा है।

  • समस्या: ये मॉडल एक पथ (path) की भविष्यवाणी छोटे, नॉर्मलाइज्ड कदमों की एक श्रृंखला के रूप में करते हैं (जैसे कहना "10 कदम आगे बढ़ें")। लेकिन वास्तविक दुनिया में, एक छोटे खिलौना रोबोट के लिए "एक कदम" एक विशाल ट्रक के "कदम" से बहुत अलग होता है।
  • खराबी: यदि आप रोबोट को "10 कदम चलें" कहते हैं, लेकिन आप उसे यह नहीं बताते कि एक कदम कितना लंबा है, तो वह गलत अनुमान लगा सकता है। यदि वह अनुमान लगाता है कि कदम बहुत लंबा है, तो वह दीवार से टकरा सकता है। यदि वह अनुमान लगाता है कि कदम बहुत छोटा है, तो वह रास्ता भटक सकता है। पेपर इसे स्केल वल्नरेबिलिटी (scale vulnerability) कहता है। रोबोट तस्वीर तो देखता है, लेकिन उसे यह नहीं पता होता कि वह जिस दुनिया में चल रहा है उसका आकार क्या है।

समाधान: VISTA की दो महाशक्तियाँ

इसे ठीक करने के लिए, लेखकों ने VISTA को दो विशेष उपकरण दिए:

1. "कदमों की स्मृति" (एक्शन हिस्ट्री कंडीशनिंग)

कल्पना कीजिए कि आप एक गलियारे में चल रहे हैं। यदि आप केवल अपने सामने की दीवार को देखते हैं, तो आपको यह नहीं पता चलेगा कि आप तेज़ चल रहे हैं या धीरे। लेकिन यदि आपको याद रहे, "मैंने पिछले एक सेकंड में तीन कदम लिए थे," तो आप समझ सकते हैं कि आप कितनी गति से चल रहे हैं।

  • VISTA कैसे करता है: केवल वर्तमान कैमरा इमेज देखने के बजाय, VISTA अपने पिछले कदमों के इतिहास को देखता है। वह याद रखता है, "मैंने अभी-अभी X की नॉर्मलाइज्ड दूरी तय की है।"
  • परिणाम: अपने पिछले कदमों की तुलना वर्तमान दृश्य से करके, रोबोट अपने वास्तविक भौतिक आकार (real physical size) को समझ सकता है। वह जानता है, "आह, मैं उस मात्रा में चला था, इसलिए मेरा अगला कदम इतना लंबा होना चाहिए।" यह उसे गलत आकार का अनुमान लगाने और टकराने से रोकता है।

2. "सुपर-आई" (DINOv3 एनकोडर)

कुछ स्थान नेविगेट करना कठिन होते क्योंकि वे हर जगह एक जैसे दिखते हैं, जैसे एक लंबा गलियारा जिसमें समान दरवाजे हों या बर्फ से भरा मैदान जिसमें कोई पेड़ न हो। पुराने रोबोट की "आंखें" यहाँ भ्रमित हो जाती हैं और उन्हें लगता है कि वे एक ही समय में दो अलग-अलग जगहों पर हैं।

  • VISTA कैसे करता है: शोधकर्ताओं ने VISTA को एक नया प्रकार का कैमरा मस्तिष्क दिया जिसे DINOv3 कहा जाता है। इसे एक उन्नत आंख के रूप में सोचें जो केवल "एक दरवाजा" नहीं देखती, बल्कि दरवाजे के आकार, बनावट और ज्यामिति (geometry) को और फर्श एवं छत के साथ उसके संबंध को समझती है।
  • परिणाम: उबाऊ और दोहराव वाले स्थानों में भी, VISTA "दरवाजा #1" और "दरवाजा #3" के बीच अंतर कर सकता है, जिससे वह रास्ता भटकने से बच जाता है।

प्रमाण: वास्तविक दुनिया के परीक्षण

टीम ने VISTA का परीक्षण केवल कंप्यूटर पर ही नहीं, बल्कि वास्तविक दुनिया में भी किया। उन्होंने इसे तीन बहुत अलग जगहों पर भेजा बिना पहले से कुछ भी सिखाए (इसे जीरो-शॉट डिप्लॉयमेंट कहा जाता है):

  1. खुला मैदान: झाड़ियों वाला एक घास का क्षेत्र।
  2. जंगल: पेड़ों, लट्ठों और पत्तों वाली एक अव्यवस्थित जगह।
  3. ऑफिस-लैब: कई समान दरवाजों और तंग कोनों वाला एक जटिल गलियारा।

परिणाम:

  • VISTA ने आउटडोर, फॉरेस्ट और ऑफिस सेटिंग्स में सभी परीक्षणों में 100% सफलता के साथ लक्ष्य तक पहुँचने में सफलता प्राप्त की। इसने तंग कोनों को पार किया और हर बार सही दरवाजा ढूँढा।
  • पुराने मॉडल (जैसे ViNT या NoMaD): वे संघर्ष करते रहे। वे अक्सर दीवारों से टकरा जाते थे, समान दरवाजों के बीच रास्ता भटक जाते थे, या सही समय पर रुकने में विफल रहते थे। वे अपने मूवमेंट के "स्केल" को समझने में असमर्थ थे।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि किसी रोबट को कहीं भी सुरक्षित रूप से चलने के लिए, उसे दो चीजों की आवश्यकता होती है:

  1. अच्छी आंखें: दुनिया के आकार को समझने के लिए (जो DINOv3 द्वारा प्रदान किया गया है)।
  2. स्केल का बोध: यह जानने के लिए कि उसके अपने मूवमेंट कितने बड़े हैं (जो उसके पिछले कदमों को याद रखने से प्राप्त होता है)।

इन दोनों के बिना, रोबोट एक ऐसे ड्राइवर की तरह है जिसके पास बेहतरीन GPS तो है लेकिन उसे यह नहीं पता कि वह कितनी गति से गाड़ी चला रहा है—वह अंततः दुर्घटनाग्रस्त हो जाएगा। VISTA इन दोनों को जोड़ता है, जिससे यह बिना किसी मैनुअल या नक्शे के, नई और अनदेखी जगहों पर चलने में सक्षम होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →