← नवीनतम पेपर
🤖 AI

Policy-Guided World Model Planning for Language-Conditioned Visual Navigation

यह शोध पत्र PiJEPA प्रस्तुत करता है, जो एक दो-चरणीय ढांचा (framework) है जो एक फाइन-ट्यून्ड पॉलिसी का उपयोग करके JEPA वर्ल्ड मॉडल पर MPPI प्लानिंग को वॉर्म-स्टार्ट करके भाषा-सशर्त विजुअल नेविगेशन को बेहतर बनाता है, जिससे मौजूदा विधियों की तुलना में बेहतर लक्ष्य-पहुंच सटीकता और निर्देश-अनुपालन निष्ठा प्राप्त होती है।

मूल लेखक: Amirhosein Chahe, Lifeng Zhou

प्रकाशित 2026-03-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Amirhosein Chahe, Lifeng Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के माध्यम से चलकर किसी विशिष्ट वस्तु को खोजने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं, जैसे कि "किचन काउंटर पर रखा लाल मग," जो एक वॉयस कमांड (आवाज़ के निर्देश) पर आधारित हो। यह एक कठिन काम है क्योंकि रोबोट को यह देखना होगा कि उसके सामने क्या है, शब्दों को समझना होगा, और बिना दीवारों से टकराए या रास्ता भटके सबसे अच्छा रास्ता तय करना होगा।

यह पेपर एक नई प्रणाली पेश करता है जिसे PiJEPA (पॉलिसी-गाइडेड JEPA प्लानिंग) कहा जाता है, जो इस समस्या को हल करने के लिए दो विशेषज्ञों की एक टीम की तरह काम करता है: एक तेज़ सहज ड्राइवर (Fast Instinctive Driver) और एक रणनीतिक नेविगेटर (Strategic Navigator)।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: दो दोषपूर्ण दृष्टिकोण

PiJEPA से पहले, रोबॉल आमतौर पर नेविगेट करने के दो तरीकों में से एक का प्रयास करते थे, और दोनों में बड़ी कमजोरियां थीं:

  • "तेज़ सहज ड्राइवर" (रिएक्टिव पॉलिसी):
    इसे एक ऐसे टैक्सी ड्राइवर की तरह सोचें जो त्वरित मोड़ लेने और अभी के ट्रैफिक लाइट पर प्रतिक्रिया देने में माहिर है। यदि आप कहते हैं "बाएं मुड़ें," तो वे तुरंत ऐसा करते हैं। हालाँकि, यदि आप उनसे किसी विशिष्ट पते पर 20 मील जाने के लिए कहते हैं, तो वे रास्ता भटक सकते हैं क्योंकि वे पूरे सफर के बारे में नहीं सोच रहे हैं, बल्कि केवल अगले सेकंड के बारे में सोच रहे हैं। उनमें "दीर्घकालिक दृष्टि" (long-term vision) की कमी है।
  • "रणनीतिक नेविगेटर" (वर्ल्ड मॉडल प्लानिंग):
    यह एक GPS की तरह है जो आपके शुरू करने से पहले ही अपने दिमाग में हजारों संभावित मार्गों का अनुकरण (simulate) करता है। यह लंबी यात्रा की योजना बनाने में बहुत अच्छा है। लेकिन, इसमें एक बड़ा दोष है: इसे यह नहीं पता होता कि तलाश कहाँ से शुरू करनी है। कल्पना कीजिए कि आप GPS से एक कॉफी शॉप खोजने के लिए कहते हैं, लेकिन वह शहर की हर सड़क पर बेतरतीब ढंग से अनुमान लगाना शुरू कर देता है। वह गलत रास्तों का अनुमान लगाने में इतना समय बर्बाद करता है कि बैटरी खत्म होने से पहले वह कॉफी शॉप तक कभी नहीं पहुँच पाता।

2. समाधान: PiJEPA (एक परफेक्ट टीम-अप)

PiJEPA इन दोनों को एक सुपर-टीम में जोड़ता है। यह रणनीतिक नेविगेटर को "हेड स्टार्ट" (शुरुआती बढ़त) देने के लिए तेज़ ड्राइवर का उपयोग करता है।

यहाँ एक उपमा (analogy) का उपयोग करके चरण-दर-चरण प्रक्रिया दी गई है:

चरण 1: "वार्म स्टार्ट" (सहज ड्राइवर)

सबसे पहले, रोबोट आपके कमांड को सुनता है ("सीढ़ियों पर जाओ") और कमरे को देखता है। वह अपने तेज़ सहज ड्राइवर (एक प्री-ट्रेन्ड AI जिसे 'Octo' कहा जाता है) से सलाह मांगता है।

  • ड्राइवर केवल एक रैंडम मूव नहीं चुनता; वह कहता है, "जो मैं देख रहा हूँ, उसके आधार पर, सबसे अच्छा पहला कदम आगे और थोड़ा बाईं ओर जाना होने की 90% संभावना है।"
  • यह नेविगेटर को आशाजनक दिशाओं की एक "शॉर्टलिस्ट" देता है।

चरण 2: "रणनीतिक सिमुलेशन" (नेविगेटर)

अब, रणनीतिक नेविगेटर (वर्ल्ड मॉडल) उस शॉर्टलिस्ट को लेता है। बेतरतीब दिशाओं (जैसे "दीवार में पीछे की ओर जाना") का अनुमान लगाकर समय बर्बाद करने के बजाय, यह केवल उन रास्तों का अनुकरण करता है जो ड्राइवर के सुझावों से शुरू होते हैं।

  • यह एक मानसिक सिमुलेशन चलाता है: "यदि मैं आगे-बाएं जाता हूँ, तो 5 सेकंड में कमरा कैसा दिखेगा? क्या मैं सीढ़ियों से टकरा जाऊंगा?"
  • क्योंकि इसकी शुरुआत एक अच्छे अनुमान के साथ हुई है, यह पथ को पूरी तरह से परिष्कृत (refine) करने में सक्षम है, न कि संभावनाओं के पूरे ब्रह्मांड को खोजने में।

चरण 3: निष्पादन (Execution)

रोबोट इस परिष्कृत, सटीक पथ का पहला कदम उठाता है, आगे बढ़ता है, और फिर अगले कदम के लिए पूरी प्रक्रिया को दोहराता है।

3. गुप्त नुस्खा: "फ्रोजन आइज़" (Frozen Eyes)

पेपर में रोबोट के लिए विशेष "आंखों" (विज़न एनकोडर) का उपयोग करने का भी उल्लेख है। उन्होंने दो प्रकारों का परीक्षण किया:

  • DINOv2: एक हाई-रिज़ॉल्यूशन कैमरे की तरह जो एक सिंगल फोटो में आकृतियों और वस्तुओं को पहचानने में अद्भुत है।
  • V-JEPA-2: एक वीडियो कैमरे की तरह जो समझता है कि समय के साथ चीजें कैसे चलती हैं।

शोधकर्ताओं ने पाया कि जबकि वीडियो कैमरा (V-JEPA-2) गति के प्रवाह को समझने में बेहतर था, टीम तब सबसे अच्छा काम करती थी जब "ड्राइवर" और "नेविगेटर" दोनों एक ही प्रकार की आंखों का उपयोग कर रहे हों। यह सुनिश्चित करता है कि वे जो देखते हैं, उसके बारे में वे एक ही भाषा बोल रहे हैं।

4. यह क्यों महत्वपूर्ण है

परिणामों ने दिखाया कि यह टीम-अप दृष्टिकोण अकेले किसी भी विशेषज्ञ की तुलना में बहुत बेहतर था।

  • सटीकता (Accuracy): रोबोट अपने लक्ष्य तक बहुत अधिक बार पहुँचा।
  • गति (Speed): इसने गलत रास्तों का अनुमान लगाने में समय बर्बाद नहीं किया।
  • विश्वसनीयता (Reliability): भले ही निर्देश अस्पष्ट थे (जैसे "इमारत का पीछा करें" जब वहां तीन इमारतें हों), ड्राइवर के शुरुआती अनुमान ने नेविगेटर को पूरी तरह से फंसने से बचने में मदद की।

निचोड़ (The Bottom Line)

PiJEPA एक स्थानीय गाइड (पॉलिसी) को काम पर रखने जैसा है जो इलाके को अच्छी तरह जानता है और आपको सही दिशा दिखाने के लिए है, और फिर वहां से एक परफेक्ट, बाधा-मुक्त मार्ग मैप करने के लिए एक टूर प्लानर (वर्ल्ड मॉडल) को काम पर लेना है। स्थानीय गाइड को प्लानर को "वार्म स्टार्ट" देने देकर, रोबोट कम गलतियों के साथ, तेजी से और अधिक समझदारी से नेविगेट करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →