← नवीनतम पेपर
💻 computer science

NaviTrace: Evaluating Embodied Navigation of Vision-Language Models

यह शोध पत्र NaviTrace को प्रस्तुत करता है, जो विविध परिदृश्यों और एम्बॉडमेंट प्रकारों में 3000 से अधिक विशेषज्ञ नेविगेशन ट्रेसेस (navigation traces) वाला एक उच्च-गुणवत्ता वाला विजुअल क्वेश्चन अनस्वर्सिंग (Visual Question Answering) बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान विजन-लैंग्वेज मॉडल एक नवीन सिमेंटिक-अवेयर ट्रेस स्कोर (semantic-aware trace score) के साथ मूल्यांकन किए जाने पर स्थानिक ग्राउंडिंग (spatial grounding) और लक्ष्य स्थानीयकरण (goal localization) में अभी भी मानव प्रदर्शन से पीछे हैं।

मूल लेखक: Tim Windecker, Manthan Patel, Moritz Reuss, Richard Schwarzkopf, Cesar Cadena, Rudolf Lioutikov, Marco Hutter, Jonas Frey

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tim Windecker, Manthan Patel, Moritz Reuss, Richard Schwarzkopf, Cesar Cadena, Rudolf Lioutikov, Marco Hutter, Jonas Frey

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बुद्धिमान लेकिन अनुभवहीन पर्यटक को एक नए शहर में रास्ता दिखाने के लिए सिखा रहे हैं। आप उसे एक सड़क की फोटो दिखाते हैं और कहते हैं, "उस लाल कार तक जाओ।" एक मानव पर्यटक उस फोटो को देखेगा, कार को पहचानेगा, सीढ़ियों को देखेगा, "आगे न बढ़ें" (Do Not Walk) का संकेत देखेगा, और फोटो पर एक रास्ता बनाएगा जो बिल्कुल दिखाएगा कि कहाँ कदम रखना है।

यह शोध पत्र NaviTrace पेश करता है, जो एक नया "टेस्ट" है यह देखने के लिए कि क्या आधुनिक AI रोबोट (विशेष रूप से विजन-लैंग्वेज मॉडल्स) भी ऐसा ही कर सकते हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इस शोध पत्र का विवरण दिया गया है:

1. समस्या: "रोबोट पर्यटक" रास्ता भटक रहा है

रोबोट भाषा समझने और चित्रों को देखने में स्मार्ट होते जा रहे हैं। लेकिन जब आप किसी रोबोट को "नीचे की ओर जाओ" या "सड़क का पीछा करो" कहते हैं, तो हमें वास्तव में यह नहीं पता होता कि वह रास्ता खोजने में कितना कुशल है।

  • पुराना तरीका: रोबोटों का परीक्षण करने के लिए, शोधकर्ता उन्हें वास्तविक दुनिया में भेजते थे। यह एक ड्राइवर को टेस्ट करने जैसा है जैसे हर बार उसकी कुशलता जांचने के लिए उसे पूरे देश में गाड़ी चलाने के लिए भेजना। यह महंगा, धीमा और दोहराने में कठिन है।
  • सिमुलेशन का तरीका: अन्य लोग वीडियो गेम सिमुलेशन का उपयोग करते हैं। यह एक ड्राइवर को फ्लाइट सिम्युलेटर में टेस्ट करने जैसा है। यह सस्ता और दोहराने योग्य है, लेकिन गेम के "रास्ते" अक्सर बहुत सरल होते हैं, जिनमें वास्तविक दुनिया के विवरण जैसे ऊबड़-खाबड़ फुटपाथ या सामाजिक नियम (जैसे पैदल यात्री के लिए रुकना) गायब होते हैं।

2. समाधान: एक "कागज-और-पेंसिल" नेविगेशन परीक्षा

लेखकों ने NaviTrace बनाया है, जो रोबोट नेविगेशन के लिए एक मानकीकृत परीक्षा (standardized exam) की तरह है।

  • सेटअप: रोबोट को बाहर भेजने के बजाय, वे एक AI को वास्तविक दुनिया के दृश्य (जैसे व्यस्त सड़क या पार्क) की एक फोटो दिखाते हैं और उसे एक कमांड देते हैं (जैसे, "सड़क के अंत तक जाओ")।
  • ट्विस्ट: वे AI को फोटो पर सीधे एक 2D रेखा (एक "ट्रेस") खींचने के लिए कहते हैं, जो दिखाए कि एक विशिष्ट प्रकार के यात्री को कहाँ जाना चाहिए।
  • यात्री (Travelers): वे चार अलग-अलग "एम्बॉडीमेंट्स" (यात्रियों के प्रकार) का परीक्षण करते हैं:
    1. मानव (Human): कहीं भी चल सकता है लेकिन ऊंची दीवारों पर नहीं चढ़ सकता।
    2. लेग्ड रोबोट (Legged Robot): चार पैरों वाले कुत्ते की तरह; ऊबड़-खाबड़ जमीन को संभाल सकता है लेकिन छोटा होता है।
    3. व्हील्ड रोबोट (Wheeled Robot): डिलीवरी बॉट या व्हीलचेयर की तरह; इसे चिकने रास्तों और रैंप की आवश्यकता होती है।
    4. साइकिल (Bicycle): इसे सड़कों या साइकिल लेन पर रहना चाहिए; इसे सीढ़ियों से नफरत है।

3. ग्रेडिंग सिस्टम: एक "स्मार्ट रूलर"

आप एक ड्राइंग को कैसे ग्रेड करेंगे? आप केवल शुरुआत से अंत तक की दूरी नहीं माप सकते। लेखकों ने एक विशेष स्कोरिंग सिस्टम बनाया है जो एक स्मार्ट रूलर की तरह काम करता है:

  • आकार का मिलान (Shape Match): क्या खींची गई रेखा वैसी ही है जैसा कि एक मानव विशेषज्ञ द्वारा बनाया गया पथ होगा? (वे आकार की तुलना करने के लिए "डायनेमिक टाइम वार्पिंग" नामक एक गणितीय ट्रिक का उपयोग करते हैं)।
  • लक्ष्य की जाँच (Goal Check): क्या रेखा वास्तव में गंतव्य तक पहुँची?
  • "वहाँ मत जाओ" पेनल्टी (The "Don't Go There" Penalty): यह सबसे चतुर हिस्सा है। सिस्टम जानता है कि फोटो में क्या चीजें हैं (जैसे घास, सीढ़ियाँ, व्यस्त सड़क)। यदि AI एक व्हीलचेयर के लिए एक सीढ़ी पर जाने का रास्ता बनाता है, तो सिस्टम उसे भारी पेनल्टी देता है। यदि वह एक मानव के लिए साइकिल लेन पर चलने का रास्ता बनाता है, तो उसे छोटी पेनल्टी मिलती है।

4. परिणाम: AI स्मार्ट है, लेकिन "ग्राउंडेड" नहीं है

लेखकों ने शीर्ष-स्तरीय AI मॉडल्स (जैसे Gemini, GPT-5 और अन्य) का मानव विशेषज्ञों के मुकाबले परीक्षण किया।

  • अंतर (The Gap): मनुष्यों का स्कोर लगभग 75/100 था। सर्वश्रेष्ठ AI मॉडल्स का स्कोर लगभग 34/100 था। AI रैंडम अनुमान लगाने से बेहतर कर रहा है, लेकिन यह अभी भी इंसान से बहुत पीछे है।
  • मुख्य गलती: सबसे बड़ी समस्या यह नहीं है कि AI को यह नहीं पता कि कैसे चलना है; बल्कि यह है कि वह गंतव्य (destination) को नहीं खोज पाता।
    • उपमा: यदि आप AI को कहते हैं "लाल कार तक जाओ," तो वह अक्सर एक ऐसा रास्ता बनाता है जो देखने में तर्कसंगत लगता है लेकिन गलत कार पर समाप्त होता है, या वह एक ऐसा रास्ता बनाता है जो मैप से बाहर चला जाता है।
    • जब शोधकर्ताओं ने AI को केवल गंतव्य का अनुमान लगाने के लिए मजबूर किया और वहां तक एक सीधी रेखा खींची, तो स्कोर में अधिक सुधार नहीं हुआ। इसका मतलब है कि AI फोटो में चीजों के स्थान को समझने में संघर्ष कर रहा है, न कि केवल यह कि कैसे हिलना है।
  • "रीज़निंग" का जाल (The "Reasoning" Trap): कुछ AI मॉडल्स (जैसे o3) ने टेक्स्ट में एकदम सटीक तार्किक चरण लिखे: "मुझे बाईं ओर जाना चाहिए, सीढ़ियों से बचना चाहिए, और कार की ओर बढ़ना चाहिए।" हालांकि, जब उन्होंने वास्तव में रेखा खींची, तो उन्होंने अपने स्वयं के टेक्स्ट को अनदेखा कर दिया और एक ऐसा रास्ता बनाया जो दीवार के अंदर चला गया। AI का "दिमाग" (टेक्स्ट) और उसकी "आंखें" (ड्राइंग) आपस में ठीक से बात नहीं कर पा रहे हैं।

5. यह क्यों मायने रखता है

यह शोध पत्र तर्क देता है कि इससे पहले कि हम रोबोटों पर पैकेज डिलीवर करने, बुजुर्गों की मदद करने या जीवित बचे लोगों की तलाश करने के लिए भरोसा कर सकें, हमें एक ऐसे तरीके की आवश्यकता है जिससे उन्हें टेस्ट किया जा सके जो निष्पक्ष, सस्ता और वास्तविक दुनिया की जटिलताओं को कवर करने वाला हो। NaviTrace वह टेस्ट प्रदान करता है। यह हमें दिखाता है कि हालांकि AI बातचीत करने और वस्तुओं को पहचानने में महान है, फिर भी यह दुनिया को इस तरह से "देखने" में संघर्ष करता है जिससे वह सुरक्षित और तार्किक रूप से आगे बढ़ सके।

संक्षेप में: यह शोध पत्र एक नेविगेशन टेस्ट बनाता है जहाँ रोबोट को एक फोटो पर नक्शा बनाना होता है। परिणाम बताते हैं कि हालांकि रोबट बेहतर हो रहे हैं, फिर भी वे रास्ता खोजने में बहुत खराब हैं और अक्सर सड़क के भौतिक नियमों (जैसे व्हीलचेयर के लिए सीढ़ियाँ) को अनदेखा कर देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →