← नवीनतम पेपर
💻 computer science

GroundControl: Anticipating Navigation Failures in Vision-Language Agents via Trajectory-Consistent Uncertainty Estimates

यह शोधपत्र GroundControl को प्रस्तुत करता है, जो एक प्रक्षेपवक्र-सुसंगत (trajectory-consistent) अनिश्चितता अनुमानक है जो लक्ष्य-निर्देशित दूरी गतिकी (goal-directed distance dynamics) से विचलन को मॉडल करके विजन-लैंग्वेज एजेंटों में नेविगेशन विफलताओं का पूर्वानुमान लगाता है, और एक नए सिलेक्टिव रिस्क-कवरेज नेविगेशन (SRCN) प्रोटोकॉल के माध्यम से विफलता या अक्षमता के आधार पर प्रकरणों (episodes) को रैंक करने में मौजूदा बेसलाइन की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Nastaran Darabi, Divake Kumar, Sina Tayebati, Devashri Naik, Amit Ranjan Trivedi

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nastaran Darabi, Divake Kumar, Sina Tayebati, Devashri Naik, Amit Ranjan Trivedi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

द बिग पिक्चर: "कन्फ्यूज्ड टूरिस्ट" (भटका हुआ पर्यटक) की समस्या

कल्पना कीजिए कि आप एक रोबोट (एक "विज़न-लैंग्वेज एजेंट") को खजाने की खोज (scavenger hunt) पर भेज रहे हैं। आप उसे एक नक्शा और एक वॉयस इंस्ट्रक्शन देते हैं: "लिविंग रूम में लाल कुर्सी के पास जाओ।"

रोबोट स्मार्ट है। वह कमरे को देख सकता है और आपकी बातों को समझ सकता है। हालाँकि, कभी-कभी वह भ्रमित हो जाता है। वह गोल-गोल घूम सकता है, किसी नकली कुर्सी को घूरते हुए अटक सकता है, या गलत दिशा में भटक सकता है।

समस्या यह है कि वर्तमान रोबोट अपनी गलती मानने में बुरे होते हैं। वे अपने द्वारा उठाए गए हर एक कदम के बारे में बहुत आश्वस्त महसूस कर सकते हैं, भले ही वे कदम उन्हें गोल-गोल घुमा रहे हों। उन्हें तब तक पता नहीं चलता कि वे असफल हो रहे हैं जब तक कि उनकी बैटरी या समय खत्म नहीं हो जाता।

GroundControl एक नया "सेफ्टी मॉनिटर" है जिसे इन विफलताओं को होते समय पकड़ने के लिए डिज़ाइन किया गया है, न कि रोबोट के क्रैश होने के बाद।


GroundControl कैसे काम करता है: "स्पीडोमीटर" का उदाहरण

यह पूछने के बजाय कि, "क्या आप इस विशिष्ट कदम को लेकर भ्रमित हैं?" (जैसा कि पुराने तरीके करते हैं), GroundControl पूछता है, "क्या आपकी पूरी यात्रा समझ में आ रही है?"

रोबोट की यात्रा को एक मंजिल तक जाने वाली कार यात्रा की तरह समझें।

  • लक्ष्य: लाल कुर्सी।
  • सिग्नल: कुर्सी तक की दूरी।

एक आदर्श यात्रा में, लक्ष्य तक की दूरी सुचारू रूप से और लगातार कम होनी चाहिए, जैसे कोई कार एक सीधे हाईवे पर चल रही हो।

GroundControl एक कलमन फ़िल्टर (Kalman Filter) (एक फैंसी गणित उपकरण) का उपयोग करता है जो एक प्रेडिक्टिव स्पीडोमीटर की तरह काम करता है। यह भविष्यवाणी करता है: "यदि आप लक्ष्य की ओर जा रहे हैं, तो आपकी दूरी हर सेकंड X मात्रा में कम होनी चाहिए।"

अगर रोबत कुछ अजीब करने लगता है, तो स्पीडोमीटर चिल्ला उठता है:

  1. ऑसिलेशन (Oscillation): रोबोट आगे-पीछे (back and forth) जा रहा है (दूरी ऊपर जाती है, फिर नीचे आती है, फिर ऊपर जाती है)।
  2. स्टैग्नेशन (Stagnation): रोबोट ट्रैफिक में फंसा हुआ है (दूरी बदल नहीं रही है)।
  3. डेटोर्स (Detours): रोबोट एक बड़े घेरे में घूम रहा है (दूरी पर्याप्त तेज़ी से कम नहीं हो रही है)।

GroundControl एक "कन्फ्यूजन स्कोर" (Confusion Score) की गणना करता है कि रोबोट का वास्तविक पथ इस सुचारू, अनुमानित रेखा से कितना विचलित होता है। यदि स्कोर अधिक हो जाता है, तो इसका मतलब है कि रोबोट का व्यवहार ज्यामितीय रूप से असंगत (geometrically inconsistent) है—संभावना है कि वह असफल हो रहा है, भले ही उसे लग रहा हो कि वह बहुत अच्छा काम कर रहा है।

स्कोर के घटक (Ingredients)

GroundControl केवल स्पीडोमीटर को नहीं देखता; यह पूरी ड्राइविंग रिपोर्ट को देखता है:

  • गणित (Kalman Filter): क्या दूरी उम्मीद के अनुसार बदली?
  • प्रगति (Progress): क्या हम वास्तव में लक्ष्य के करीब पहुंचे?
  • मोनोटनी (Monotony): क्या दूरी लगातार कम होती गई, या यह ऊपर-नीचे होती रही?
  • दक्षता (Efficiency): क्या हमने सीधा रास्ता लिया, या हम इधर-उधर भटकते रहे?
  • वबुल (Wobble): क्या रोबोट बार-बार बाएं और दाएं मुड़ता रहा?

यह इन सभी को एक संख्या में जोड़ देता है। कम संख्या का अर्थ है "स्मूथ सेलिंग" (सुचारू यात्रा)। उच्च संख्या का अर्थ है "हम नियंत्रण से बाहर हो रहे हैं।"

उन्होंने इसका परीक्षण कैसे किया: "सिलेक्टिव रिस्क" गेम

यह साबित करने के लिए कि उनका सिस्टम काम करता है, शोधकर्ताओं ने एक नया तरीका विकसित किया जिसे SRCN (Selective Risk-Coverage Navigation) कहा जाता है।

कल्पना कीजिए कि एक शिक्षक 100 छात्रों (रोबोट एपिसोड्स) की एक क्लास को ग्रेड दे रहा है।

  • पुराना तरीका: शिक्षक अंत तक प्रतीक्षा करता है कि कौन पास हुआ और कौन फेल।
  • GroundControl का तरीका: शिक्षक टेस्ट के दौरान "कन्फ्यूजन स्कोर" को देखता है।
    • यदि किसी छात्र का स्कोर बहुत अधिक हो जाता है, तो शिक्षक कहता है, "रुको! तुम फेल होने वाले हो।"
    • फिर शिक्षक जाँच करता है: "क्या मैंने सही छात्रों को रोका?"

यदि शिक्षक फेल होने वाले छात्रों को जल्दी रोक देता है और पास होने वाले छात्रों को जारी रहने देता है, तो यह एक परफेक्ट स्कोर है। पेपर दिखाता है कि GroundControl इसमें अविश्वसनीय रूप से अच्छा है। यह विफलता की भविष्यवाणी लगभग उतनी ही अच्छी तरह कर सकता है जितनी कि एक "जादुई क्रिस्टल बॉल" (जिसे वे "ओरेकल" कहते हैं) कर सकती है।

परिणाम: यह क्यों मायने रखता है

शोधकर्ताओं ने तीन अलग-अलग "दिमागों" (AI मॉडल: GPT-4o, GPT-5-mini, और Gemini-1.5-Flash) पर 300 विभिन्न नेविगेशन कार्यों में इसका परीक्षण किया।

  • विजेता: GroundControl ने लगातार फेल होने वाले रोबोट्स को सबसे पहले खोजा। यह अन्य तरीकों की तुलना में बहुत बेहतर था जो केवल यह देखते थे कि रोबोट अपने अगले कदम को लेकर कितना "अनिश्चित" महसूस कर रहा है।
  • हारने वाले: पुराने तरीके (जैसे यह देखना कि रोबोट अपने अगले कदम को लेकर अनिश्चित है या नहीं) अक्सर विफलताओं को मिस कर देते थे। रोबोट अपने अगले कदम को लेकर बहुत आश्वस्त हो सकता था कि वह बाएं मुड़ रहा है, भले ही वह बाएं मुड़ना गलत कदम हो जो क्रैश की ओर ले जाए।
  • लॉन्ग हॉल (Long Haul): GroundControl लंबे, कठिन कार्यों में विफलताओं को पकड़ने में विशेष रूप से अच्छा था जहाँ गलतियाँ समय के साथ जमा होती रहती हैं।

सारांश

GroundControl नेविगेशन रोबोट के लिए एक को-पायलट की तरह है। यह पूछने के बजाय कि, "क्या आप इस मोड़ के बारे में सुनिश्चित हैं?" यह पूछता है, "क्या आपका पूरा रास्ता लक्ष्य की ओर एक सीधी रेखा जैसा दिखता है?"

यदि रास्ता डगमगाता हुआ, फंसा हुआ या गोलाकार दिखता है, तो GroundControl अलार्म बजा देता है। यह सिस्टम को यह जानने की अनुमति देता है कि वह विफल हो रहा है, इससे पहले कि उसका समय समाप्त हो जाए, जिससे रोबोट अधिक सुरक्षित और विश्वसनीय बनते हैं।

मुख्य बात: सफलता केवल अगले कदम के लिए सही निर्णय लेने के बारे में नहीं है; यह इस बारे में भी है कि क्या पूरी यात्रा सही दिशा में बढ़ रही है। GroundControl पूरी यात्रा को देखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →