← नवीनतम पेपर
💬 NLP

VLN-NF: Feasibility-Aware Vision-and-Language Navigation with False-Premise Instructions

यह शोध पत्र VLN-NF को प्रस्तुत करता है, जो विज़न-एंड-लैंग्वेज नेविगेशन में गलत-आधारित निर्देशों (false-premise instructions) को संभालने के लिए एक बेंचमार्क और मूल्यांकन मीट्रिक है, साथ ही इसमें ROAM एजेंट भी शामिल है जो प्रभावी ढंग से नेविगेट, अन्वेषण और उन अनुपस्थित लक्ष्यों की सही पहचान करता है जहाँ पारंपरिक विधियाँ विफल हो जाती हैं।

मूल लेखक: Hung-Ting Su, Ting-Jun Wang, Jia-Fong Yeh, Min Sun, Winston H. Hsu

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hung-Ting Su, Ting-Jun Wang, Jia-Fong Yeh, Min Sun, Winston H. Hsu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप "रोबो" (Robo) नाम के एक रोबोट बटलर हैं। आपका मानव मालिक आपको एक सरल निर्देश देता है: "रसोई में जाओ और मेज पर रखी लाल प्लेट उठा लो।"

पारंपरिक रोबोट प्रशिक्षण की दुनिया में, वैज्ञानिक यह मान लेते हैं कि मालिक हमेशा सही होता है। वे मानते हैं कि लाल प्लेट निश्चित रूप से वहीं है। इसलिए, वे रोबो को जितनी जल्दी हो सके रसोई की ओर दौड़ने, जो भी पहली प्लेट दिखे उसे उठाने और "हो गया!" कहने के लिए प्रशिक्षित करते हैं।

लेकिन वास्तविक जीवन में, इंसान गलतियाँ करते हैं। हो सकता है कि प्लेट वास्तव में लिविंग रूम में हो, या शायद मालिक प्लेट धोकर डिशवॉशर में रख चुका हो और वह भूल गया हो। यदि रोबो रसोई की ओर दौड़ता है, इधर-उधर देखता है, उसे कोई लाल प्लेट नहीं मिलती, और फिर भी किसी रैंडम कटोरे को उठा लेता है क्योंकि उसे "हार न मानने" के लिए प्रशिक्षित किया गया था, तो वह एक बुरा रोबोट है। वह भ्रमित (hallucinating) हो रहा है।

यह शोध पत्र रोबोट्स को इन "ओप्स" (गलती वाले) क्षणों को संभालने के लिए प्रशिक्षित करने का एक नया तरीका पेश करता है। यहाँ इसका विवरण दिया गया है:

1. नई परीक्षा: "VLN-NF" (द "नॉट फाउंड" एग्जाम)

शोधकर्ताओं ने रोबोट्स के लिए एक नई परीक्षा बनाई है जिसे VLN-NF कहा जाता है।

  • सेटअप: वे सामान्य निर्देशों को लेते हैं और गुप्त रूप से लक्ष्य (target) को किसी ऐसी चीज़ से बदल देते हैं जो उस कमरे में मौजूद नहीं है
    • पुराना निर्देश: "लाल प्लेट ढूँढो।" (वह वहाँ है)।
    • नया निर्देश: "नीला टोस्टर ढूँढो।" (वह वहाँ नहीं है)।
  • लक्ष्य: रोबोट को कमरे में प्रवेश करना चाहिए, सावधानी से चारों ओर देखना चाहिए, और यदि उसे नीला टोस्टर नहीं मिलता है, तो उसे आत्मविश्वास के साथ कहना चाहिए, "NOT FOUND" (नहीं मिला)
  • जाल: यदि रोबोट बस अंदाज़ा लगाकर "मिल गया!" कह देता है या बिना देखे जल्दी हार मान लेता है, तो वह इस टेस्ट में फेल हो जाता है।

2. उन्होंने यह टेस्ट कैसे बनाया (द "फेक न्यूज" फैक्ट्री)

इन नकली निर्देशों को हाथ से बनाना कठिन और उबाऊ काम है। इसलिए, टीम ने एक स्वचालित फैक्ट्री बनाई:

  • लेखक (LLM): एक स्मार्ट AI एक शरारती व्यक्ति की तरह काम करता है। यह एक वास्तविक निर्देश ("लैंप ढूँढो") लेता है और वस्तु को किसी ऐसी चीज़ से बदल देता है जो तर्कसंगत लगे लेकिन वहां मौजूद न हो ("पियानो ढूँढो")।
  • फैक्ट-चेकर (VLM): दूसरा AI एक सख्त संपादक की तरह काम करता है। यह कमरे को स्कैन करता है ताकि यह सुनिश्चित हो सके कि पियानो वास्तव में वहाँ नहीं है। यदि उसे पियानो दिखता है, तो वह निर्देश को खारिज कर देता है और फिर से प्रयास करता है।
  • परिणाम: ट्रिकी निर्देशों का एक विशाल संग्रह, जहाँ रोबोट को यह स्वीकार करना ही होगा कि वस्तु गायब है।

3. नया स्कोरकार्ड: "REV-SPL"

पुराने समय में, रोबोट्स को उनके गंतव्य तक पहुँचने की गति के आधार पर स्कोर दिया जाता था। लेकिन इस नए टेस्ट में, गति सब कुछ नहीं है।

  • उपमा: कल्पना कीजिए कि एक जासूस खोए हुए वॉलेट की तलाश कर रहा है।
    • पुराना स्कोर: क्या आप घर तक पहुँचे? (हाँ/नहीं)।
    • नया स्कोर (REV-SPL): क्या आप घर तक पहुँचे? क्या आपने सोफा, रसोई और बेडरूम चेक किया? और क्या आपने सही ढंग से रिपोर्ट किया, "यह यहाँ नहीं है," बजाय इसके कि आप केवल अंदाज़ा लगाएँ?
  • यह नया स्कोर उन रोबोट्स को पुरस्कृत करता है जो गहन (thorough) और ईमानदार होते हैं, और उन्हें दंडित करता है जो या तो बहुत जल्दी हार मान लेते हैं या कुछ खोजने का झूठ बोलते हैं।

4. समाधान: "ROAM" (द टू-स्टेज डिटेक्टिव)

शोधकर्ताओं ने पाया कि मौजूदा रोबोट इस मामले में बहुत खराब थे।

  • सुपरवाइज्ड रोबोट्स: वे सही कमरे तक पहुँचने में तो माहिर हैं लेकिन खोजने में बहुत खराब हैं। वे कमरे में घुसते हैं, वस्तु नहीं देखते, और तुरंत हार मान लेते हैं या अंदाज़ा लगाने लगते हैं।
  • AI चैटबॉट रोबोट्स: वे तर्क करने में अच्छे हैं ("शायद टोस्टर गैरेज में है?") लेकिन जटिल 3D घरों में बिना रास्ता भटके नेविगेट करने में बहुत खराब हैं।

ROAM (रूम-ऑब्जेक्ट अवेयर मूवमेंट) से मिलिए:
ROAM को एक दो-सदस्यीय जासूसी टीम के रूप में सोचें:

  1. नेविगेटर (द GPS): इस हिस्से को केवल रोबोट को सही कमरे (जैसे, रसोई) तक पहुँचाने के लिए प्रशिक्षित किया जाता है। यह अभी वस्तु की चिंता नहीं करता; यह बस आपको दरवाजे तक पहुँचा देता है।
  2. एक्सप्लोरर (द डिटेक्टिव): कमरे के अंदर पहुँचने के बाद, एक स्मार्ट AI कमान संभाल लेता है। यह एक विशेष "रडार" (जिसे FREE कहा जाता है) का उपयोग करता है यह देखने के लिए कि कितना खाली स्थान अभी भी खोजा जाना बाकी है।
    • "FREE" रडार: कल्पना कीजिए कि आप एक अंधेरे कमरे में हैं। आप केवल बेतरतीब ढंग से नहीं चलते। आप उस बड़े खुले स्थान को देखते हैं जिसे आपने अभी तक चेक नहीं किया है। यह रडार रोबोट को बताता है, "हे, वह कोना बहुत बड़ा और अन-सर्च किया हुआ है, वहाँ जाओ!"
    • यदि रोबोट सभी बड़े स्थानों की जाँच कर लेता है और फिर भी उसे वस्तु नहीं मिलती, तो वह आत्मविश्वास के साथ कहता है, "NOT FOUND"

5. परिणाम

जब उन्होंने इस नई टीम (ROAM) का पुराने रोबोट्स के मुकाबले परीक्षण किया:

  • पुराने रोबोट भ्रमित थे। या तो वे बहुत जल्दी हार मान लेते थे या अनंत काल तक खोजते रहते थे।
  • ROAM सबसे बेहतरीन छात्र साबित हुआ। यह कमरे में पहुँचा, अपने "रडार" का उपयोग करके गहन खोज की, और सही ढंग से पहचान लिया कि चीजें गायब थीं। इसने पिछले सर्वश्रेष्ठ रोबोट की तुलना में 45% बेहतर स्कोर किया।

बड़ी तस्वीर (The Big Picture)

यह शोध पत्र रोबोट्स को एक बहुत ही मानवीय कौशल सिखाता है: यह जानना कि आप क्या नहीं जानते।
आदेशों का आँख मूँदकर पालन करने के बजाय, रोबोट्स में यह कहने की क्षमता होनी चाहिए, "मैंने हर जगह देख लिया है, और यह यहाँ नहीं है। क्या आपका मतलब कहीं और का था?" यह रोबोट्स को सुरक्षित, अधिक विश्वसनीय और वास्तविक, गलतियों से भरी दुनिया के लिए तैयार बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →