← नवीनतम पेपर
🤖 AI

Path-level Hindsight Instructions for Semantic Exploration in Vision-Language Navigation

Phi-Nav एक एकीकृत ऑन-पॉलिसी फ्रेमवर्क है जो एक तीन-चरणीय ड्यूल-सप्रेशन चक्र को नियोजित करके विजन-लैंग्वेज नेविगेशन में सिमेंटिक मिसमैच को संबोधित करता है, जहाँ एक हिंडसाइट स्पीकर एजेंट के वास्तविक अन्वेषण पथ के साथ संरेखित पथ-स्तरीय निर्देशों को संश्लेषित करता है, जिससे काफी कम विशेषज्ञ प्रदर्शनों के साथ सुदृढ़ प्रशिक्षण सक्षम होता है।

मूल लेखक: Sung June Kim, Sangpil Kim, Honglak Lee

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sung June Kim, Sangpil Kim, Honglak Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को लिखित निर्देशों के एक सेट का उपयोग करके घर में नेविगेट करना सिखा रहे हैं। लक्ष्य यह है कि रोबोट एक वाक्य के आधार पर लिविंग रूम से किचन तक जाना सीख जाए, जैसे: "लिविंग रूम से बाहर निकलें, किचन में जाएँ, डाइनिंग टेबल को खोजें, और रुक जाएँ।"

समस्या: "गलत मोड़" की दुविधा (The "Wrong Turn" Dilemma)

अतीत में, रोबोटों को ऑफ-पॉलिसी लर्निंग (Off-Policy Learning) का उपयोग करके सिखाया जाता था। यह एक आदर्श पथ का नक्शा देने जैसा है और यह कहना कि, "बस इसे याद कर लो।" रोबोट कभी भटकता या गलतियाँ नहीं करता, इसलिए जब वह किसी नए घर में प्रवेश करता है, तो वह भ्रमित हो जाता है क्योंकि उसने गलतियों से उबरना नहीं सीखा होता है।

इसे ठीक करने के लिए, शोधकर्ताओं ने ऑन-पॉलिसी लर्निंग (On-Policy Learning) की ओर रुख किया। यहाँ, रोबोट को अपने स्वयं के निर्णय लेने और अन्वेषण करने की अनुमति दी जाती है। यदि वह गलत मोड़ लेता है, तो एक मानव शिक्षक (या एक "ओरेकल") हस्तक्षेप करता है और कहता है, "नहीं, इसके बजाय बाईं ओर जाओ।"

  • चूक (The Catch): रोबोट अपनी गलतियों से सीखता है, लेकिन उसे जो निर्देश दिए गए थे, वे वास्तव में उसके द्वारा लिए गए टेढ़े-मेढ़े रास्ते के लिए नहीं, बल्कि आदर्श पथ के लिए लिखे गए थे।
  • उपमा (The Analogy): कल्पना कीजिए कि रोबोट गलती से किचन के बजाय बेडरूम में चला जाता है। शिक्षक कहता है, "किचन में जाओ," लेकिन रोबोट एक बिस्तर को देख रहा है। निर्देश अब उस दृश्य वास्तविकता से मेल नहीं खाते जो रोबोट वास्तव में देख रहा है। रोबोट भ्रमित हो जाता है क्योंकि शब्द उस चीज़ का वर्णन नहीं करते जो वह वास्तव में देख रहा है।

समाधान: Φ-Nav (फाई-नैव)

इस विसंगति को हल करने के लिए लेखकों ने Φ-Nav नामक एक नया सिस्टम बनाया है। Φ-Nav को एक स्मार्ट अनुवादक (Smart Translator) के रूप में समझें जो रोबोट की यात्रा समाप्त होने के बाद कहानी को फिर से लिखता है।

यह तीन सरल चरणों में कैसे काम करता है:

  1. अन्वेषण (The Walk - सैर): रोबol घर में सैर करता है। वह मूल निर्देशों का पालन करने की कोशिश करता है लेकिन अनिवार्य रूप से कुछ गलत मोड़ लेता है या भटक जाता है। मानक प्रशिक्षण की तरह, उसे रास्ते में शिक्षक द्वारा सुधारा जाता है।
  2. "हाइंडसाइट" पुनर्लेखन (The Storyteller - कहानीकार): एक बार जब रोबोट अपनी सैर पूरी कर लेता है, तो एक शक्तिशाली AI (जिसे "हाइंडसाइट स्पीकर" कहा जाता है) रोबोट की वास्तविक यात्रा के वीडियो को देखता है। फिर यह निर्देशों का एक नया सेट लिखता है जो बिल्कुल सटीक रूप से वर्णन करता है कि रोबोट ने वास्तव में क्या देखा और क्या किया।
    • मूल निर्देश: "किचन में जाओ।"
    • हाइंडसाइट निर्देश (यदि रोबोट बेडरूम में चला गया): "बाएँ मुड़ें, सीढ़ियों के पास से गुजरें, और बिस्तर के पास रुक जाएँ।"
    • अब, शब्द दृश्य वास्तविकता के साथ पूरी तरह मेल खाते हैं।
  3. दूसरा सबक (The Re-Run - दोबारा चलाना): रोबोट इस नए, कस्टम-लिखित निर्देश को लेता है और इससे फिर से सीखता है। वह इस "पुनर्लिखित कहानी" को ऐसे मानता है जैसे कि वह उस विशिष्ट पथ के लिए नेविगेट करने का एक आदर्श उदाहरण हो।

सुरक्षा जाँच: "भ्रम" (Hallucinations) से बचना

यहाँ एक जोखिम है: निर्देश लिखने वाला AI चीज़ें बना सकता है (hallucinate) या ऐसी चीज़ों का वर्णन कर सकता है जो वीडियो से मेल नहीं खातीं। इसे रोकने के लिए, Φ-Nav एक ट्रस्ट स्कोर (Trust Score) का उपयोग करता है।

  • रूपक (The Metaphor): कल्पना कीजिए कि एक शिक्षक छात्र के निबंध को ग्रेड दे रहा है। निबंध को एक वैध सबक के रूप में स्वीकार करने से पहले, शिक्षक जाँच करता है: "क्या इस निबंध का हर वाक्य वास्तव में वीडियो में दिखाई देता है?"
  • यदि AI कहता है, "रोबोट ने एक लाल कुत्ता देखा," लेकिन वीडियो में कोई कुत्ता नहीं था, तो ट्रस्ट स्कोर गिर जाता है। रोबोट फिर उस सबक के उस हिस्से को अनदेखा कर देता है।
  • यदि विवरण वीडियो के साथ पूरी तरह मेल खाता है, तो ट्रस्ट स्कोर उच्च होता है, और रोबोट इससे बहुत अधिक सीखता है।

यह क्यों महत्वपूर्ण है

यह पेपर दिखाता है कि यह विधि अविश्वसनीय रूप से कुशल है।

  • कम डेटा की आवश्यकता: क्योंकि रोबोट अपने "गलत मोड़ों" को निर्देशों को बदलकर सीखने में सक्षम है, इसलिए उसे स्मार्ट बनने के लिए मानव प्रदर्शनों के उतने आदर्श उदाहरणों की आवश्यकता नहीं होती।
  • बेहतर नेविगेशन: R2R और RxR जैसे मानक परीक्षणों पर, Φ-Nav का उपयोग करने वाले रोबोटों ने पुराने तरीकों का उपयोग करने वाले रोबोटों की तुलना में बेहतर रास्ता खोजा और कम गलतियाँ कीं, भले ही उनके पास कम प्रशिक्षण डेटा था।

सारांश

Φ-Nav एक रोबोट के लिए स्व-सुधारने वाली डायरी (Self-correcting diary) की तरह है। रोबोट को एक कठोर स्क्रिप्ट में फिट करने के बजाय, यह उसे अन्वेषण करने देता है, और फिर एक ऐसी नई स्क्रिप्ट लिखता है जो उस साहसिक कार्य के अनुकूल हो जो रोबोट ने वास्तव में किया था। यह हर गलत मोड़ और भटकाव को एक मूल्यवान सीखने के अवसर में बदल देता है, जिससे रोबोट कम मानवीय सहायता के साथ अधिक स्मार्ट और अनुकूलनीय बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →