← नवीनतम पेपर
🤖 AI

Advancing DialNav through Automatic Embodied Dialog Augmentation

DialNav फ्रेमवर्क को सीमित करने वाली डेटा की कमी को दूर करने के लिए, यह शोध पत्र 238K स्वचालित रूप से जनरेट किए गए संवाद एपिसोड के एक बड़े पैमाने के संग्रह—RAINbow डेटासेट—के साथ-साथ दोहरी-रणनीति प्रशिक्षण और एक लोकलाइजेशन मॉडल को प्रस्तुत करता है, जो सामूहिक रूप से देखे गए (seen) और अनदेखे (unseen) नेविगेशन स्प्लिट्स दोनों पर सफलता दर में महत्वपूर्ण सुधार के साथ एक नया स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त करता है।

मूल लेखक: Leekyeung Han, Sangwon Jung, Hyunji Min, Jinseong Jeong, Minyoung Kim, Paul Hongsuck Seo

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Leekyeung Han, Sangwon Jung, Hyunji Min, Jinseong Jeong, Minyoung Kim, Paul Hongsuck Seo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, भ्रमित करने वाले हवेली में एक विशिष्ट कमरे को खोजने की कोशिश कर रहे हैं, लेकिन आप पूरा नक्शा नहीं देख सकते। आपका एक दोस्त (गाइड) है जो पूरी हवेली को देखते हुए एक बालकनी पर खड़ा है, लेकिन वह आपको देख नहीं सकता। आप (नेविगेटर) गलियारों में नीचे हैं, और आपके पास एक अस्पष्ट सुराग है जैसे, "उस कमरे को खोजें जिसमें पौधा है।"

यह DialNav की दुनिया है, एक ऐसा कार्य जहाँ एक रोबोट एजेंट को एक रिमोट दोस्त के साथ चैट करके एक फोटोरियलिस्टिक घर में नेविगेट करना होता है। समस्या यह है कि रोबोट को ऐसी मददगार बातचीत करना सिखाना अविश्वसनीय रूप से कठिन है क्योंकि इसके लिए बहुत अधिक "अभ्यास सत्रों" (डेटा) की आवश्यकता होती है। मूल शोधकर्ताओं के पास केवल लगभग 2,000 अभ्यास सत्र थे, जो शतरंज सीखने के लिए केवल कुछ खेल देखने जैसा है।

यह पेपर रोबोट को बात करके नेविगेट करना सिखाने का एक नया तरीका पेश करता है, जिसमें तीन मुख्य तरकीबें शामिल हैं:

1. "रेसिपी रीमिक्स" (The RAINbow Dataset)

सबसे बड़ी बाधा अभ्यास डेटा की कमी थी। नया डेटा एकत्र करना महंगा है; एक वर्चुअल घर में इन नेविगेशन चैट्स को निभाने के लिए दो लोगों को काम पर रखने में हजारों डॉलर खर्च होते हैं।

लेखकों ने एक चतुर, कम लागत वाला समाधान निकाला: द RAINbow डेटासेट

  • उपमा: कल्पना कीजिए कि आपके पास पुराने, एक-पेज के निर्देशों की एक लाइब्रेरी है जैसे "रसोई में जाओ, फिर बाएं मुड़ो।" ये उबाऊ और छोटे हैं। लेखकों ने इन हजारों पुराने निर्देशों को लिया और लंबे, घुमावदार रास्ते बनाने के लिए उन्हें आपस में जोड़ दिया
  • जादू: इसके बाद उन्होंने एक AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग इन जुड़े हुए रास्तों को एक स्वाभाविक बातचीत में फिर से लिखने के लिए किया। केवल "बाएं मुड़ें" कहने के बजाय, AI ने नेविगेटर को यह कहने के लिए बनाया कि "मैं एक अजीब पेंटिंग वाले हॉलवे में हूँ, मुझे कहाँ जाना चाहिए?" और गाइड ने उत्तर दिया, "आह, पेंटिंग के बगल से दाएं मुड़ें।"
  • परिणाम: उन्होंने अपनी छोटी सी 2,000 सत्रों की लाइब्रेरी को 238,000 सत्रों की एक विशाल लाइब्रेरी में बदल दिया, वह भी बहुत कम खर्च में। यह एक ही कुकबुक का उपयोग करके मशीन के माध्यम से 100,000 नए, अद्वितीय व्यंजन तैयार करने जैसा है।

2. "ड्रिल सार्जेंट और एक्सप्लोरर" (Dual-Strategy Training)

प्रैक्टिस डेटा की एक बड़ी लाइब्रेरी होना अच्छा है, लेकिन यदि आप रोबोट को पुराने तरीकों से सिखाते हैं, तो वह विफल हो जाता है। पुराना तरीका एक ऐसे छात्र जैसा था जो केवल शिक्षक के हाथ का सटीक रूप से अनुसरण करके सीखता है। यदि छात्र एक छोटी सी गलती करता है, तो वह रास्ता भटक जाता है और उबर नहीं पाता।

लेखकों ने डुअल-स्ट्रेटजी ट्रेनिंग पेश की, जो एक एथलीट को एक साथ दो अलग-अलग तरीकों से प्रशिक्षित करने जैसा है:

  • ड्रिल सार्जेंट (डेटा-गाइडेड): रोबोट "सही" उत्तरों और सही समय पर मदद कैसे मांगनी है, यह सीखने के लिए डेटासेट से सटीक पथ का अनुसरण करता है।
  • एक्सप्लोरर (ऑन-पॉलिसी): रोबोट को पथ से भटकने और गलतियाँ करने की अनुमति दी जाती है। जब वह खो जाता है, तो उसे गाइड के साथ चैट का उपयोग करके वापस ट्रैक पर आने का तरीका ढूंढना पड़ता है।
  • यह क्यों काम करता है: यह रोबोट को न केवल यह सिखाता है कि क्या करना है, बल्कि यह भी कि चीजें गलत होने पर कैसे उबरना है। यह उस रोबोट और उस रोबोट के बीच का अंतर है जो दीवार से टकराने पर टूट जाता है, और उस रोबोट के बीच जो कहता है, "ओह, मैं खो गया हूँ, मुझे दिशा-निर्देश मांगने दें," और आगे बढ़ता रहता है।

3. "शरलॉक होम्स" (बेहतर लोकलाइजेशन)

इस खेल में, गाइड नेविगेटर के स्थान को नहीं देख सकता। जब नेविगेटर कहता है, "मैं एक नीले सोफे वाले कमरे में हूँ," तो गाइड को अनुमान लगाना होता है, "ओह, यह दूसरी मंजिल पर स्थित लिविंग रूम होना चाहिए।" इसे लोकलाइजेशन कहा जाता है।

मूल प्रणाली अनुमान लगाने में खराब थी। लेखों ने नेविगेशन प्रशिक्षण के एक अलग प्रकार (VLN) से ज्ञान उधार लेकर गाइड के मस्तिष्क को अपग्रेड किया।

  • उपमा: यह एक ऐसे जासूस को लेने जैसा है जो एक शहर में अपराध सुलझाने में अच्छा है और उसे पुराने शहर के मानचित्र दिखाकर नए शहर के लेआउट को सिखाना है। गाइड ने नेविगेटर के विवरण के आधार पर उसके सटीक स्थान को पहचानने में बहुत बेहतर प्रदर्शन किया, जिससे अधिक सटीक निर्देश मिले।

अंतिम स्कोर

इन तीनों को जोड़कर—भारी मात्रा में सस्ते, AI-जनरेटेड प्रैक्टिस डेटा, गलतियों से उबरना सिखाने वाली ट्रेनिंग, और बेहतर स्थान का अनुमान लगाने वाला एक स्मार्ट गाइड—रोबोट का प्रदर्शन आसमान छू गया।

  • पहले: रोबोट परिचित घरों में लगभग 31% बार और नए, अनदेखे घरों में 15% बार लक्ष्य खोजने में सफल रहा।
  • बाद में: नए सिस्टम के साथ, सफलता दर परिचित घरों में 58% और नए घरों में 29% तक बढ़ गई।

सरल शब्दों में, उन्होंने केवल रोबोट को थोड़ा बेहतर नहीं बनाया; उन्होंने उसे अभ्यास बातचीत की एक विशाल लाइब्रेरी देकर और उसे घबराहट के बिना खो जाने को संभालने के तरीके सिखाकर उसकी सफलता दर को दोगुना कर दिया। यह इस बात का नया रिकॉर्ड है कि रोबट बात करके कितनी अच्छी तरह नेविगेट कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →