← नवीनतम पेपर
💻 computer science

HarnessVLN: Unifying Training-Free Embodied Navigation through an Agent Harness

HarnessVLN एक ज़ीरो-शॉट, ट्रेनिंग-मुक्त फ्रेमवर्क पेश करता है जो एक एजेंट हार्नेस (Agent Harness) का उपयोग करके धारणा (perception), स्मृति (memory) और क्रिया सत्यापन (action validation) को एक संरचित टूल इंटरफ़ेस के माध्यम से समन्वित करके एम्बॉडीड नेविगेशन को एकीकृत करता है, जिससे बिना किसी कार्य-विशिष्ट प्रशिक्षण के कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Yang Chen, Lirong Che, Zhenyu Huang, Wenbo Fu, Chuang Wang, Xu Cao, Daqi Liu, Yuzhe Yang, Jian Su, Lan-Zhe Guo

प्रकाशित 2026-09-16
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yang Chen, Lirong Che, Zhenyu Huang, Wenbo Fu, Chuang Wang, Xu Cao, Daqi Liu, Yuzhe Yang, Jian Su, Lan-Zhe Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट जो अपने आप दुनिया में घूम सकें, लंबे समय से विज्ञान कथाओं का एक सपना रहे हैं, लेकिन इंजीनियरों के लिए, चुनौती कहीं अधिक व्यावहारिक है। नेविगेट करने के लिए, एक मशीन को तीन चीजें एक साथ करनी होती हैं: वह जो देख रहा है उसे समझना, वह कहाँ गया है उसे याद रखना, और अगला कदम क्या होगा यह तय करना। वर्षों तक, शोधकर्ताओं ने रोबों को सफल यात्राओं के हजारों उदाहरण दिखाकर उन्हें सिखाने की कोशिश की, इस उम्मीद में कि मशीन पैटर्न सीख लेगी। हालाँकि, यह दृष्टिकोण अक्सर विफल हो जाता है जब रोबोट किसी नए कमरे या थोड़े अलग निर्देश का सामना करता है। एक हालिया विचार रोबोट को एक शक्तिशाली 'भाषा मस्तिष्क' देना था, जो उन बड़े आर्टिफिशियल इंटेलिजेंस मॉडल्स के समान है जो कहानियाँ लिख सकते हैं या प्रश्नों के उत्तर दे सकते हैं। उम्मीद यह थी कि ये मॉडल बिना किसी विशिष्ट प्रशिक्षण के एक इमारत के माध्यम से तर्कपूर्ण ढंग से रास्ता बना सकेंगे। फिर भी, एक अंतर बना रहा: जबकि ये मॉडल एक योजना के बारे में बात कर सकते थे, वे अक्सर यह जाँचने में संघर्ष करते थे कि क्या वह योजना वास्तव में भौतिक दुनिया में संभव थी, जिससे भ्रम या फंसने जैसी स्थितियाँ पैदा होती थीं।

शोधकर्ताओं की एक टीम ने 'हार्नेसवीएलएन' (HarnessVLN) नामक एक नई प्रणाली पेश की है जो इस अंतर को पाटती है। एक एकल मॉडल पर सब कुछ करने के लिए निर्भर रहने के बजाय, उन्होंने एक केंद्रीय प्रबंधक, या "हार्नेस" (harness) बनाया, जो रोबोट के मस्तिष्क के लिए एक सख्त पर्यवेक्षक के रूप में कार्य करता है। यह प्रबंधक केवल रोबोट को अनुमान लगाने नहीं देता; यह लगातार रोबोट द्वारा प्रस्तावित हर कदम की जाँच रोबोट वास्तव में क्या देख रहा है और क्या याद रख रहा है, इसके विरुद्ध करता है। इस प्रणाली का परीक्षण जटिल डिजिटल वातावरणों और एक वास्तविक, पूर्ण आकार के मानव रूपी (humanoid) रोबोट पर किया गया। इन परीक्षणों में, रोब-ोट ने विशिष्ट वस्तुओं को खोजने या कुछ स्थानों तक पहुँचने के विस्तृत मौखिक निर्देशों का सफलतापूर्वक पालन किया, और सफलता दर उन पिछले तरीकों से अधिक रही जिनमें विशिष्ट कार्यों के लिए प्रशिक्षण की आवश्यकता नहीं थी। मुख्य निष्कर्ष यह है कि सत्यापन की एक परत जोड़कर—जहाँ रोबोट को आगे बढ़ने से पहले यह सिद्ध करना होता है कि लक्ष्य दृश्यमान और सुलभ है—यह प्रणाली उन अज्ञात स्थानों में ऐसी विश्वसनीयता के साथ नेविगेट कर सकती है जो केवल अनुमान लगाने से संभव नहीं है।

इस नए दृष्टिकोण का मूल विचार यह है कि एक रोबोट को विभिन्न प्रकार के नेविगेशन कार्यों को संभालने के लिए एक एकीकृत तरीके की आवश्यकता होती है। चाहे लक्ष्य "रसोई में जाओ और दाएं मुड़ो" हो या केवल "डिशवॉशर खोजो", रोबोट के सामने एक ही मौलिक समस्या होती है: उसे शब्दों को भौतिक स्थान से जोड़ना होगा। शोधकर्ताओं ने एक ढांचा तैयार किया जहाँ एक केंद्रीय नियंत्रक, 'हार्नेस', रोबोट के सभी उपकरणों का समन्वय करता है। इसमें रोबोट की आँखें शामिल हैं, जो चित्र और गहराई (depth) कैप्चर करती हैं; इसकी स्मृति, जो यह संग्रहीत करती है कि इसने क्या देखा है; और इसके पैर, जो इसे आगे बढ़ाते हैं। जब रोबोट का भाषा मस्तिष्क किसी कदम का सुझाव देता है, तो हार्नेस उसे मान्य करने के लिए रुक जाता है। वह पूछता है: क्या इसके लिए प्रमाण है? क्या रास्ता साफ है? क्या यह वर्तमान लक्ष्य से मेल खाता है? यदि उत्तर 'नहीं' है, तो रोबोट अंधाधुंध नहीं चलता; उसे पुनर्विचार करने या अधिक जानकारी खोजने के लिए वापस भेजा जाता है।

यह सत्यापन प्रक्रिया दो अलग-अलग प्रकार की स्मृतियों के मिलकर काम करने पर निर्भर करती है। पहला है घटनाओं का रिकॉर्ड, जो रोबोट के तत्काल इतिहास को ट्रैक करता है, जैसे कि कौन से उप-लक्ष्य (sub-goals) पूरे किए गए और हाल ही में कहाँ विफलता मिली। दूसरा है वातावरण का एक स्थायी मानचित्र, जो उन स्थानों का रिकॉर्ड रखता है जहाँ रोबोट गया है और उन वस्तुओं का जो उसने देखी हैं, साथ ही उनके अवलोकन का समय और स्थान भी। यह मानचित्र रोबोट को ताज़ा जानकारी और पुरानी, आउटडेटेड धारणाओं के बीच अंतर करने में मदद करता है। यदि रोबोट ने पहले एक दरवाजे से जाने की कोशिश की थी और पाया कि वह बंद है, तो यह प्रणाली उस विफलता को याद रखती है और रोबोट को उसी असंभव पथ को दोबारा आज़माने से रोकती है। अपने तर्क और भौतिक क्रियाओं के बीच एक स्पष्ट अलगाव बनाए रखकर, यह प्रणाली सुनिश्चित करती है कि हर कदम वास्तविकता पर आधारित हो।

शोधकर्ताओं ने इस प्रणाली का परीक्षण चार अलग-अलग बेंचमार्क पर किया, जो नेविगेशन कौशल को मापने के लिए उपयोग किए जाने वाले मानक चुनौतियों के सेट हैं। उन परीक्षणों में जहाँ रोबोट को शब्दों में वर्णित मार्ग का पालन करना था, वह एक प्रमुख परीक्षण में 60.8% मामलों में और दूसरे में 53.9% मामलों में सफल रहा। जब कार्य एक विशिष्ट वस्तु, जैसे कुर्सी या बिस्तर को खोजना था, तो यह प्रणाली एक वातावरण में 76.0% प्रयासों में और दूसरे में 59.3% में सफल रही। ये संख्याएँ उन अन्य तरीकों की तुलना में एक महत्वपूर्ण सुधार का प्रतिनिधित्व करती हैं जो विशिष्ट प्रशिक्षण डेटा का उपयोग नहीं करते हैं। शोधकर्ताओं ने नोट किया कि यह प्रणाली पिछले प्रयासों से बेहतर प्रदर्शन करती है क्योंकि यह केवल भाषा मॉडल के आत्मविश्वास पर भरोसा नहीं करती थी; इसने शारीरिक प्रमाण की आवश्यकता रखी कि लक्ष्य तक पहुँचना संभव है।

यह सिद्ध करने के लिए कि यह प्रणाली कंप्यूटर सिमुलेशन के बाहर काम करती है, टीम ने इसे 1.74 मीटर ऊंचे एक वास्तविक मानव रूपी रोबोट पर तैनात किया। इस रोबोट को, जो कैमरों और सेंसरों से लैस है, एक वास्तविक इमारत में नेविगेट करने का कार्य दिया गया। एक प्रयोग में, रोबोट को एक चौराहे तक जाने, बाएं मुड़ने, पानी के डिस्पेंसर के पास एक कूड़ेदान पर रुकने और फिर रेफ्रिजरेटर खोजने के लिए कहा गया। दूसरे में, उसे एक लाल अग्निशामक यंत्र (fire extinguisher) को खोजना था, बिना यह जाने कि वह वास्तव में कैसा दिखता है। रोबोट ने इन कार्यों को प्रबंधित करने के लिए उसी हार्नेस प्रणाली का उपयोग किया, और हर कदम पर अपने दृश्य साक्ष्य की जाँच की। इसने सफलतापूर्वक अपनी प्रगति को ट्रैक किया, लैंडमार्क की पहचान की, और जो कुछ उसने वास्तव में देखा उसके आधार पर अपने रुकने के बिंदुओं को मान्य किया। तथ्य यह है कि वही सॉफ़्टवेयर एक जटिल मार्ग के माध्यम से रोबोट को मार्गदर्शन करने और फिर बिना किसी री-प्रोग्रामिंग के एक अज्ञात वस्तु को खोजने में सक्षम रहा, इस दृष्टिकोण के लचीलेपन को प्रदर्शित करता है।

हार्नेसवीएलएन की सफलता यह सुझाव देती है कि रोबोट नेविगेशन का भविष्य मशीनों को हर संभावित पथ सिखाने में नहीं, बल्कि उन्हें अपने काम की जाँच करने का एक विश्वसनीय तरीका देने में निहित है। रोबोट की क्रियाओं को एक निरंतर अनुमान के बजाय सत्यापित चरणों की एक श्रृंखला के रूप में मानकर, यह प्रणाली खो जाने या गलतियाँ दोहराने के सामान्य दोषों से बचती है। शोधकर्ताओं ने पाया कि एक शक्तिशाली भाषा योजनाकार (language planner) और एक सख्त, साक्ष्य-आधारित प्रबंधक के संयोजन ने रोबोट को उन कार्यों को संभालने की अनुमति दी जो उसने पहले कभी नहीं देखे थे। हालाँकि यह प्रणाली अभी भी जाँच करने और स्मृति को अपडेट करने के लिए पूर्व-निर्धारित नियमों पर निर्भर करती है, परिणाम दिखाते हैं कि समन्वय की यह विधि उन रोबोटों की ओर एक व्यावहारिक कदम है जो वास्तव में मानव दुनिया में घूम और कार्य कर सकें। यह परियोजना आगे के विकास के लिए खुली है, जिसमें टीम खुले वातावरण में बातचीत के माध्यम से इन प्रणालियों को और अधिक सीखने और अनुकूलित होने की संभावना तलाशने की योजना बना रही है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →