← नवीनतम पेपर
💻 computer science

NavThinker: Action-Conditioned World Models for Coupled Prediction and Planning in Social Navigation

NavThinker एक भविष्य-जागरूक ढांचा है जो एक एक्शन-कंडीशन्ड वर्ल्ड मॉडल को ऑन-पॉलिसी रीइन्फोर्समेंट लर्निंग के साथ जोड़ता है ताकि रोबोट अपने कार्यों और मानव गति के पारस्परिक प्रभाव के बारे में तर्क कर सकें, जिससे अत्याधुनिक सामाजिक नेविगेशन प्रदर्शन और वास्तविक दुनिया में सामान्यीकरण प्राप्त होता है।

मूल लेखक: Tianshuai Hu, Zeying Gong, Lingdong Kong, XiaoDong Mei, Yiyi Ding, Qi Zeng, Ao Liang, Rong Li, Yangyi Zhong, Junwei Liang

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tianshuai Hu, Zeying Gong, Lingdong Kong, XiaoDong Mei, Yiyi Ding, Qi Zeng, Ao Liang, Rong Li, Yangyi Zhong, Junwei Liang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भीड़भाड़ वाले, व्यस्त बाज़ार से गुजर रहे हैं। आप दूसरे छोर पर स्थित बेकरी तक पहुँचना चाहते हैं, लेकिन भीड़ अप्रत्याशित रूप से चल रही है।

पुराना तरीका (अधिकांश रोबोट):
आज के अधिकांश रोबोट उन लोगों की तरह हैं जो केवल अपने पैरों की ओर देखते हैं। वे अपने सामने किसी व्यक्ति को देखते हैं, रुक जाते हैं, उस व्यक्ति के हटने का इंतज़ार करते हैं, और फिर एक कदम आगे बढ़ते हैं। यदि दो लोग एक साथ हिलते हैं, तो रोबोट भ्रमित हो जाता है, जम जाता है, या किसी से टकरा जाता है। वे केवल 'अभी' (वर्तमान) पर प्रतिक्रिया देते हैं, वे 'अगले' (भविष्य) के बारे में नहीं सोचते।

नया तरीका (NavThinker):
यह शोध पत्र NavThinker का परिचय देता है, जो एक ऐसा रोबोट है जो केवल भीड़ को देखता ही नहीं है; यह भविष्य की कल्पना भी करता है। यह एक शतरंज खिलाड़ी की तरह है जो केवल वर्तमान बोर्ड को नहीं देखता, बल्कि अपनी चाल चलने से पहले अपने दिमाग में अगले तीन कदमों का अनुकरण (simulate) करता है।

NavThinker कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:

1. "क्रिस्टल बॉल" (वर्ल्ड मॉडल - The World Model)

NavThinker के पास एक विशेष आंतरिक इंजन है जिसे वर्ल्ड मॉडल कहा जाता है। इसे रोबोट के मस्तिष्क के भीतर एक "क्रिस्टल बॉल" या "फ्लाइट सिम्युलेटर" के रूप में समझें।

  • यह कैसे काम करता है: वास्तव में चलने से पहले, रोबोट अपनी क्रिस्टल बॉल से पूछता है: "यदि मैं एक कदम आगे बढ़ता हूँ, तो 2 सेकंड में भीड़ कैसी दिखेगी? यदि मैं बाईं ओर मुड़ता हूँ, तो वह व्यक्ति कहाँ होगा?"
  • जादू: यह केवल अंदाज़ा नहीं लगाता। यह एक विशेष "विज़न लेंस" (जिसे Depth Anything V2 कहा जाता है) का उपयोग करता है जो कमरे के 3D आकार और लोगों के चलने के तरीके को समझता है। यह उस क्रिया के आधार पर भविष्य की एक मानसिक फिल्म बनाता है जिसे वह करने पर विचार कर रहा है।

2. "क्या-होगा-अगर" का खेल (Coupled Prediction & Planning)

यही सबसे महत्वपूर्ण हिस्सा है। आमतौर पर, रोबोट पहले यह अनुमान लगाते हैं कि लोग कहाँ जाएंगे, और फिर अलग से अपना रास्ता तैयार करते हैं। NavThinker इन दोनों को एक साथ करता है।

  • उपमा: लुका-छिपी (tag) का खेल खेलने की कल्पना करें।
    • पुराना रोबोट: देखता है कि आप दौड़ रहे हैं, यह गणना करने की कोशिश करता है कि आप कहाँ हैं, और फिर दौड़ने का निर्णय लेता है।
    • NavThinker: दौड़ने का नाटक करता है, देखता है कि आप बचकर निकले, फिर मुड़ने का नाटक करता है, देखता है कि आप रुके, फिर रुकने का नाटक करता है, और देखता है कि आप पास से गुजर गए। यह इन "क्या-होगा-अगर" (What-If) परिदृश्यों को पलक झपकते ही रन-थ्रू करता है और उस चाल को चुनता है जो सबसे सुगम रास्ता प्रदान करती है।

3. दो महाशक्तियाँ (The "Think-Ahead" Mechanisms)

इस कल्पना को उपयोगी बनाने के लिए, शोधकर्ताओं ने रोबोट को दो विशिष्ट उपकरण दिए हैं:

  • उपकरण A: "फ्यूचर विजन" ओवरले।
    जब रोबोट दुनिया को देखता है, तो वह केवल वर्तमान डेप्थ मैप को नहीं देखता। यह भविष्य की कल्पित छवि को उसके ऊपर आरोपित (overlay) कर देता है। यह ऐसा है जैसे आप ऐसे चश्मे पहने हों जो आपको दिखाते हैं कि लोग कहाँ होंगे, ताकि रोबट वहां पहुँचने से पहले ही उनके चारों ओर रास्ता बना सके।
  • उपकरण B: "सोशल स्कोरकार्ड"।
    रोबोट को केवल लक्ष्य तक पहुँचने के लिए ही नहीं, बल्कि मानव व्यवहार का कितनी अच्छी तरह से पूर्वानुमान लगाने के लिए भी इनाम (एक "अच्छा काम किया" संकेत) मिलता है। यदि रोबोट का "क्रिस्टल बॉल" यह अनुमान लगाता है कि एक विशिष्ट चाल से टक्कर या दुर्घटना हो सकती है, तो रोबोट को उसके प्रशिक्षण में "दंड" (penalty) मिलता है। यह उसे कुशल होने के साथ-साथ विनम्र और सुरक्षित होना सिखाता है।

4. परिणाम: सिमुलेशन से वास्तविक जीवन तक

शोधकर्ताओं ने इसका परीक्षण आभासी लोगों (Social-HM3D) के साथ एक कंप्यूटर सिमुलेशन पर और वास्तविक दुनिया में एक असली रोबोट डॉग (Unitree Go2) पर किया।

  • स्कोर: NavThinker बिना किसी से टकराए अपने लक्ष्य तक पहुँचने में सबसे बेहतर रहा। यह पिछले "स्मार्ट" रोबोटों की तुलना में काफी बेहतर था।
  • "जीरो-शॉट" ट्रिक: उन्होंने रोबोट को एक प्रकार की आभासी इमारत में प्रशिक्षित किया, और यह बिना किसी अतिरिक्त प्रशिक्षण के पूरी तरह से एक अलग इमारत में भी काम कर गया। यह एक वीडियो गेम में गाड़ी चलाना सीखने और फिर एक ऐसे शहर में असली कार चलाने जैसा है जिसे आपने पहले कभी नहीं देखा।
  • वास्तविक दुनिया का परीक्षण: उन्होंने इसे एक असली रोबोट डॉग पर लगाया। कुत्ता लोगों के साथ एक कमरे में सफलतापूर्वक चला, बिना टकराए रास्ता निकाल लिया, जिससे यह सिद्ध हुआ कि यह केवल एक कंप्यूटर का कमाल नहीं है।

सारांश

NavThinker एक ऐसा रोबोट है जो प्रतिक्रिया देना बंद करता है और सोचना शुरू करता है। किसी व्यक्ति के रास्ते से हटने का इंतज़ार करने के बजाय, यह भविष्य की कल्पना करता है, विभिन्न विकल्पों का अनुकरण करता है, और उस विकल्प को चुनता है जो सभी को सुरक्षित और खुश रखता है। यह एक ऐसे रोबोट के बीच का अंतर है जो भीड़ में अपने ही पैरों से लड़खड़ा जाता है और एक ऐसे रोबोट के बीच का अंतर है जो भीड़ के बीच से खूबसूरती से नृत्य करते हुए निकलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →