← नवीनतम पेपर
💻 computer science

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

Qwen-RobotNav एक स्केलेबल, पैरामीट्रिक नेविगेशन मॉडल है जिसे 15.6M नमूनों पर प्रशिक्षित किया गया है जो एजेंटिक सिस्टम को बिना किसी आर्किटेक्चरल बदलाव के इन्फरेंस के समय गतिशील रूप से अवलोकन रणनीतियों और कार्य मोड को पुनर्गठित करने में सक्षम बनाता है, जिससे विविध बेंचमार्क और वास्तविक दुनिया के रोबोट्स में अत्याधुनिक प्रदर्शन और मजबूत ज़ीरो-शॉट सामान्यीकरण प्राप्त होता है।

मूल लेखक: Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu
प्रकाशित 2026-06-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu, Jingyang Fan, Zhixuan Liang, Pei Lin, Ye Wang, Anzhe Chen, Kun Yan, Xiao Xu, Jiahao Li, Lulu Hu, Minying Zhang, Shurui Li, Wenhu Xiao, Shuai Bai, Xuancheng Ren, Chenxu Lv, Chenfei Wu, Xiong-Hui Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट कुत्ता या एक सेल्फ-ड्राइविंग कार है। आप चाहते हैं कि वह कई अलग-अलग काम करे: जैसे किसी बोले गए निर्देश का पालन करना जैसे "किचन में जाओ," चलते हुए व्यक्ति का पीछा करना, खोई हुई चाबियों को ढूँढना, या ट्रैफिक में सुरक्षित रूप से गाड़ी चलाना।

आमतौर पर, ऐसे रोबोट को बनाने के लिए जो ये सभी काम कर सके, ऐसा लगता है जैसे आप एक ही व्यक्ति को एक साथ मास्टर शेफ, रेस कार ड्राइवर और जासूस बनाने की कोशिश कर रहे हों। यह अविश्वसनीय रूप से कठिन है क्योंकि प्रत्येक काम के लिए दुनिया को देखने का एक अलग तरीका चाहिए होता है। एक जासूस को घंटों पहले मिले सुरागों को याद रखने की आवश्यकता होती है, जबकि एक रेस कार ड्राइवर को केवल उसी बात की परवाह होती है जो उसके सामने इस सेकंड हो रही है।

Qwen-RobotNav एक नया "दिमाग" है जो इस समस्या को हल करता है। हर काम के लिए एक अलग दिमाग बनाने के बजाय, शोधकर्ताओं ने एक लचीला दिमाग बनाया है जो जो वह कर रहा है, उसके आधार पर अपने "चश्मे" बदल सकता है।

यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) का उपयोग किया गया है:

1. "स्विस आर्मी नाइफ" वाला दिमाग

Qwen-RobotNav को एक स्विस आर्मी नाइफ की तरह समझें। अधिकांश नेविगेशन रोबोट एक साधारण पेचकश (screwdriver) की तरह होते हैं; वे एक चीज़ में बहुत अच्छे होते हैं लेकिन दूसरों के लिए बेकार होते हैं। Qwen-RobotNav पूरा टूल है।

  • द स्विच (बदलने का तरीका): इसमें एक "मोड स्विच" है। यदि आप इसे "उस व्यक्ति का पीछा करो" कहते हैं, तो यह ट्रैकिंग मोड (Tracking Mode) में स्विच हो जाता है। इस मोड में, यह "तेज़ चश्मे" पहन लेता है जो केवल वीडियो के पिछले कुछ सेकंड को देखते हैं, पुराने इतिहास को अनदेखा कर देते हैं ताकि यह तुरंत प्रतिक्रिया दे सके।
  • द मेमोरी (याददाश्त): यदि आप इसे "लाल सोफा ढूँढो" कहते हैं, तो यह सर्च मोड (Search Mode) में स्विच हो जाता है। यहाँ, यह "वाइड-एंगल चश्मे" पहनता है जो पिछले 10 मिनट में उसने जो कुछ भी देखा है उसे याद रखता है, ताकि वह गोल-गोल न घूमता रहे।
  • द मैजिक (जादू): सबसे अच्छी बात यह है कि आपको इन चश्मों को बदलने के लिए रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आप बस इसे बताते हैं कि क्या करना है, और यह तुरंत दुनिया पर अपना ध्यान केंद्रित करने का तरीका बदल लेता है।

2. आँखों के लिए "स्मार्ट बजट"

रोबोटों की एक सीमा होती है कि वे एक बार में कितनी दृश्य जानकारी (visual information) प्रोसेस कर सकते हैं (जैसे एक कंप्यूटर जिसमें RAM खत्म हो रही हो)।

  • समस्या: यदि एक रोबोट वीडियो के 100 फ्रेम देखता है, तो वह अभिभूत (overwhelmed) हो सकता है। यदि वह केवल 1 फ्रेम देखता है, तो वह एक महत्वपूर्ण विवरण मिस कर सकता है।
  • समाधान: Qwen-RobotNav एक स्मार्ट बजट का उपयोग करता है। कल्पना कीजिए कि आपके पास कमरे की तस्वीरें खरीदने के लिए $100 हैं।
    • यदि आप ड्राइविंग कर रहे हैं, तो आप अपने पैसे का अधिकांश हिस्सा सड़क की तस्वीर (सामने का दृश्य) पर खर्च करते हैं और पिछले दृश्य पर बहुत कम।
    • यदि आप खोई हुई वस्तु की तलाश कर रहे हैं, तो आप पिछले कुछ मिनटों के पूरे कमरे की तस्वीरें खरीदने के लिए अपने पैसे को फैला देते हैं।
    • रोबोट यह गणित स्वचालित रूप से करना सीख जाता है। वह तय करता है कि हर कैमरे और हर क्षण के लिए उसे कितने "पिक्सेल" (दृश्य विवरण) रखने हैं।

3. "मेगा-मिक्स" अनुभवों से सीखना

इस रोबोट को सिखाने के लिए, शोधकर्ताओं ने इसे केवल एक प्रकार का वीडियो नहीं दिखाया। उन्होंने इसे 15.6 मिलियन विभिन्न अनुभवों का एक विशाल "स्मूदी" खिलाया:

  • निर्देशों का पालन करना: "नीली कुर्सी के पास बाएं मुड़ें।"
  • पॉइंट नेविगेशन: "निर्देशांक (5, 2) पर जाएँ।"
  • वस्तु की खोज: "टीवी रिमोट ढूँढें।"
  • ट्रैकिंग: "काली टोपी वाले आदमी का पीछा करें।"
  • ड्राइविंग: "एक चौराहे से सुरक्षित रूप से गुजरें।"

उन्होंने इसमें सामान्य "दुनिया का ज्ञान" (जैसे साइन बोर्ड पढ़ना या वस्तुओं को पहचानना) भी मिला दिया ताकि रोबट चलने के तरीके सीखते समय भाषा को समझने की क्षमता न भूल जाए। यह रोबोट को एक "बिना सोचे-समझे काम करने वाली मशीन" बनने से रोकता है जो बिना सोचे-समझे केवल चलती रहती है।

4. "मैनेजर और वर्कर" सिस्टम

बहुत लंबे और जटिल कार्यों के लिए (जैसे "कॉफी शॉप में हरा छाता ढूँढें और मुझे बताएं कि क्या वह वहाँ है"), रोबोट एक टीम के रूप में काम करता है:

  • द मैनेजर (ऊपरी योजनाकार - Upper Planner): यह एक उच्च-स्तरीय AI है जो बड़े लक्ष्य को छोटे चरणों में तोड़ता है। यह तय करता है, "पहले, हॉलवे में जाओ। फिर, कॉफी शॉप की तलाश करो।"
  • द वर्कर (Qwen-RobotNav): यह नेविगेशन मॉडल है। मैनेजर वर्कर को बताता है, "कॉफी शॉप पर जाओ, लेकिन अपने 'सर्च मोड' और बड़े मेमोरी बजट का उपयोग करो।"
  • द लूप (चक्र): वर्कर जाता है, दुकान ढूँढता है, और वापस रिपोर्ट करता है, "मैं यहाँ हूँ, लेकिन छाता नहीं है।" मैनेजर अपनी याददाश्त अपडेट करता है और कहता है, "ठीक है, अगली मेज को चेक करो।" काम पूरा होने तक यह प्रक्रिया बार-बार चलती रहती है।

5. वास्तविक दुनिया के परिणाम

पेपर दिखाता है कि यह रोबोट केवल एक सिमुलेशन का कमाल नहीं है।

  • यह प्रतियोगिताओं को जीतता है: इसने निर्देशों का पालन करने, वस्तुओं को खोजने और चलते लक्ष्यों का पीछा करने के परीक्षणों में अन्य शीर्ष रोबोटों को हराया।
  • यह ड्राइविंग करता है: इसने जटिल ट्रैफिक सिमुलेशन में कारों को सुरक्षित रूप से चलाना सीखा।
  • यह वास्तविक रोबोट पर काम करता है: टीम ने इसे एक ऐसी इमारत में असली रोबोट कुत्ते पर टेस्ट किया जिसे उसने पहले कभी नहीं देखा था। उन्होंने इसे "मेडिकल रूम में चलो, फिर मुड़ो और पीछे की ओर चलो" जैसे मौखिक निर्देश दिए। रोबोट ने उस अजीब इमारत में सफलतापूर्वक रास्ता बनाया, लैंडमार्क का उपयोग करके अपना रास्ता खोजा, और ठीक वैसे ही पीछे की ओर चला जैसा उसे कहा गया था।

संक्षेप में: Qwen-RobotNav एक यूनिवर्सल नेविगेशन ब्रेन है जो अपने स्वयं के ध्यान (attention) को "ट्यून" करना सीखता है। यह जानता है कि वर्तमान क्षण पर ध्यान केंद्रित करना है और कब अतीत को याद रखना है, जिससे एक अकेला रोबोट एक साथ ड्राइवर, ट्रैकर और खोजकर्ता बन सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →