← नवीनतम पेपर
🤖 AI

SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation

SocialNav एक सामाजिक रूप से जागरूक एम्बोडीड नेविगेशन के लिए एक पदानुक्रमित फाउंडेशन मॉडल पेश करता है, जिसे 7-मिलियन-नमूना वाले बड़े पैमाने के डेटासेट और एक नवीन सोशली-अवेयर फ्लो एक्सप्लोरेशन GRPO फ्रेमवर्क पर प्रशिक्षित किया गया है ताकि नेविगेशन सफलता और सामाजिक अनुपालन दोनों में अत्याधुनिक प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Ziyi Chen, Yingnan Guo, Zedong Chu, Minghua Luo, Yanfen Shen, Mingchao Sun, Junjun Hu, Shichao Xie, Kuan Yang, Pei Shi, Zhining Gu, Lu Liu, Honglin Han, Xiaolong Wu, Mu Xu, Yu Zhang, Ning Guo

प्रकाशित 2026-03-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziyi Chen, Yingnan Guo, Zedong Chu, Minghua Luo, Yanfen Shen, Mingchao Sun, Junjun Hu, Shichao Xie, Kuan Yang, Pei Shi, Zhining Gu, Lu Liu, Honglin Han, Xiaolong Wu, Mu Xu, Yu Zhang, Ning Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कुत्ते को एक व्यस्त शहर के पार्क में चलना सिखा रहे हैं।

यदि आप केवल रोबोट को बिंदु A से बिंदु B तक का सबसे छोटा रास्ता सिखाते हैं, तो वह घास के बीच से कटने की, फूलों की क्यारी के ऊपर से कूदने की, या लोगों के समूह के बीच से गुजरने की कोशिश कर सकता है क्योंकि यह सबसे कुशल ज्यामितीय मार्ग है। एक इंसान के लिए, यह असभ्य, खतरनाक और अराजक लगेगा। तकनीकी रूप से रोबोट "चल" रहा है, लेकिन वह एक अच्छा नागरिक बनने में विफल हो रहा है।

SocialNav रोबोट्स के लिए बनाया गया एक नया "मस्तिष्क" है जिसे इस समस्या को हल करने के लिए डिज़ाइन किया गया है। यह केवल यह नहीं चाहता कि रोबोट वहां तेजी से पहुंचे; यह चाहता है कि वह वहां विनम्रता और सुरक्षा के साथ पहुंचे, ठीक वैसे ही जैसे एक इंसान करेगा।

यहाँ शोध पत्र इसे सरल अवधारणाओं में तोड़कर समझाता है:

1. दो-भाग वाला मस्तिष्क: "विचारक" और "चालक"

अधिकांश रोबोटों के पास एक ही मस्तिष्क होता है जो एक साथ सब कुछ करने की कोशिश करता है। SocialNav इस काम को दो अलग-अलग भूमिकाओं में विभाजित करता है, जैसे कार में एक नेविगेटर (मार्गदर्शक) और एक ड्राइवर (चालक)

  • मस्तिष्क (नेविगेटर): यह एक सुपर-स्मार्ट AI है जो दुनिया को देखता है और सोचता है। यह केवल "घास" नहीं देखता; यह समझता है कि "यह एक लॉन है जहाँ लोग नहीं चलते हैं।" यह अपने तर्क को बोलकर भी समझा सकता है (जैसे कि "चेन ऑफ थॉट"), जैसे कि कहना, "मैं आगे एक भीड़ देख रहा हूँ, इसलिए मुझे धीमा होना चाहिए और फुटपाथ पर रहना चाहिए, भले ही यह थोड़ा लंबा रास्ता हो।"
  • एक्शन एक्सपर्ट (ड्राइवर): यह हिस्सा नेविगेटर के निर्देशों को लेता है और वास्तव में रोबोट के पैरों को चलाता है। यह सहज, प्राकृतिक गतिविधियाँ बनाने में बहुत अच्छा है जो नेविगेटर द्वारा निर्धारित नियमों का पालन करती हैं।

2. प्रशिक्षण स्कूल: "7 मिलियन छात्र डेटासेट"

रोबोट को सामाजिक रूप से जागरूक होने के लिए सिखाने के लिए, आप उसे केवल कुछ वीडियो नहीं दिखा सकते। आपको उदाहरणों का एक विशाल पुस्तकालय चाहिए। शोधकर्ताओं ने SocNav नामक एक डेटासेट बनाया है जिसमें 7 मिलियन नमूने हैं। इसे "एक अच्छा नागरिक कैसे बनें" के सबक का एक विशाल पुस्तकालय समझें:

  • "वीडियो लाइब्रेरी" (इंटरनेट वीडियो): उन्होंने इंटरनेट से लाखों घंटों के वीडियो एकत्र किए हैं जो दिखाते हैं कि वास्तविक लोग शहरों, पार्कों और मॉल में कैसे चलते हैं। यह रोबोट को मानव गति के सामान्य अंदाज़ को सिखाता है।
  • "सिमुलेशन जिम" (आभासी दुनिया): उन्होंने एक आभासी शहर बनाया है जहाँ वे जटिल स्थितियाँ बना सकते हैं, जैसे कि लगभग टक्कर होना या लोगों का रोबोट के रास्ते में आ जाना, ताकि रोबोट को सुरक्षित रूप से उबरना सिखाया जा सके।
  • "असली रोबोट" (वास्तविक दुनिया का डेटा): उन्होंने वास्तविक दुनिया में चलते हुए वास्तविक रोबोटों का उपयोग किया ताकि यह सुनिश्चित किया जा सके कि प्रशिक्षण वास्तविकता में भी लागू हो।
  • "लॉजिक टेक्स्टबुक" (चेन-ऑफ-थॉट): यही असली सफलता का मंत्र है। उन्होंने केवल रोबोट को यह नहीं दिखाया कि कहाँ चलना है; उन्होंने उसे यह भी सिखाया कि क्यों चलना है। उन्होंने लाखों लिखित स्पष्टीकरण उत्पन्न किए (जैसे कि एक शिक्षक गणित की समस्या समझा रहा हो) ताकि रोबोट सामाजिक नेविगेशन के नियमों को सीख सके, न कि केवल मांसपेशियों की स्मृति (muscle memory) को।

3. "सोशल फ्लो" प्रशिक्षण: करके सीखना (और पुरस्कृत होना)

नियमों का पालन करना सिखाना कठिन है। यदि आप इसे केवल उदाहरण दिखाते हैं (इमिटेशन लर्निंग), तो यह उन बुरी आदतों की भी नकल कर सकता है जो इसने देखी हैं।

इसे ठीक करने के लिए, शोधकर्ताओं ने SAFE-GRPO नामक एक विशेष प्रशिक्षण पद्धति का उपयोग किया।

  • उपमा: एक डांस इंस्ट्रक्टर की कल्पना करें। पहले, वे आपको मूव्स दिखाते हैं (इमिटेशन)। फिर, वे आपको डांस फ्लोर पर नाचने देते हैं, लेकिन जब भी आप डांस फ्लोर पर रहते हैं और दूसरे डांसरों के पैरों पर पैर रखने से बचते हैं, तो वे आपको एक गोल्ड स्टार देते हैं। यदि आप घास पर कदम रखते हैं या किसी से टकराते हैं, तो आपको कोई स्टार नहीं मिलता।
  • परिणाम: रोबलेट चलने के विभिन्न तरीकों को आज़माना सीखता है, लेकिन वह जल्दी ही सीख जाता है कि "गोल्ड स्टार" विनम्र और सुरक्षित होने से मिलते हैं, न कि केवल तेज़ होने से।

4. परिणाम: एक रोबोट जो अपना स्थान जानता है

जब उन्होंने अन्य शीर्ष रोबोटों के मुकाबले SocialNav का परीक्षण किया:

  • सफलता दर: यह पिछले सर्वश्रेष्ठ रोबोटों की तुलना में 38% अधिक बार अपने गंतव्य तक पहुँचा।
  • सामाजिक अनुपालन (Social Compliance): यह फुटपाथ पर रहा और सामाजिक मानदंडों का पालन 46% बेहतर तरीके से किया।

मुख्य बात:
पिछले रोबोट एक ऐसे पर्यटक की तरह थे जो एग्जिट तक पहुँचने के लिए संग्रहालय के माध्यम से दौड़ता है, "छूना मना है" के संकेतों को अनदेखा करता है। SocialNav एक स्थानीय गाइड की तरह है जो नियमों को जानता है, भीड़ छंटने का इंतज़ार करता है, और निर्धारित पथ पर विनम्रता से चलता है। यह साबित करता है कि हमारे दैनिक जीवन में वास्तव में शामिल होने के लिए, रोबोटों को न केवल स्मार्ट, बल्कि सामाजिक रूप से जागरूक होने की भी आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →