← नवीनतम पेपर
💻 computer science

IndoorR2X: Indoor Robot-to-Everything Coordination with LLM-Driven Planning

यह शोध पत्र IndoorR2X को प्रस्तुत करता है, जो एक नया बेंचमार्क और सिमुलेशन फ्रेमवर्क है जो बेहतर इनडोर दृश्य समझ, कम अन्वेषण ओवरहेड और कुशल मल्टी-रोबोट कार्य नियोजन के लिए मोबाइल रोबोटों को स्थिर IoT सेंसरों के साथ समन्वयित करने हेतु लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है।

मूल लेखक: Fan Yang, Soumya Teotia, Shaunak A. Mehta, Prajit KrisshnaKumar, Quanting Xie, Jun Liu, Yueqi Song, Li Wenkai, Atsunori Moteki, Kanji Uchino, Yonatan Bisk

प्रकाशित 2026-03-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fan Yang, Soumya Teotia, Shaunak A. Mehta, Prajit KrisshnaKumar, Quanting Xie, Jun Liu, Yueqi Song, Li Wenkai, Atsunori Moteki, Kanji Uchino, Yonatan Bisk

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप तीन रोबोटों की एक टीम के साथ एक बहुत बड़े, बिखरे हुए घर की सफाई करने की कोशिश कर रहे हैं। लेकिन इसमें एक पेंच है: प्रत्येक रोबोट ने आंखों पर पट्टी बांधी हुई है जो उन्हें केवल उनके ठीक सामने की चीज़ें देखने देती है। वे अगले कमरे में क्या है यह नहीं देख सकते, और उन्हें तब तक पता नहीं चलेगा कि टीवी चालू है या बंद, जब तक कि वे उसके बिल्कुल पास न चले जाएं।

अतीत में, यदि ये रोबोट मिलकर काम करना चाहते, तो उन्हें लगातार एक-दूसरे से टकराना पड़ता और पूछना पड़ता, "क्या तुमने टीवी देखा?" और फिर वे चेक करने के लिए पूरे घर में चक्कर काटते। यह अंधेरे घर में चाबियों का खोया हुआ सेट खोजने जैसा है, जहाँ आप दीवार के हर इंच को छूकर देखते हैं, भले ही आपको पता हो कि किसी और ने उन्हें पहले देखा होगा।

पेश है "IndoorR2X"।

IndoorR2X को इन आंखों पर पट्टी बांधे हुए रोबोट्स को सुपर-विज़न (दिव्य दृष्टि) और एक स्मार्ट दिमाग देने के रूप में समझें जो सब कुछ जोड़ता है।

मुख्य विचार: "स्मार्ट होम" एक साथी के रूप में

पेपर का तर्क है कि अधिकांश घरों में पहले से ही "आंखें" मौजूद हैं जिनका रोबोट उपयोग नहीं करते: IoT सेंसर (जैसे सुरक्षा कैमरे, स्मार्ट लाइट्स और स्मार्ट फ्रिज)।

  • पुराना तरीका (रोबोट-टू-रोबोट): रोबोट आपस में बात करते हैं। "मैं लैपटॉप ढूंढ रहा हूँ।" "मैंने नहीं देखा।" दोनों रोबोट इधर-उधर भटकते रहते हैं।
  • IndoorR2X का तरीका (रोबोट-टू-एवरीथिंग): रोबोट पूरे घर से बात करते हैं। सुरक्षा कैमरा (R2X में "X") बेड पर लैपटॉप को देखता है। वह तुरंत केंद्रीय "दिमाग" (एक AI) को बताता है, "हे, लैपटॉप बेडरूम में है!" दिमाग फिर रोबोट को बताता है, "सीधे बेडरूम में जाओ। खोजने की ज़रूरत नहीं है।"

यह कैसे काम करता है: "मिशन कंट्रोल" का उदाहरण

डिनर के व्यस्त समय के दौरान एक व्यस्त किचन की कल्पना करें।

  1. शेफ (रोबोट): वे सब्जियां काटने, खाना पकाने और इधर-उधर जाने में व्यस्त हैं। वे केवल अपने खुद के चॉपिंग बोर्ड को देख सकते हैं।
  2. कैमरे (IoT सेंसर): वे छत पर लगे हैं, पूरे किचन पर नज़र रख रहे हैं। वे देखते हैं कि नमक ऊंचे शेल्फ पर है, ओवन गर्म है, और डिलीवरी वाला पिछले दरवाजे पर है।
  3. हेड शेफ (LLM): यह एक "लार्ज लैंग्वेज मॉडल" (एक सुपर-स्मार्ट AI) है। वह एक डेस्क पर एक विशाल व्हाइटबोर्ड के साथ बैठा है।
    • उसे कैमरों से अपडेट मिलते हैं: "नमक शेल्फ पर है।"
    • उसे शेफ से अपडेट मिलते हैं: "मुझे नमक चाहिए।"
    • जादू: शेफ को नमक खोजने के लिए किचन में भटकने के लिए भेजने के बजाय, हेड शेफ व्हाइटबोर्ड को देखता है, कैमरे की जानकारी देखता है, और कहता है, "शेफ 1, शेल्फ की ओर जाओ। शेफ 2, ओवन की ओर जाओ।"

यह एक बड़ी बात क्यों है?

शोधकर्ताओं ने इसे टेस्ट करने के लिए एक वीडियो गेम सिमुलेशन (एक "बेंचमार्क") बनाया। उन्होंने तीन अद्भुत चीजें पाईं:

  1. कम भटकना: रोबोटों को कम घूमना पड़ा। यह लाइब्रेरी में हर शेल्फ को चेक करके फिल्म खोजने और लाइब्रेरियन द्वारा आपको सटीक गलियारा बताने के बीच के अंतर जैसा है।
  2. स्मार्ट प्लानिंग: "हेड शेफ" (AI) को उतनी मेहनत नहीं करनी पड़ी। क्योंकि जानकारी पहले से ही वहां थी, इसलिए उसने अनुमान लगाने में ऊर्जा बर्बाद नहीं की। इससे पैसा और समय (AI द्वारा उपयोग किए गए कम "टोकन") बचता है।
  3. लचीलापन (Resilience): यदि कोई कैमरा कुछ मिस कर देता है (एक "ग्लिच"), तो रोबोट खुद जाकर उसे ढूंढ लेते हैं। लेकिन अगर कैमरा झूठ बोलता है (कहता है कि नमक शेल्फ पर है जबकि वह वास्तव में कचरे में है), तो रोबोट भ्रमित हो जाते हैं। इसलिए, सिस्टम को सेंसरों पर आँख मूंदकर भरोसा करने के बजाय सावधान रहने की आवश्यकता है।

वास्तविक दुनिया का परीक्षण

टीम केवल कंप्यूटर गेम तक ही सीमित नहीं रही। उन्होंने एक वास्तविक सेटअप बनाया जिसमें एक कमरे में वास्तविक रोबोटिक आर्म्स और वेबकैम का उपयोग किया गया।

  • कैमरों के बिना: रोबोटों को एक नीला बैग और एक USB केबल खोजने के लिए हर कमरे में जाना पड़ा।
  • कैमरों के साथ: कैमरों ने वस्तुओं को तुरंत देख लिया। रोबोट सीधे उन तक पहुंचे, जिससे उनका "खोजने" वाला चरण पूरी तरह से खत्म हो गया। यह समाधान तक पहुँचने के लिए टेलीपोर्ट होने जैसा था।

निष्कर्ष

IndoorR2X रोबोट्स को "अकेले खोजकर्ता" बनने से रोकने और उन्हें एक जुड़े हुए दल में बदलने के बारे में है जो पूरे स्मार्ट होम को अपनी आंखों और कानों के रूप में उपयोग करते हैं। रोबोट्स को केवल एक-दूसरे से ही नहीं, बल्कि पूरे घर से बात करने की अनुमति देकर, वे कार्यों को तेज़ी से पूरा कर सकते हैं, कम ऊर्जा का उपयोग कर सकते हैं और उन चीजों को खोजने में समय बर्बाद करना बंद कर सकते हैं जिन्हें घर पहले से ही जानता है कि वे कहाँ हैं।

यह अंधेरे शहर में हर दरवाजे को खटखटाकर पार्टी खोजने की कोशिश करने वाले लोगों के समूह और एक GPS ऐप के बीच के अंतर जैसा है जो आपको बताता है कि किस दरवाजे पर दस्तक देनी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →