← नवीनतम पेपर
🤖 AI

Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments

MultiSix एक नवीन फ्रेमवर्क है जो एम्बॉडीड एजेंट्स (embodied agents) के लिए, अनुभवात्मक दूरी-आधारित रूटिंग (experiential distance-based routing) और स्केल-डिपेंडेंट फॉरगेटिंग मैकेनिज्म (scale-dependent forgetting mechanisms) के साथ एक स्केल-अवेयर मिक्स्चर ऑफ एक्सपर्ट्स आर्किटेक्चर को पेश करके, विकसित होते परिवेशों में मल्टी-स्केल रीजनिंग और अनुकूलन को बढ़ाता है।

मूल लेखक: Jinwoo Jang, Daniel J. Rho, Sihyung Yoon, Hyunsuk Cho, Honguk Woo

प्रकाशित 2026-07-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jinwoo Jang, Daniel J. Rho, Sihyung Yoon, Hyunsuk Cho, Honguk Woo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट हैं जो एक ऐसे घर में नेविगेट करने की कोशिश कर रहे हैं जो लगातार बदल रहा है। कभी-कभी आपको बस एक कप उठाने की ज़रूरत होती है (एक सरल, तत्काल कार्य)। अन्य समय में, आपको गलियारे में फैलती आग से बचने का रास्ता खोजने की आवश्यकता होती है (एक जटिल, अमूर्त और तत्काल स्थिति)।

यह पेपर MuSix नामक एक नई प्रणाली पेश करता है जिसे रोबोट को इन विभिन्न स्थितियों को बेहतर ढंग से संभालने में मदद करने के लिए डिज़ाइन किया गया है। यह इसे विशेषज्ञों की एक टीम की तरह काम करने में मदद करता है, जहाँ रोबोट को पता होता है कि वर्तमान स्थिति कितनी "नई" या "अजीब" महसूस हो रही है, इसके आधार पर किस विशेषज्ञ को बुलाना है।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

समस्या: "एक ही आकार के सभी के लिए उपयुक्त" (One-Size-Fits-All) रोबोट

वर्तमान रोबोट अक्सर एक ही "मस्तिष्क" या नियमों के एक निश्चित सेट का उपयोग करते हैं। लेखक तर्क देते हैं कि यह अक्षम है क्योंकि:

  1. इसे पैमाने (scale) का ज्ञान नहीं है: यदि रोबोट भ्रमित है, तो वह एक साधारण "चम्मच उठाने" की समस्या को हल करने के लिए उच्च-स्तरीय "दार्शनिक" मस्तिष्क का उपयोग करने की कोशिश कर सकता है, या एक जटिल "आग से बचने" की योजना बनाने के लिए एक सरल "रिफ्लेक्स" (प्रतिवर्त) मस्तिष्क का उपयोग कर सकता है।
  2. यह बहुत धीरे या बहुत तेज़ी से सीखता है: यदि रोबोट कुछ भी नया देखने पर अपने ज्ञान को अपडेट करता है, तो वह महत्वपूर्ण दीर्घकालिक नियमों (जैसे "आग बुरी है") को भूल सकता है। यदि वह अपडेट नहीं होता है, तो वह यह नहीं सीख सकता कि एक विशिष्ट कमरा अब आग की चपेट में है।

समाधान: MuSix (एक "विशेषज्ञ टीम")

MuSix रोबोट के मस्तिष्क को Mixture of Experts (विशेषज्ञों के मिश्रण) की तरह मानता है। एक अस्पताल के विभिन्न विभागों की कल्पना करें:

  • लो-स्केल डॉक्टर्स (Low-Scale Doctors): तात्कालिक, भौतिक विवरणों के विशेषज्ञ (जैसे, "क्या फर्श फिसलन भरा है?")।
  • हाई-स्केल डॉक्टर्स (High-Scale Doctors): अमूर्त योजना और बड़ी तस्वीर के नियमों के विशेषज्ञ (जैसे, "सबसे सुरक्षित निकास मार्ग क्या है?")।

MuSix के पास इस टीम को पूरी तरह से काम करने के लिए दो मुख्य नवाचार हैं:

1. "नॉवेलटी मीटर" (अनुभवात्मक दूरी - Experiential Distance)

डॉक्टर को बुलाने के लिए अनुमान लगाने के बजाय, MuSix के पास एक "नॉवेलटी मीटर" होता है। यह अनुभवात्मक दूरी (Experiential Distance) को मापता है।

  • उपमा: अपनी स्वयं की स्मृति के बारे में सोचें। यदि आप अपने किचन में जाते हैं, तो यह परिचित लगता है (कम दूरी)। यदि आप किसी ऐसे कमरे में जाते हैं जिसे आपने पहले कभी नहीं देखा है, तो यह अजीब और नया लगता है (उच्च दूरी)।
  • यह कैसे काम करता है: रोबोट वर्तमान स्थिति की तुलना अपने पिछले सभी अनुभवों से करता है।
    • परिचित स्थिति? मीटर कम रहता है। रोबोट त्वरित, नियमित कार्यों को संभालने के लिए लो-स्केल (Low-Scale) विशेषज्ञों को बुलाता है।
    • अजीब/नई स्थिति? मीटर अचानक बढ़ जाता है। रोबोट बड़ी तस्वीर को समझने और एक नई रणनीति बनाने के लिए हाई-स्केल (High-Scale) विशेषज्ञों को बुलाता है।

2. "दो-चरणीय स्विच" (रूटिंग - Two-Stage Switch)

पुराने सिस्टम केवल रैंडम तरीके से या एक अस्पष्ट भावना के आधार पर डॉक्टर चुनते थे। MuSix एक Two-Stage Routing सिस्टम का उपयोग करता है:

  • चरण 1: "नॉवेलटी मीटर" तय करता है कि किस स्तर की विशेषज्ञता (लो, मीडियम, या हाई) की आवश्यकता है।
  • चरण 2: एक बार स्तर चुने जाने के बाद, उस स्तर के भीतर एक विशिष्ट विशेषज्ञ को काम करने के लिए चुना जाता है।
  • यह क्यों मायने रखता है: यह सुनिश्चित करता है कि रोबोट एक साधारण कार्य के लिए जटिल प्लानर का समय बर्बाद न करे, और एक खतरनाक संकट के लिए सरल रिफ्लेक्स का उपयोग न करे।

3. "मेमोरी अपडेट" सिस्टम (विकास - Evolution)

रोबोट को पुराने अनुभवों को भूले बिना नए अनुभवों से सीखने की आवश्यकता है। MuSix इसे स्केल-डिपेंडेंट फॉरगेटिंग (Scale-Dependent Forgetting) के साथ संभालता है:

  • लो-स्केल मेमोरी (तेज़ अपडेट): तात्कालिक वातावरण के बारे में विवरण (जैसे "फर्श अभी गीला है") तेज़ी से बदलते हैं। MuSix इन यादों को तेज़ी से अपडेट करता है और जब वे अब सच नहीं रहतीं, तो उन्हें उतनी ही तेज़ी से भूल भी जाता है।
  • हाई-स्केल मेमोरी (धीमा अपडेट): बड़े नियम (जैसे "आग को न छुएं") स्थिर रहने चाहिए। MuSix इन यादों को बहुत धीरे से अपडेट करता है ताकि रोबोट गलती से सुरक्षा नियमों को "अनलर्न" (unlearn) न कर दे।
  • गेटेड ट्रांसफर (Gated Transfer): कभी-कभी, एक उच्च-स्तरीय अहसास (जैसे "आग फैल रही है") को निम्न-स्तरीय रिफ्लेक्स को बताना पड़ता है (जैसे "बाएँ भागो")। MuSix में एक "गेट" है जो सूचना को केवल आवश्यकता होने पर ही स्तरों के बीच प्रवाहित होने देता है, जिससे पूरी टीम समन्वित रहती है।

परिणाम: क्या यह काम करता है?

लेखकों ने दो मुख्य परिदृश्यों में MuSix का परीक्षण किया:

  1. जटिल तर्क (EmbodiedBench): उन कार्यों में जिनमें रोबोट को वस्तुओं को समझने, कमरों में नेविगेट करने और जटिल निर्देशों का पालन करने की आवश्यकता होती है, MuSix ने पिछले शीर्ष तरीकों से बेहतर प्रदर्शन किया। यह विशेष रूप से उन कार्यों में अच्छा था जिनमें भौतिक दक्षता और अमूर्त योजना दोनों की आवश्यकता थी।
  2. गतिशील आपदाएं (HAZARD): उन्होंने ऐसे वातावरण का अनुकरण किया जहाँ स्थितियाँ तेजी से बदलती हैं, जैसे फैलती आग या बढ़ती बाढ़। Mu-Six ऑन-द-फ्लाई (चलते-फिरते) अपनी रणनीति को अनुकूलित करने में बेहतर था। यह अन्य रोबोटों की तुलना में अधिक वस्तुओं को बचा सका और पर्यावरण को कम नुकसान पहुँचाया क्योंकि यह त्वरित प्रतिक्रिया और रणनीतिक योजना के बीच प्रभावी ढंग से स्विच कर सकता था।

सारांश

संक्षेप में, MuSix रोबोटों के लिए उनके ज्ञान को व्यवस्थित करने का एक स्मार्ट तरीका है। एक ही मस्तिष्क होने के बजाय जो एक साथ सब कुछ करने की कोशिश करता है, यह तय करने के लिए "नॉवेलटी मीटर" का उपयोग करता है कि उसे रिफ्लेक्स (परिचित चीजों के लिए) का उपयोग करना है या रणनीतिकार (नई चीजों के लिए) का। यह यह भी सुनिश्चित करता है कि यह जानकारी के महत्व के आधार पर अलग-अलग गति से अपनी स्मृति को अपडेट करे, जिससे यह अपने मूल सिद्धांतों को खोए बिना एक बदलती दुनिया में फुर्तीला बना रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →