← नवीनतम पेपर
💻 computer science

MoWM: Mixture-of-World-Models for Embodied Planning via Latent-to-Pixel Feature Modulation

MoWM एक मिश्रण-ऑफ-वर्ल्ड-मॉडल फ्रेमवर्क का प्रस्ताव करता है जो संकुचित गतिकी (compact dynamics) और क्रिया-प्रासंगिक दृश्य विवरणों को कैप्चर करने के लिए मोशन-अवेयर लेटेंट रिप्रेजेंटेशन्स को फाइन-ग्रेन्ड पिक्सेल-स्पेस फीचर्स के साथ फ्यूज करके एम्बोडीड एक्शन प्लानिंग को बढ़ाता है।

मूल लेखक: Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yangcheng Yu, Xin Jin, Yu Shang, Xin Zhang, Haisheng Su, Wei Wu, Yong Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को टी-शर्ट तह करना या एक विशिष्ट ब्लॉक उठाना सिखाने की कोशिश कर रहे हैं। ऐसा करने के लिए, रोबोट को दो चीजों की आवश्यकता है: अति-तीक्ष्ण दृष्टि (यह देखने के लिए कि कपड़े के किनारे ठीक कहाँ हैं) और गति का बोध (यह समझने के लिए कि छूने पर चीजें कैसे बदलती और बहती हैं)।

शोधकर्ताओं ने पाया कि वर्तमान रोबोट आमतौर पर संघर्ष करते हैं क्योंकि वे एक "आंख" की शैली चुनते हैं लेकिन दूसरी को अनदेखा कर देते हैं। यह शोध पत्र MoWM पेश करता है, जो रोबोट को "हाइब्रिड विजन" (मिश्रित दृष्टि) देने का एक तरीका है।

यहाँ एक सरल उपमा का उपयोग करके इसका विवरण दिया गया है।

समस्या: "फोटोग्राफर" बनाम "डायरेक्टर"

कल्पना कीजिए कि आप दो अलग-अलग प्रकार के वीडियो देखकर एक जटिल नृत्य की दिनचर्या (डांस रूटीन) सीखने की कोशिश कर रहे हैं:

  1. फोटोग्राफर (पिक्सेल-आधारित वर्ल्ड मॉडल्स): यह वीडियो अल्ट्रा-हाई डेफिनिशन है। आप नर्तक की त्वचा के रोमछिद्र और उनके कपड़ों के हर धागे को देख सकते हैं। यह सुंदर है, लेकिन इसमें बहुत अधिक जानकारी है। आप बैकग्राउंड के वॉलपेपर या फर्श की बनावट को देखने में इतना समय बिता देते हैं कि आप वास्तवक में नर्तक की वास्तविक गति से भटक जाते हैं। आप "बारीकियों में खो" जाते हैं।
  2. डायरेक्टर (लेटेंट-आधारित वर्ल्ड मॉडल्स): यह वीडियो एक धुंधले, अमूर्त स्केच की तरह है। आप नर्तक का चेहरा नहीं देख सकते, लेकिन आप गति के 'प्रवाह' (flow) को पूरी तरह से समझ सकते हैं। आप लय और दिशा को समझते हैं, लेकिन आप यह नहीं देख पाते कि नर्तक का हाथ ठीक कहाँ जमीन को छू रहा है। आपके पास "वाइब" तो है, लेकिन आपके पास सटीकता (precision) की कमी है।

वर्तमान रोबट आमतौर पर एक ही चुनते हैं: या तो वे "वॉलपेपर" (बैकग्राउंड) से विचलित हो जाते हैं या वे नाजुक कार्यों को करने के लिए बहुत अधिक "धुंधले" होते हैं।


समाधान: MoWM (द "स्मार्ट ओवरले")

शोधकर्ताओं ने MoWM (मिक्सचर-ऑफ-वर्ल्ड-मॉडल्स) बनाया। रोबोट को चुनने के बजाय, वे इसे फीचर मॉड्यूलेशन (Feature Modulation) की प्रक्रिया के माध्यम से एक ही समय में दोनों का उपयोग करने की अनुमति देते हैं।

इसे ऑगमेंटेड रियलिटी (AR) चश्मे के उपयोग की तरह समझें:

  • रोबोट हाई-डेफिनिशन दुनिया देखने के लिए फोटोग्राफर की आंखों का उपयोग करता है।
  • लेकिन, वह डायरेक्टर के AR चश्मे पहनता है जो दृश्य पर "मोशन हाइलाइट्स" को ओवरले (ऊपर से प्रदर्शित) करता है।

जब रोबोट कपड़े का एक टुकड़ा देखता है, तो उसके मस्तिष्क का "डायरेक्टर" हिस्सा उस पथ को हाइलाइट करता है जिस पर कपड़े को हिलाने पर वह चलेगा, जबकि "फोटोग्राफर" वाला हिस्सा उसे बताता है कि शर्ट का किनारा (hem) ठीक कहाँ है। इन दोनों को मिलाकर, रोबोट "शोर" (स्थिर बैकग्राउंड) को अनदेखा करता है और केवल "सिग्नल" (छवि के वे हिस्से जो कार्य के लिए वास्तव में महत्वपूर्ण हैं) पर ध्यान केंद्रित करता है।


क्या यह काम करता है?

शोधकर्ताओं ने दो तरीकों से इसका परीक्षण किया:

  1. एक डिजिटल प्लेग्राउंड में (CALVIN): उन्होंने रोबोट को लंबे, जटिल कार्यों के अनुक्रम दिए (जैसे कि स्कैवेंजर हंट)। MoWM ने लगभग सभी अन्य तरीकों को पछाड़ दिया, विशेष रूप से लंबे कार्यों में जहाँ रोब्राट आमतौर पर "अपना रास्ता भटक" जाते हैं।
  2. वास्तविक दुनिया में: उन्होंने एक वास्तविक रोबोटिक हाथ को एक कठिन काम दिया: एक टी-शर्ट को एक साफ आयत (rectangle) के रूप में तह करना। क्योंकि रोबोट कपड़े के बारीक विवरण देख सकता था और साथ ही फोल्डिंग मोशन के "प्रवाह" को भी समझ सकता था, इसलिए वह सफल रहा।

"टू लॉन्ग; डिडंट रीड" (TL;DR) सारांश

अधिकांश रोबोट या तो छोटी बारीकियों पर बहुत अधिक ध्यान केंद्रित करते हैं (और बड़ी तस्वीर चूक जाते हैं) या वे बड़ी तस्वीर पर बहुत अधिक ध्यान केंद्रित करते हैं (और छोटी बारीकियां चूक जाते हैं)। MoWM एक स्मार्ट फिल्टर की तरह काम करता है जो हाई-डेफिनिशन विजन को गति की समझ के साथ जोड़ता है, जिससे रोबोट जटिल, नाजुक कार्यों को बहुत उच्च सफलता दर के साथ करने में सक्षम होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →