← नवीनतम पेपर
🤖 AI

EWAM: An Enhanced World Action Model for Closed-Loop Online Adaptation in Embodied Intelligence

यह शोध पत्र EWAM को प्रस्तुत करता है, जो एक क्लोज्ड-लूप ऑनलाइन एडेप्टेशन फ्रेमवर्क है जो अनुभव स्मृति (experience memory), विसंगति का पता लगाने (anomaly detection), नीति रूटिंग (policy routing) और क्रिया सुधार (action correction) के लिए चार विभेदक न्यूरल परतों (differentiable neural layers) को एकीकृत करके ज़ीरो-शॉट एम्बोडीड इंटेलिजेंस के लिए एक फ्रोजन Cosmos3 बैकबोन को उन्नत करता है, जिससे अतिरिक्त प्रदर्शनों या फाइन-ट्यूनिंग के बिना नए टास्क लेआउट के प्रति मजबूत अनुकूलन सक्षम होता है।

मूल लेखक: Xin Zhou, Cong Miao

प्रकाशित 2026-06-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xin Zhou, Cong Miao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास कॉसमॉस (Cosmos) नाम का एक बहुत ही स्मार्ट रोबोट शेफ है। कॉसमॉस ने लाखों कुकबुक्स पढ़ी हैं और अनगिनत कुकिंग वीडियो देखे हैं। उसे ठीक-ठीक पता है कि कैसे काटना है, कैसे चलाना है और खाना कैसे परोसना है। हालाँकि, जब आप कॉसमॉस को एक वास्तविक रसोई में रखते हैं जहाँ लेआउट थोड़ा अलग हो या फर्श पर एक फिसलन भरा केला पड़ा हो, तो वह कभी-कभी अपने ही पैरों से टकराकर लड़खड़ा जाता है, हवा में हाथ मारता है यह सोचकर कि उसने केला पकड़ा है, या काउंटर से टकरा जाता है।

समस्या यह है कि कॉसमॉस उस छात्र की तरह है जिसने पाठ्यपुस्तक तो रट ली है लेकिन वास्तव में एक अस्त-व्यस्त रसोई में कभी खाना नहीं बनाया है। वह नहीं जानता कि चीजें बिगड़ने पर वास्तविक समय (real-time) में कैसे प्रतिक्रिया देनी है।

EWAM (एन्हांस्ड वर्ल्ड एक्शन मॉडल) ऐसा है जैसे कॉसमॉस के ठीक बगल में एक स्मार्ट, अनुभवी sous-chef (सहायक शेफ) खड़ा हो, जो उसके हर कदम को देख रहा हो और गलतियों को सुधारने के लिए फुसफुसाकर निर्देश दे रहा हो।

यहाँ इस "sous-chef" सिस्टम के काम करने का तरीका दिया गया है, जिसे सरल भागों में विभाजित किया गया है:

1. जमा हुआ मस्तिष्क (The Frozen Brain - द बैकबोन)

पेपर में कॉसमॉस के मूल मस्तिष्क को 'फ्रीज' (स्थिर) रखने की बात कही गई है। वे कॉसमॉस को शुरू से सब कुछ फिर से सिखाने की कोशिश नहीं करते क्योंकि इसमें बहुत समय लगता है और इससे वह वह सब कुछ भूल सकता है जो वह पहले से जानता है। इसके बजाय, वे मुख्य मस्तिष्क को वैसा ही रहने देते हैं और इसके चारों ओर चार नए "उपकरण" जोड़ देते हैं।

2. चार नए उपकरण (The Four Layers - चार परतें)

इन चार उपकरणों को रोबोट की मदद करने वाले विशेषज्ञों की एक टीम के रूप में समझें:

  • मेमोरी बुक (Neural Experience Memory Layer - न्यूरल एक्सपीरियंस मेमोरी लेयर):

    • यह क्या करता है: जब रोबोट किसी नए कार्य का सामना करता है (जैसे कटोरे में केला रखना), तो वह शून्य से शुरुआत नहीं करता। वह जल्दी से एक "मेमोरी बुक" के पन्ने पलटता है ताकि समान स्थितियों को ढूँढ सके जो उसने पहले देखी हैं।
    • उपमा: यह एक शेफ की तरह है जो कहता है, "ओह, मैंने पहले भी ऐसा फिसलन भरा केला देखा है! पिछली बार, मुझे इसे धीरे से पकड़ना पड़ा था।" यह वर्तमान चाल को निर्देशित करने के लिए पिछले अनुभवों का उपयोग करता है।
  • वॉचडॉग (Neural Anomaly Detection Layer - न्यूरल एनोमली डिटेक्शन लेयर):

    • यह क्या करता है: यह परत लगातार जाँचती है: "क्या जो मैं देख रहा हूँ वह मेरी भविष्यवाणी से मेल खाता है?" यदि रोबोट को लगता है कि उसने केला पकड़ा है लेकिन उसके सेंसर कहते हैं कि वहाँ कोई वजन नहीं है, या यदि वह दीवार से टकराने वाला है, तो वॉचडॉग चिल्लाता है "रुक जाओ!"
    • उपमा: यह एक सुरक्षा निरीक्षक की तरह है जो सीढ़ी पर चढ़ने से पहले ही उसकी डगमगाहट को भांप लेता है। यह "भ्रम" (यह सोचना कि आपने कुछ पकड़ा है जबकि आपने नहीं पकड़ा है) और टकराव को होने से पहले ही पकड़ लेता है।
  • ट्रैफिक पुलिस (Neural Policy Routing Layer - न्यूरल पॉलिसी रूटिंग लेयर):

    • यह क्या करता है: वॉचडॉग जो देखता है, उसके आधार पर ट्रैफिक पुलिस तय करती है कि आगे क्या करना है।
      • ग्रीन लाइट: सब कुछ ठीक दिख रहा है? आगे बढ़ो!
      • येलो लाइट: कुछ थोड़ा अजीब है? धीमे हो जाओ और सावधानी से रास्ता फिर से तय करो।
      • रेड लाइट: आपदा आ रही है? "अनडू" (Undo) बटन दबाओ और आखिरी सुरक्षित स्थान पर वापस जाओ।
    • उपमा: यह निर्णय लेने वाला व्यक्ति है जो चुनता है कि सीधे गाड़ी चलानी है, रास्ता बदलना है, या सुरक्षित पार्किंग स्थल पर वापस जाना है।
  • फिक्स-इट किट (Neural Action Correction Layer - न्यूरल एक्शन करेक्शन लेयर):

    • यह क्या करता है: यदि रोबोट गलती करने वाला होता है, तो यह परत गलती होने से ठीक पहले रोबोट की हाथ की गतिविधियों में सुधार करती है। यह गति को सुचारू बनाती है ताकि रोबंत कोई नरम फल न कुचल दे या कटोरा न छोड़ दे।
    • उपमा: यह एक डांस इंस्ट्रक्टर की तरह है जो आपके हाथ को धीरे से गाइड करता है ताकि आप स्पिन के दौरान अपने ही पैरों से न टकरा जाएं।

3. "क्वालिटी गेट" (फ़िल्टरिंग)

यह सिस्टम बहुत चूज़ी (नखरेबाज) है। यदि रोबोट कुछ प्रयास करता है और विफल हो जाता है (जैसे केला गिरा देना), तो सिस्टम उस विफलता को मेमोरी बुक में सेव नहीं करता है। यह केवल सफल और सुरक्षित प्रयासों को ही सेव करता है।

  • क्यों? कल्पना कीजिए कि आप केवल उन लोगों के वीडियो देखकर गाड़ी चलाना सीखते हैं जो दुर्घटनाग्रस्त होते हैं। आप गलत तरीका सीखेंगे! EWAM केवल "अच्छी" ड्राइविंग से सीखता है, जिससे यह सुनिश्चित होता है कि रोबोट अपनी गलतियों से भ्रमित हुए बिना स्मार्ट बनता जाए।

4. परिणाम: तेज़ और सुरक्षित

इस पेपर का परीक्षण "RoboLab" नामक एक सिमुलेशन पर किया गया, जिसमें केले को कटोरे में रखने या ब्लॉक को एक के ऊपर एक रखने जैसे कार्य शामिल थे।

  • गति: EWAM वाले रोबोट ने केला रखने का कार्य 9 सेकंड में पूरा किया, जबकि बिना EWAM वाले रोबोट को 25 सेकंड लगे।
  • गलतियाँ: बिना EWAM वाले रोबोट ने प्रत्येक प्रयास में 13.5 बार चीजों से टक्कर मारी या केला मिस कर दिया। EWAM वाले रोबोट ने केवल 2.2 गलतियाँ कीं।
  • सफलता दर: दोनों रोबोट अंततः 100% बार सफल हुए, लेकिन EWAM ने इसे बहुत तेज़ी से और बहुत कम क्रैश के साथ किया।

निचोड़ (The Bottom Line)

EWAM रोबोट को नई भाषा सिखाने के बारे में नहीं है; यह उसे एक सुरक्षा जाल और एक याददाश्त देने के बारे में है ताकि वह वास्तविक दुनिया के वातावरण में तुरंत खुद को ढाल सके। यह एक शक्तिशाली, प्री-ट्रेन्ड रोबोट को "कॉमन सेंस" की एक परत प्रदान करता है जो उसे टकराने से बचने, फिसलन से उबरने और काम को कुशलतापूर्वक पूरा करने में मदद करता है।

महत्वपूर्ण नोट: पेपर बताता है कि ये परिणाम एक कंप्यूटर सिमुलेशन (RoboLab) के हैं। उन्होंने अभी तक इसे वास्तविक रसोई में एक वास्तविक भौतिक रोबोट पर टेस्ट नहीं किया है, इसलिए हम अभी नहीं जानते कि क्या यह कंप्यूटर के बाहर भी काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →