← नवीनतम पेपर
💻 computer science

DC-WAM: Dynamic-Centric Visual Supervision and Reasoning for World-Action Models

DC-WAM एक डायनेमिक-सेंट्रिक फ्रेमवर्क है जो वर्ल्ड-एक्शन मॉडल्स को फोटोरियलिस्टिक अपीयरेंस से इंटरैक्शन-प्रेरित विजुअल डायनेमिक्स की ओर सुपरविजन को स्थानांतरित करके और एक टोकन-वाइज डायनेमिक रिलिवेंस प्रेडिक्टर का उपयोग करके बेहतर बनाता है, जिससे तैनाती के समय अतिरिक्त मोडैलिटीज की आवश्यकता के बिना रोबोट नियंत्रण प्रदर्शन और पर्यावरणीय व्यवधानों के प्रति मजबूती में सुधार होता है।

मूल लेखक: Haoyuan Ji, Lingxiang Fan, Shang Su, Yinqiao Lu, Mengkai Shi, Jun Gao, Shuo Feng

प्रकाशित 2026-07-29
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoyuan Ji, Lingxiang Fan, Shang Su, Yinqiao Lu, Mengkai Shi, Jun Gao, Shuo Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखा रहे हैं। आप उसे एक शेफ की सब्जी काटने का वीडियो दिखाते हैं, और रोबोट उस वीडियो के अगले फ्रेम (frame) की भविष्यवाणी करके सीखने की कोशिश करता है। यह वर्ल्ड-एक्शन मॉडल्स (World-Action Models - WAMs) की दुनिया है। ये विशेष AI दिमाग हैं जो न केवल रोबोट को यह बताते हैं कि क्या करना है; बल्कि वे यह भी कल्पना करने की कोशिश करते हैं कि रोबोट के हिलने-डुलने पर भविष्य कैसा दिखेगा। विचार यह है कि यदि रोबोट यह सटीक रूप से सीख सके कि दृश्य कैसे बदलेगा—जैसे चाकू द्वारा गाजर को काटना या बर्तन को उठाना—तो वह बेहतर तरीके से चलना सीख जाएगा।

लंबे समय तक, वैज्ञानिकों ने सोचा कि इन रोबots को सिखाने का सबसे अच्छा तरीका यह है कि उन्हें भविष्य के वीडियो के हर एक विवरण की भविष्यवाणी करने के लिए बनाया जाए, जैसे मेजपोश की बनावट, रोशनी का विशिष्ट पैटर्न और दीवार का रंग। यह एक छात्र को गणित की समस्या हल करने के लिए पूरी पाठ्यपुस्तक को, यहाँ तक कि उसके फॉन्ट साइज और कागज की गुणवत्ता को भी याद करने के लिए कहने जैसा है। लेकिन समस्या यह है: रोबोट को फॉन्ट साइज की परवाह नहीं है। उसे गणित की परवाह है। यदि रोबोट अपना सारा दिमागी बल बैकग्राउंड को पूरी तरह से फिर से बनाने में खर्च कर देता है, तो वह यह देखना भूल सकता है कि चाकू चल रहा है या बर्तन गिरने वाला है। यह शोध पत्र एक सरल प्रश्न पूछता है: क्या होगा यदि हम रोबोट को उबाऊ, स्थिर विवरणों को अनदेखा करना और केवल उन हिस्सों पर ध्यान केंद्रित करना सिखाएं जो वास्तव में उसके कार्यों के कारण बदलते हैं?

इस शोध पत्र के लेखक, कंप्यूटर सिमुलेशन और वास्तविक दुनिया दोनों में रोबोट्स के साथ काम करते हुए, एक नई विधि प्रस्तावित करते हैं जिसे DC-WAM (डायनामिक-सेंट्रिक विजुअल सुपरविजन) कहा जाता है। उनका तर्क है कि रोब-ोट्स को "फोटोरियलिस्टिक" (यथार्थवादी) भविष्य की भविष्यवाणी करने के लिए सिखाने का पुराना तरीका वास्तव में उन्हें पीछे खींच रहा है। एक पूर्ण कैमरा बनने के बजाय जो हर छाया और धूल के कण को रिकॉर्ड करता है, वे चाहते हैं कि रोबोट एक जासूस बन जाए जो केवल गति और अंतःक्रिया (interaction) को देखता है।

यहाँ बताया गया है कि उन्होंने यह कैसे किया और उन्हें क्या मिला।

समस्या: बहुत अधिक शोर, बहुत कम संकेत (Too Much Noise, Not Enough Signal)

अतीत में, इन रोबोट ब्रेन्स को प्रशिक्षित करते समय, वैज्ञानिक एक "लॉस फंक्शन" (एक स्कोरकार्ड जो यह बताता है कि रोबोट कितनी अच्छी तरह सीख रहा है) का उपयोग करते थे जो रोबोट को भविष्य की तस्वीर के किसी भी हिस्से को गलत करने पर दंडित करता था। यदि रोबोट ने कप की भविष्य की स्थिति सही बताई लेकिन दीवार का रंग थोड़ा गलत कर दिया, तो भी उसे खराब स्कोर मिलता था। इसका मतलब था कि रोबोट दीवार के रंग को याद करने में अपनी ऊर्जा बर्बाद कर रहा था, जिससे उसे कप पकड़ने में कोई मदद नहीं मिलती।

यह शोध पत्र सुझाव देता है कि यह "अपीयरेंस-फोकस्ड" (दिखावट-केंद्रित) प्रशिक्षण नाजुक है। यदि आप कमरे में रोशनी बदल देते हैं या दीवार पर अलग पैटर्न लगा देते हैं, तो रोबोट भ्रमित हो जाता है क्योंकि उसे उन चीजों की परवाह करने के लिए प्रशिक्षित किया गया था। यह एक ऐसे ड्राइवर की तरह है जिसने केवल धूप वाले दिनों और हरी घास पर गाड़ी चलाना सीखा है; जैसे ही बारिश होती है या घास भूरी हो जाती है, वे घबरा जाते हैं।

समाधान: "डायनामिक-सेंट्रिक" दृष्टिकोण

लेखकों ने DC-WAM पेश किया, जो खेल के नियमों को दो चतुर तरीकों से बदलता है:

  1. "चीज़" के बजाय "बदलाव" पर ध्यान दें: रोबोट को पूरी तस्वीर की भविष्यवाणी करने के लिए कहने के बजाय, उन्होंने इसे फ्रेमों के बीच के अंतर पर ध्यान केंद्रित करना सिखाया। उन्होंने टेम्पोरल-डिफरेंस सुपरविजन नामक तकनीक का उपयोग किया। एक फ्लिपबुक एनीमेशन देखने की कल्पना करें। यह शोध पत्र रोबोट को उन पन्नों को अनदेखा करना सिखाता है जो बिल्कुल एक जैसे दिखते हैं (स्थिर बैकग्राउंड) और केवल उन पन्नों पर ध्यान देना सिखाता है जहाँ कुछ हिलता है। उन्होंने एक "ट्रैकर" (चलते हुए बिंदुओं का पीछा करने वाला टूल) का भी उपयोग किया ताकि यह उजागर किया जा सके कि रोबोट का हाथ (ग्रिपर) और वस्तुएं कहाँ हिल रही हैं। यह एक "डायनामिक मैप" बनाता है जो रोबोट को बताता है: "हे, यहाँ देखो! कप हिल रहा है! बाकी को अनदेखा करो!"

  2. "DynaRoute" अटेंशन मैकेनिज्म: सही प्रशिक्षण के बावजूद, रोबोट का दिमाग (एक न्यूरल नेटवर्क) अभी भी गलत चीजों को देख सकता है। इसे ठीक करने के लिए, लेखकों ने DynaRoute नामक एक मॉड्यूल जोड़ा। इसे एक थिएटर में स्पॉटलाइट ऑपरेटर के रूप में सोचें। जब रोबोट अपने अगले कदम का निर्णय लेने की कोशिश कर रहा होता है, तो DynaRoute भविष्य के वीडियो के उन हिस्सों पर एक तेज रोशनी डालता है जिनमें गति शामिल होती है (जैसे ग्रिपर का बंद होना) और बाकी सब कुछ (जैसे स्थिर बैकग्राउंड) पर रोशनी को धीमा कर देता है। यह रोबोट के ध्यान को क्रिया (action) पर टिके रहने के लिए मजबूर करता है।

परिणाम: बेहतर रोबोट, कम पूर्ण चित्र

इस शोध पत्र का सबसे आश्चर्यजनक निष्कर्ष यह है कि रोबोट को एक "खराब" चित्र की भविष्यवाणी करने से वास्तव में एक बेहतर रोबोट बनता है।

अपने प्रयोगों में, लेखकों ने PSNR (पीक सिग्नल-टू-नॉइज़ रेशियो) नामक एक मानक मीट्रिक का उपयोग करके मापा कि रोबोट कितने बेहतर प्रदर्शन करते हैं, जो मूल रूप से यह मापता है कि अनुमानित वीडियो कितना स्पष्ट और पूर्ण है।

  • पुराने तरीकों (जैसे FastWAM) ने बहुत स्पष्ट, उच्च-गुणवत्ता वाले भविष्य के वीडियो (उच्च PSNR) बनाए।
  • नया DC-WAM तरीका थोड़े धुंधले और कम पूर्ण वीडियो (कम PSNR) बनाता है।

हालाँकि, जब वास्तव में कार्य करने की बात आई, तो DC-WAM ने स्पष्ट जीत हासिल की।

  • LIBERO सिमुलेशन परीक्षणों में (एक मानक रोबोट बेंचमार्क), DC-WAM ने 98.1% सफलता दर हासिल की, जो पिछले सर्वश्रेष्ठ से स्पष्ट अंतर से आगे है।
  • इससे भी महत्वपूर्ण बात यह है कि जब शोधकर्ताओं ने LIBERO-Plus (एक ऐसा संस्करण जहाँ उन्होंने रोबोट को चकमा देने के लिए लाइटिंग, बैकग्राउंड और ऑब्जेक्ट के रंगों को बदल दिया) में परीक्षण किया, तो DC-WAM मजबूत बना रहा। इसने 60.9% की सफलता दर प्राप्त की, जबकि पुराने तरीके काफी गिर गए।
  • वास्तविक दुनिया के परीक्षणों में, एक दो-हाथ वाले रोबोट (Agilex Piper) के साथ, DC-WAM ने कटोरे रखने और टोकरियाँ खोलने जैसे कार्यों में सफलता दर में सुधार किया, विशेष रूप से जब रोशनी बदली गई या बैकग्राउंड में भीड़भाड़ थी।

यह शोध पत्र स्पष्ट रूप से इस विचार को खारिज करता है कि एक अच्छा रोबोट पॉलिसी होने के लिए आपको एक पूर्ण, फोटोरियलिस्टिक भविष्य के वीडियो की आवश्यकता है। उन्होंने दिखाया कि डायनामिक्स (गति और अंतःक्रिया) पर ध्यान केंद्रित करना अपीयरेंस (रंग और बनावट) की तुलना में कहीं अधिक महत्वपूर्ण है।

यह क्यों मायने रखता है

यह शोध बताता है कि हमें ऐसे रोबोट बनाने की आवश्यकता नहीं है जो पूर्ण कलाकार हों; हमें ऐसे रोबोट चाहिए जो कारण और प्रभाव (cause and effect) के अच्छे पर्यवेक्षक हों। रोबोट को दुनिया के "शोर" (जैसे बदलती रोशनी या बैकग्राउंड पैटर्न) को अनदेखा करने और केवल "संकेत" (रोबोट द्वारा किसी वस्तु को हिलाने) पर ध्यान केंद्रित करने के लिए सिखाकर, हम उन्हें बहुत अधिक मजबूत बना सकते हैं।

लेखक नोट करते हैं कि इस विधि के लिए वास्तविक कार्य के दौरान किसी अतिरिक्त सेंसर या विशेष कैमरों की आवश्यकता नहीं होती है। रोबोट उसी मानक कैमरे का उपयोग करता है जो वह हमेशा करता है, लेकिन उसका दिमाग दुनिया को अलग तरह से देखने के लिए फिर से प्रशिक्षित किया गया है। यह एक याद दिलाता है कि कभी-कभी, भविष्य को स्पष्ट रूप रूप से देखने के लिए, आपको विवरणों को देखना बंद करना होगा और गति को देखना शुरू करना होगा।

संक्षेप में, DC-WAM साबित करता है कि एक रोबोट के लिए, यह जानना कि कप कहाँ जा रहा है, यह जानने से बहुत अधिक महत्वपूर्ण है कि उसके पीछे की दीवार का रंग क्या है। और रोबोट को "क्या" के बजाय "कहाँ" को प्राथमिकता देना सिखाकर, हम ऐसी मशीनें बना सकते हैं जो वास्तविक, अप्रत्याशित दुनिया के लिए तैयार हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →