DexWorldModel: Causal Latent World Modeling towards Automated Learning of Embodied Tasks
यह शोध पत्र DexWorldModel प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जिसमें DINOv3-आधारित जनरेटिव लक्ष्यों के साथ कॉज़ल लेटेंट वर्ल्ड मॉडल (CLWM), निरंतर मेमोरी स्केलिंग के लिए डुअल-स्टेट टेस्ट-टाइम ट्रेनिंग, और लेटेंसी को कम करने के लिए स्पेक्युलेटिव एसिंक्रोनस इन्फरेंस शामिल है, जो स्वचालित एम्बोडीड टास्क लर्निंग के लिए अत्याधुनिक ज़ीरो-शॉट सिम-टू-रियल ट्रांसफर को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। अतीत में, आपको रोबोट को किसी व्यक्ति को सैंडविच बनाते हुए दिखाने वाला एक वीडियो दिखाना पड़ता था, और रोबोट ब्रेड के सटीक शेड, मक्खन पर पड़ने वाली रोशनी के तरीके और मेज की बनावट जैसे हर एक पिक्सेल को याद करने की कोशिश करता था। यदि आप सैंडविच को अलग रोशनी वाले दूसरे किचन में ले जाते, तो रोबोट भ्रमित हो जाता और ब्रेड गिरा देता। वह एक्शन (क्रिया) के बजाय पिक्चर (चित्र) को सीखने की कोशिश कर रहा था।
यह पेपर DexWorldModel पेश करता है, जो रोबोट को सिखाने का एक नया तरीका है जो खेल बदल देता है। इसे रोबोट के मस्तिष्क को एक "फोटोकॉपी करने वाली मशीन" से "रणनीतिक योजनाकार" (strategic planner) में अपग्रेड करने के रूप में समझें।
यह कैसे काम करता है, इसे चार सरल विचारों में विभाजित किया गया है:
1. "अब्स्ट्रैक्ट आर्टिस्ट" (Causal Latent World Model)
समस्या: पुराने रोबोट अगली फोटो बिल्कुल कैसी दिखेगी, इसका सटीक अनुमान लगाने की कोशिश करते थे। वे धूल के कण के हिलने या सूरज की रोशनी थोड़ी तेज होने जैसे उबाऊ विवरणों का अनुमान लगाने में अपनी दिमागी शक्ति बर्बाद करते थे।
समाधान: यह नया मॉडल, जिसे CLWM कहा जाता है, उबाऊ विवरणों (जैसे धूल और रोशनी) को अनदेखा करता है। इसके बजाय, यह दृश्य के अर्थ को देखने के लिए एक "स्मार्ट फिल्टर" (DINOv3) का उपयोग करता है।
- उपमा: एक फिल्म देखने की कल्पना करें। एक पुराना रोबोट हर अभिनेता की शर्ट के रंग और बैकग्राउंड के दृश्यों को याद करने की कोशिश करता है। यह नया रोबोट केवल प्लॉट (कथानक) को याद रखता है: "नायक तलवार उठाता है और उसे घुमाता है।"
- यह कैसे मदद करता है: क्योंकि यह स्पेशल इफेक्ट्स (पिक्सेल) के बजाय कहानी (इंटरेक्शन) पर ध्यान केंद्रित करता है, इसलिए यह पूरी तरह से नए किचन में जाकर भी सैंडविच बनाना जानता होगा। यह दुनिया के कारण और प्रभाव (causality) को समझता है।
2. "अनंत बैकपैक" (Constant Memory)
समस्या: किसी लंबे कार्य (जैसे पूरा घर साफ करना) की योजना बनाने के लिए, रोबोटों को आमतौर पर अब तक उठाए गए हर कदम को याद रखना पड़ता है। जैसे-जैसे कार्य लंबा होता जाता है, उनकी मेमोरी बहुत बड़ी होती जाती है, जैसे एक बैकपैक जो भारी होता जाता है और अंततः फट जाता है। अंततः, रोबोट की मेमोरी खत्म हो जाती है और वह क्रैश हो जाता है।
समाधान: लेखकों ने एक Dual-State TTT Memory बनाई है।
- उपमा: आपके द्वारा ली गई हर फोटो से भरा हुआ बैकपैक ले जाने के बजाय, कल्पना करें कि आपके पास एक स्मार्ट नोटबुक है। जब आप कुछ नया सीखते हैं, तो आप एक नया पेज नहीं जोड़ते; आप बस अपनी मौजूदा नोटबुक में स्याही को अपडेट करते हैं। चाहे आप कितने भी वर्षों तक उपयोग करें, नोटबुक का आकार समान रहता है।
- यह कैसे मदद करता है: रोबोट बिना कभी मेमोरी खत्म हुए घंटों या दिनों तक योजना बना सकता है। यह एक "कन्स्टेंट फुटप्रिंट" बनाए रखता है, जिसका अर्थ है कि यह बिना थके या भूले लंबे, जटिल कार्यों को संभाल सकता है।
3. "समानांतर विचारक" (Speculative Asynchronous Inference)
समस्या: आमतौर पर, रोबोट एक धीमे, सतर्क ड्राइवर की तरह काम करते हैं: "थोड़ा चला, रुका, आसपास देखा, अगले कदम के बारे में सोचा, थोड़ा चला, रुका..." रोबोट वास्तविक दुनिया के चलते समय खाली बैठा रहता है, जिससे देरी होती है।
समाधान: उन्होंने Speculative Asynchronous Inference (SAI) पेश किया है।
- उपमा: एक शेफ की कल्पना करें जो सब्जियां काट रहा है जबकि पानी उबल रहा है। रोबोट अगले कदम के बारे में सोचने के लिए पानी उबलने का इंतज़ार नहीं करता है। वह अपने "इमेजिनेशन" (कल्पना) का उपयोग करता है कि अगला दृश्य कैसा दिखेगा और भौतिक रूप से चलते समय ही योजना बनाना शुरू कर देता है।
- यह कैसे मदद करता है: यह प्रतीक्षा समय को आधा कर देता है। रोबोट हमेशा एक कदम आगे रहता है, जिससे वह दोगुना तेज़ और अचानक होने वाले बदलावों (जैसे कप का गिरना) के प्रति बहुत अधिक प्रतिक्रियाशील हो जाता है।
4. "अनंत सिम्युलेटर" (EmbodiChain)
समस्या: वास्तव में कुशल होने के लिए, रोबोटों को लाखों बार अभ्यास करने की आवश्यकता होती है। लेकिन आप एक इंसान को लाखों अलग-अलग कार्य करते हुए फिल्माने के लिए मजबूर नहीं कर सकते, और वास्तविक रोबोट टूट जाते हैं यदि आप उन्हें बहुत अधिक विफल होने देते हैं।
समाधान: उन्होंने EmbodiChain बनाया है, जो अभ्यास डेटा की एक अनंत धारा उत्पन्न करता है।
- उपमा: रोबोट को कोई कार्य करने के लिए मानव कोच दिखाने के बजाय, आप रोबोट को एक वीडियो गेम देते हैं जो कभी खत्म नहीं होता। गेम नए स्तर, नई बाधाएं बनाता है, और यहाँ तक कि रोबट को विफल होने और उससे उबरना सीखने की अनुमति भी देता है, और यह सब एक सुरक्षित, वर्चुअल दुनिया में होता है।
- यह कैसे मदद करता है: रोबोट लाखों अद्वितीय, भौतिकी-परफेक्ट परिदृश्यों पर अभ्यास करता है। जब वह अंततः वास्तविक दुनिया में जाता है, तो वह इतना प्रशिक्षित होता है कि उसे किसी मानवीय सहायता की आवश्यकता नहीं होती। यह उस पायलट की तरह है जिसने सिम्युलेटर में 10,000 घंटे उड़ान भरी है और अपने पहले ही वास्तविक उड़ान में विमान को पूरी तरह से लैंड कर सकता है।
बड़ा परिणाम
टीम ने इस परीक्षण को दो हाथों वाले एक वास्तविक रोबोट पर किया। उन्होंने इसे केवल कंप्यूटर सिमुलेशन में प्रशिक्षित किया (उनके अनंत अभ्यास सिस्टम का उपयोग करके)। फिर, उन्होंने इसे जटिल कार्य करने के लिए वास्तविक दुनिया में भेजा जैसे कि पानी डालना, मेज को व्यवस्थित करना और पैन खोलना।
रोबोट बिना कभी वास्तविक जीवन में किसी इंसान को देखे, सफल रहा। उसने उन अन्य रोबोटों को भी पछाड़ दिया जिन्हें विशेष रूप से वास्तविक मानव वीडियो पर प्रशिक्षित किया गया था।
संक्षेप में: उन्होंने रोबोट को दुनिया के लॉजिक (तर्क) को समझने के लिए सिखाया, उसे अनंत मेमोरी दी, उसे चलते समय सोचने के काबिल बनाया, और उसे एक सुपर-चार्ज्ड वीडियो गेम में अभ्यास करने दिया। परिणाम एक ऐसा रोबोट है जो तेज़, स्मार्ट और वास्तविक दुनिया के लिए तैयार है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।