← नवीनतम पेपर
💻 computer science

EmbodiedVAE: Disentangled Video VAE for Efficient and Controllable Embodied Manipulation

यह शोध पत्र EmbodiedVAE को प्रस्तुत करता है, जो एक नवीन वीडियो VAE है जिसमें एक डुअल-एनकोडर आर्किटेक्चर और एक ऑप्टिमल-ट्रांसपोर्ट-आधारित कंसिस्टेंसी मॉड्यूल है ताकि कॉम्पैक्ट, डिसेंटैंगल्ड लेटेंट रिप्रेजेंटेशन उत्पन्न किए जा सकें जो रोबोट की गति को बैकग्राउंड से अलग करते हैं, जिससे एम्बॉडीड मैनिपुलेशन वर्ल्ड मॉडल्स के लिए अधिक कुशल प्रशिक्षण और सटीक नियंत्रण सक्षम होता है।

मूल लेखक: Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

प्रकाशित 2026-08-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayi Luo, Hanxin Zhu, Chen Gao, Jiankun Wang, Cong Wang, Tianyu He, Jianxin Li, Zhibo Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। आप केवल यह नहीं चाहते कि रोबोट ब्रेड और हैम को देखे; आप चाहते हैं कि वह यह भी समझे कि उसका ग्रिपर (पकड़ने वाला हिस्सा) ठीक कैसे चलता है, हैम कैसे फिसलता है, और चाकू कैसे काटता है, और यह सब करते समय वह इस बात को पूरी तरह से अनदेखा कर दे कि किचन की मेज थोड़ी टेढ़ी है या रोशनी टिमटिमा रही है। यह "एम्बोडीड लर्निंग" (embodied learning) की दुनिया है, जहाँ आर्टिफिशियल इंटेलिजेंस भौतिक दुनिया के साथ अंतःक्रिया करके सीखने की कोशिश करता है, ठीक वैसे ही जैसे एक इंसान करता है। इसे कुशलतापूर्वक करने के लिए, वैज्ञानिक एक विशेष प्रकार के डिजिटल मस्तिष्क का उपयोग करते हैं जिसे "लेटेंट डिफ्यूजन मॉडल" (Latent Diffusion Model) कहा जाता है। इन मॉडलों को "सुपर-स्मार्ट सपने देखने वाले" के रूप में सोचें। वे वीडियो के हर एक पिक्सेल को याद नहीं करते (जो कि समुद्र तट पर रेत के हर कण को याद रखने जैसा होगा); इसके बजाय, वे वीडियो को एक छोटे, अमूर्त "सपने" या "लेटेंट" प्रतिनिधित्व में संकुचित कर देते हैं। यह सपना इस बात के सार को पकड़ लेता है कि वहां क्या हो रहा है। हालाँकि, अब तक, इन सपनों को बनाने के लिए उपयोग किए जाने वाले उपकरण फिल्में या प्रकृति के वृत्तचित्र देखने के लिए डिज़ाइन किए गए थे। वे सूर्यास्त या कार चेज़ को कैप्चर करने में बहुत अच्छे थे, लेकिन वे रोबोट के हिलते हुए हाथ को बैकग्राउंड के शोर से अलग करने में बहुत खराब थे। यह ऐसा था जैसे धुंधले चश्मे पहनकर भीड़ भरे कमरे में किसी विशिष्ट डांसर का पीछा करना; रोबोट की हरकतें शोर में खो जाती थीं, जिससे रोबोट को सटीक कौशल सिखाना कठिन हो जाता था।

यहीं पर EmbodiedVAE नामक एक नया आविष्कार आता है। इस प्रोजेक्ट के पीछे के शोधकर्ताओं ने महसूस किया कि रोबोट को वस्तुओं को संचालित करने के लिए सिखाने हेतु, आपको एक अलग प्रकार के "ड्रीम मशीन" की आवश्यकता होती है। उन्होंने एक नया वीडियो कंप्रेसर बनाया जो जादुई, स्प्लिट-फोकस चश्मे की तरह काम करता है। पूरे वीडियो को एक ही उलझे हुए ढेर में कुचलने के बजाय, यह नया सिस्टम वीडियो को दो अलग-अलग, सुपर-कॉम्पैक्ट कहानियों में स्वचालित रूप से विभाजित करता है: एक कहानी पूरी तरह से रोबोट के हाथ और उसकी सटीक गतिविधियों पर केंद्रित है, जबकि दूसरी कहानी बैकग्राउंड के वातावरण को कैप्चर करती है। यह ऐसा है जैसे एक निर्देशक कैमरे को कहता है, "एक्शन सीन के लिए रोबोट के हाथ पर ज़ूम करें," और साथ ही दूसरे कैमरे को कहता है, "बस बैकग्राउंड में कमरे को रखें, लेकिन विवरणों की चिंता न करें।" ऐसा करने से, रोब ביותר "सपना" अविश्वसनीय रूप से स्पष्ट और नियंत्रणीय हो जाता है। शोधकर्ताओं ने पाया कि यह अलगाव रोबोट को बहुत तेज़ी से सीखने और बहुत अधिक सटीकता के साथ चलने में मदद करता है। अपने परीक्षणों में, इस नए तरीके ने न केवल वीडियो को अच्छा दिखाया; बल्कि इसने मौजूदा सर्वोत्तम तरीकों की तुलना में इमेज क्वालिटी में 2dB का सुधार दिखाते हुए, रोबोट की निर्देशों का पालन करने की क्षमता में उल्लेखनीय वृद्धि की। उन्होंने यह भी साबित किया कि यह दृष्टिकोण तब भी काम करता है जब रोबोट का हाथ स्क्रीन के एक बड़े हिस्से को घेर लेता है, एक ऐसी स्थिति जहाँ पुराने तरीके आमतौर पर विफल हो जाते हैं।

इस सफलता के पीछे का असली रहस्य एक चतुर दो-भाग वाली संरचना (architecture) है। सबसे पहले, सिस्टम एक "डुअल-एनकोडर" सेटअप का उपयोग करता है। कल्पना कीजिए कि दो अलग-अलग कलाकार एक ही वीडियो को देख रहे हैं। एक कलाकार रोबोट के हाथ के प्रति जुनूनी है, इतना करीब ज़ूम करता है कि वह बैकग्राउंड को एक छोटे, धुंधले स्केच में संकुचित कर देता है। दूसरा कलाकार कमरे के प्रति जुनूनी है, जो रोबोट की गति को एक सरल, सुचारू प्रवाह में संकुचित करता है ताकि वह लाइटिंग और फर्नीचर पर ध्यान केंद्रित कर सके। ये दोनों कलाकार फिर अपने स्केच को एक एकल "डिकोडर" को सौंपते हैं जो उन्हें वापस जोड़कर एक परफेक्ट वीडियो बनाता है। यह सुनिश्चित करता है कि रोबोट की गतिविधियाँ बैकग्राउंड के शोर के साथ भ्रमित न हों।

यह सुनिश्चित करने के लिए कि रोबोट की गतिविधियाँ समय के साथ सुचारू और यथार्थवादी बनी रहें, टीम ने "ऑप्टिमल ट्रांसपोर्ट" (optimal transport) नामक एक गणितीय अवधारणा पर आधारित एक विशेष "कंसिस्टेंसी मॉड्यूल" जोड़ा है। इसे रोबोट की गति के लिए एक "ट्रैफिक कंट्रोलर" के रूप में सोचें। यदि रोबोट का हाथ बिंदु A से बिंदु B तक जाता है, तो यह मॉड्यूल सुनिश्चित करता है कि उस गति का "सपना" फ्रेम के बीच ग्लिच या जंप न करे। यह सिस्टम को गति के यात्रा करने के लिए सबसे कुशल, तार्किक पथ की गणना करने के लिए मजबूर करता है, जिससे यह सुनिश्चित होता है कि रोबोट अचानक टेलीपोर्ट न हो जाए या अनियंत्रित रूप से न हिले। शोधकर्ताओं ने इस सिस्टम को लगभग दस लाख रोबोटिक वीडियो के विशाल डेटासेट पर प्रशिक्षित किया, जिसमें साधारण पकड़ने से लेकर जटिल असेंबली कार्यों तक सब कुछ शामिल था।

परिणाम प्रभावशाली थे। जब उन्होंने अन्य शीर्ष-स्तरीय वीडियो कंप्रेसर के मुकाबले EmbodiedVAE का परीक्षण किया, तो यह न केवल बेहतर दिखा; बल्कि यह बहुत अधिक कुशल भी था। इसने केवल 0.39% की कंप्रेशन दर हासिल की, जिसका अर्थ है कि इसने वीडियो डेटा को उसके मूल आकार के आधे प्रतिशत से भी कम में बदल दिया, फिर भी महत्वपूर्ण विवरणों को तीक्ष्ण बनाए रखा। तुलना के लिए, कुछ अन्य उच्च-स्तरीय तरीकों की कंप्रेशन दर 2.08% या यहाँ तक कि 6.85% थी, फिर भी वे धुंधले परिणाम देते थे। रोबोट आगे क्या करेगा, इसकी भविष्यवाणी करने के विशिष्ट कार्य में (जो एक रोबोट के सीखने के लिए एक महत्वपूर्ण कौशल है), EmbodiedVAE ने Wan-VAE जैसे लोकप्रिय मॉडल सहित पिछले सर्वोत्तम तरीकों को स्पष्ट अंतर से पीछे छोड़ दिया। टीम का सुझाव है कि यह दृष्टिकोण रोबोटिक्स की एक बड़ी बाधा को हल करता है: "एक्टर" (रोबोट) को "स्टेज" (वातावरण) से अलग करने में असमर्थता। इन दोनों को अलग रखकर, रोबोट दुनिया के साथ एक ऐसे स्तर की सटीकता और दक्षता के साथ हेरफेर करना सीख सकता है जो पहले पहुंच से बाहर था। हालांकि यह पेपर इस नई संरचना की तकनीकी सफलता पर केंद्रित है, लेकिन इसका निहितार्थ स्पष्ट है: यदि हम चाहते हैं कि रोबोट हमारे घरों में निर्माण करें, खाना बनाएं और सफाई करें, तो हमें उन्हें अपनी क्रियाओं का एक स्पष्ट, बाधा रहित दृश्य चाहिए, और EmbodiedVAE बिल्कुल वही प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →