Flex-: A Multi-Stream World-Action Model with Compute Flexibility
फ्लेक्स- (Flex-) एक 6B-पैरामीटर वाला वर्ल्ड-एक्शन मॉडल है जो RGB के साथ-साथ 3D ज्यामिति और वस्तु अर्थविज्ञान (object semantics) को अंतर्निहित रूप से एनकोड करने के लिए एक फ्रोजन वीडियो-जेनरेशन VAE का लाभ उठाता है, जो एक लचीले, मल्टी-स्ट्रीम प्रशिक्षण दृष्टिकोण को सक्षम बनाता है जो बिना किसी नए सेंसर या प्री-ट्रेनिंग के वास्तविक दुनिया के द्विपक्षीय (bimanual) हेरफेर कार्यों में बेहतर सामान्यीकरण और दक्षता प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक रोबोट एक शर्ट को मोड़ने या टूटे हुए खिलौने को ठीक करने का तरीका सीखने की कोशिश कर रहा है। लंबे समय तक, वैज्ञानिकों ने रोबोट्स को इंसानों द्वारा काम करने के हजारों वीडियो दिखाकर सिखाया, इस उम्मीद में कि रोबोट बस उन गतिविधियों की "नकल" कर लेगा। लेकिन यह कार चलाने सीखने के लिए केवल डैशबोर्ड की लाइटों को देखने जैसा है; आप स्पीडोमीटर को ऊपर जाते देखते हैं, लेकिन आप सड़क, घुमावों या अन्य कारों को नहीं समझते हैं। "वर्ल्ड-एक्शन मॉडल्स" (World-Action Models) नामक एक नया, स्मार्ट दृष्टिकोण इस समस्या को ठीक करने की कोशिश करता है। केवल नकल करने के बजाय, ये मॉडल यह अनुमान लगाने की कोशिश करते हैं कि भविष्य में क्या होने वाला है। वे पूछते हैं, "यदि मैं अपने हाथ को इस तरह हिलाता हूँ, तो एक सेकंड बाद दुनिया कैसी दिखेगी?" भविष्य का अनुमान लगाकर, रोबोट भौतिकी के नियमों और वस्तुओं के बीच होने वाली अंतःक्रियाओं (interactions) को सीखता है, जिससे वह बिना लाखों उदाहरणों के नए कार्यों को समझने में बहुत बेहतर हो जाता है। हालाँकि, अधिकांश स्मार्ट रोबोट केवल सपाट, 2D चित्रों (जैसे एक मानक कैमरा) को देखते हैं, जो 3D वस्तु को पकड़ने के प्रयास में भ्रमित करने वाला हो सकता है जो किसी चीज़ के पीछे छिपी हो सकती है।
यहाँ FLEX-π आता है, एक नया रोबोटिक मस्तिष्क जो इस पहेली को एक चतुर तरकीब से सुलझाता है। FLEX-π को एक मास्टर शेफ की तरह समझें जो सूप का स्वाद लेकर तुरंत जान सकता है कि उसमें कौन से मसाले हैं, वह कितना गर्म है, और कितना गाढ़ा है, भले ही उसके पास केवल एक चम्मच तरल हो। अतीत में, रोबोट को 3D आकारों (जैसे गहराई) या वस्तुओं के अर्थ (जैसे "यह एक कप है, गेंद नहीं") को समझने के लिए, वैज्ञानिकों को उसे महंगे 3D कैमरे देने पड़ते थे या उसे दुनिया को देखने के बिल्कुल नए तरीके सिखाने पड़ते थे। हालाँकि, FLEX-π ने एक "फ्री लंच" (मुफ्त का लाभ) खोज निकाला। इसने महसूस किया कि जिस मस्तिष्क का उपयोग यह फ्लैट चित्रों को समझने के लिए करता है, वही मस्तिष्क बिना किसी अतिरिक्त प्रशिक्षण या नए हार्डवेयर के लगभग पूरी तरह से 3D आकारों और वस्तुओं के अर्थों को भी समझ सकता है।
शोधकर्ताओं ने एक 6-बिलियन-पैरामीटर वाला मॉडल (एक बहुत बड़ा डिजिटल मस्तिष्क) बनाया है जो एक साथ तीन चीजों की भविष्यवाणी करना सीखता है: अगली तस्वीर कैसी दिखेगी, दृश्य का 3D आकार क्या होगा, और दृश्य में महत्वपूर्ण वस्तुएं क्या हैं। जादू तब होता है जब वे रोबोट को इन तीनों चीजों को एक साथ कल्पना करने के लिए प्रशिक्षित करते हैं। यदि रोबोट एक कप की तस्वीर देखता है, तो वह केवल एक सपाट छवि नहीं देखता; वह साथ ही साथ कप की 3D गहराई की कल्पना करता है और जानता है कि वह एक "कप" है। इससे भी बेहतर, उन्होंने रोबोट को लचीला होना सिखाया। प्रशिक्षण के दौरान, वे कभी-कभी 3D डेटा या वस्तुओं के नाम छिपा देते थे, जिससे रोबोट केवल फ्लैट चित्र का उपयोग करके उनका अनुमान लगाने के लिए मजबूर होता था। इसका मतलब है कि जब रोबोट वास्तव में काम कर रहा होता है, तो वह केवल कैमरे का उपयोग करके (3D और ऑब्जेक्ट डेटा को अनदेखा करते हुए) "फास्ट मोड" में चल सकता है और फिर भी अविश्वसनीय रूप से स्मार्ट हो सकता है, या यदि उसके पास समय है तो वह सभी डेटा का उपयोग करके "सुपर मोड" में चल सकता है।
परिणाम प्रभावशाली हैं। जब वास्तविक रोबोटों पर कठिन कार्यों के लिए परीक्षण किया गया—जैसे मिलीमीटर की सटीकता के साथ अपने ग्रिपर को ठीक करने के लिए स्क्रूड्राइवर का उपयोग करना, या एक नरम, स्पंजी पेंसिल केस की ज़िप बंद करना—तो FLEX-π ने मौजूदा सर्वश्रेष्ठ रोबोटिक मस्तिष्कों को भारी अंतर से पछाड़ दिया, कभी-कभी 2 से 7 गुना बेहतर प्रदर्शन किया। इसने इन जटिल कौशलों को बहुत कम प्रदर्शनों (demonstrations) के साथ सीखा, जिसका अर्थ है कि इसे काम करने के लिए इंसानों को सैकड़ों बार देखने की आवश्यकता नहीं थी। शायद सबसे आश्चर्यजनक बात यह है कि जब FLEX-π को "फास्ट मोड" पर सेट किया गया था और इसने केवल कैमरे का उपयोग किया (अतिरिक्त 3D और ऑब्जेक्ट डेटा को अनदेखा करते हुए), तब भी यह अन्य शीर्ष रोबोटों की तुलना में अधिक तेज़ और अधिक सफल था। यह शोध पत्र दिखाता है कि रोबोट को 3D में और वस्तु के अर्थ के साथ भविष्य की कल्पना करने के लिए सिखाकर, हम इसे और अधिक स्मार्ट और अनुकूलन योग्य बना सकते हैं, और यह सब बिना किसी नए सेंसर या अपनी गति धीमी किए किया जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।