← नवीनतम पेपर
💻 computer science

Flex-π\pi: A Multi-Stream World-Action Model with Compute Flexibility

फ्लेक्स-π\pi (Flex-π\pi) एक 6B-पैरामीटर वाला वर्ल्ड-एक्शन मॉडल है जो RGB के साथ-साथ 3D ज्यामिति और वस्तु अर्थविज्ञान (object semantics) को अंतर्निहित रूप से एनकोड करने के लिए एक फ्रोजन वीडियो-जेनरेशन VAE का लाभ उठाता है, जो एक लचीले, मल्टी-स्ट्रीम प्रशिक्षण दृष्टिकोण को सक्षम बनाता है जो बिना किसी नए सेंसर या प्री-ट्रेनिंग के वास्तविक दुनिया के द्विपक्षीय (bimanual) हेरफेर कार्यों में बेहतर सामान्यीकरण और दक्षता प्राप्त करता है।

मूल लेखक: Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

प्रकाशित 2026-08-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ge Yan, Jinghao Liu, Yuzhi Fan, Lei Cai, Minwen Liao, Jesse Zhang, Dieter Fox

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक रोबोट एक शर्ट को मोड़ने या टूटे हुए खिलौने को ठीक करने का तरीका सीखने की कोशिश कर रहा है। लंबे समय तक, वैज्ञानिकों ने रोबोट्स को इंसानों द्वारा काम करने के हजारों वीडियो दिखाकर सिखाया, इस उम्मीद में कि रोबोट बस उन गतिविधियों की "नकल" कर लेगा। लेकिन यह कार चलाने सीखने के लिए केवल डैशबोर्ड की लाइटों को देखने जैसा है; आप स्पीडोमीटर को ऊपर जाते देखते हैं, लेकिन आप सड़क, घुमावों या अन्य कारों को नहीं समझते हैं। "वर्ल्ड-एक्शन मॉडल्स" (World-Action Models) नामक एक नया, स्मार्ट दृष्टिकोण इस समस्या को ठीक करने की कोशिश करता है। केवल नकल करने के बजाय, ये मॉडल यह अनुमान लगाने की कोशिश करते हैं कि भविष्य में क्या होने वाला है। वे पूछते हैं, "यदि मैं अपने हाथ को इस तरह हिलाता हूँ, तो एक सेकंड बाद दुनिया कैसी दिखेगी?" भविष्य का अनुमान लगाकर, रोबोट भौतिकी के नियमों और वस्तुओं के बीच होने वाली अंतःक्रियाओं (interactions) को सीखता है, जिससे वह बिना लाखों उदाहरणों के नए कार्यों को समझने में बहुत बेहतर हो जाता है। हालाँकि, अधिकांश स्मार्ट रोबोट केवल सपाट, 2D चित्रों (जैसे एक मानक कैमरा) को देखते हैं, जो 3D वस्तु को पकड़ने के प्रयास में भ्रमित करने वाला हो सकता है जो किसी चीज़ के पीछे छिपी हो सकती है।

यहाँ FLEX-π आता है, एक नया रोबोटिक मस्तिष्क जो इस पहेली को एक चतुर तरकीब से सुलझाता है। FLEX-π को एक मास्टर शेफ की तरह समझें जो सूप का स्वाद लेकर तुरंत जान सकता है कि उसमें कौन से मसाले हैं, वह कितना गर्म है, और कितना गाढ़ा है, भले ही उसके पास केवल एक चम्मच तरल हो। अतीत में, रोबोट को 3D आकारों (जैसे गहराई) या वस्तुओं के अर्थ (जैसे "यह एक कप है, गेंद नहीं") को समझने के लिए, वैज्ञानिकों को उसे महंगे 3D कैमरे देने पड़ते थे या उसे दुनिया को देखने के बिल्कुल नए तरीके सिखाने पड़ते थे। हालाँकि, FLEX-π ने एक "फ्री लंच" (मुफ्त का लाभ) खोज निकाला। इसने महसूस किया कि जिस मस्तिष्क का उपयोग यह फ्लैट चित्रों को समझने के लिए करता है, वही मस्तिष्क बिना किसी अतिरिक्त प्रशिक्षण या नए हार्डवेयर के लगभग पूरी तरह से 3D आकारों और वस्तुओं के अर्थों को भी समझ सकता है।

शोधकर्ताओं ने एक 6-बिलियन-पैरामीटर वाला मॉडल (एक बहुत बड़ा डिजिटल मस्तिष्क) बनाया है जो एक साथ तीन चीजों की भविष्यवाणी करना सीखता है: अगली तस्वीर कैसी दिखेगी, दृश्य का 3D आकार क्या होगा, और दृश्य में महत्वपूर्ण वस्तुएं क्या हैं। जादू तब होता है जब वे रोबोट को इन तीनों चीजों को एक साथ कल्पना करने के लिए प्रशिक्षित करते हैं। यदि रोबोट एक कप की तस्वीर देखता है, तो वह केवल एक सपाट छवि नहीं देखता; वह साथ ही साथ कप की 3D गहराई की कल्पना करता है और जानता है कि वह एक "कप" है। इससे भी बेहतर, उन्होंने रोबोट को लचीला होना सिखाया। प्रशिक्षण के दौरान, वे कभी-कभी 3D डेटा या वस्तुओं के नाम छिपा देते थे, जिससे रोबोट केवल फ्लैट चित्र का उपयोग करके उनका अनुमान लगाने के लिए मजबूर होता था। इसका मतलब है कि जब रोबोट वास्तव में काम कर रहा होता है, तो वह केवल कैमरे का उपयोग करके (3D और ऑब्जेक्ट डेटा को अनदेखा करते हुए) "फास्ट मोड" में चल सकता है और फिर भी अविश्वसनीय रूप से स्मार्ट हो सकता है, या यदि उसके पास समय है तो वह सभी डेटा का उपयोग करके "सुपर मोड" में चल सकता है।

परिणाम प्रभावशाली हैं। जब वास्तविक रोबोटों पर कठिन कार्यों के लिए परीक्षण किया गया—जैसे मिलीमीटर की सटीकता के साथ अपने ग्रिपर को ठीक करने के लिए स्क्रूड्राइवर का उपयोग करना, या एक नरम, स्पंजी पेंसिल केस की ज़िप बंद करना—तो FLEX-π ने मौजूदा सर्वश्रेष्ठ रोबोटिक मस्तिष्कों को भारी अंतर से पछाड़ दिया, कभी-कभी 2 से 7 गुना बेहतर प्रदर्शन किया। इसने इन जटिल कौशलों को बहुत कम प्रदर्शनों (demonstrations) के साथ सीखा, जिसका अर्थ है कि इसे काम करने के लिए इंसानों को सैकड़ों बार देखने की आवश्यकता नहीं थी। शायद सबसे आश्चर्यजनक बात यह है कि जब FLEX-π को "फास्ट मोड" पर सेट किया गया था और इसने केवल कैमरे का उपयोग किया (अतिरिक्त 3D और ऑब्जेक्ट डेटा को अनदेखा करते हुए), तब भी यह अन्य शीर्ष रोबोटों की तुलना में अधिक तेज़ और अधिक सफल था। यह शोध पत्र दिखाता है कि रोबोट को 3D में और वस्तु के अर्थ के साथ भविष्य की कल्पना करने के लिए सिखाकर, हम इसे और अधिक स्मार्ट और अनुकूलन योग्य बना सकते हैं, और यह सब बिना किसी नए सेंसर या अपनी गति धीमी किए किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →