WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling
यह शोधपत्र WorldBagel को प्रस्तुत करता है, जो BAGEL आर्किटेक्चर पर निर्मित एक एकीकृत विजन-लैंग्वेज-एक्शन-वर्ल्ड मॉडलिंग फ्रेमवर्क है, जो यह प्रदर्शित करता है कि मल्टीमॉडल जनरेशन और वर्ल्ड मॉडलिंग को एकीकृत करने से विविध रोबोटिक मैनिपुलेशन कार्यों में कार्य-विशिष्ट विकल्पों की तुलना में बेहतर प्रदर्शन और अधिक संरचित एक्शन रिप्रजेंटेशन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखा रहे हैं। वर्तमान के अधिकांश रोबोट उन शेफ की तरह होते हैं जो केवल रेसिपी (भाषा) और सामग्री (दृष्टि/विज़न) को देखते हैं ताकि यह तय किया जा सके कि आगे क्या करना है। वे निर्देशों का पालन करने में बहुत अच्छे हैं, लेकिन वे वास्तव में यह नहीं समझते कि रसोई कैसे काम करती है। उन्हें सहज रूप से यह नहीं पता होता कि यदि आप बर्तन को बहुत ज़ोर से धकेलते हैं, तो वह काउंटर से फिसल जाएगा, या उबलते हुए पैन से भाप उठेगी।
WorldBagel एक नए प्रकार का रोबोटिक मस्तिष्क है जो इसे बदल देता है। यह केवल एक ऐसे शेफ की तरह नहीं है जो आदेशों का पालन करता है, बल्कि यह रोबोट के भीतर एक सिम्युलेटर (simulator) की तरह काम करता है। यह केवल यह तय नहीं करता कि क्या करना है; यह लगातार कल्पना करता है कि कुछ करने के बाद दुनिया कैसी दिखेगी।
यहाँ बताया गया है कि यह कैसे काम करता है, शोध पत्र के अपने दावों का उपयोग करते हुए:
1. "टू-टावर" (Two-Tower) मस्तिष्क
सोचिए कि रोबोट का मस्तिष्क दो विशिष्ट विशेषज्ञों के रूप में है जो एक ही कार्यालय में काम कर रहे हैं:
- "समझने वाला" विशेषज्ञ (UND): यह विशेषज्ञ एक तस्वीर देखने और एक वाक्य पढ़ने में माहिर है ताकि यह पता लगाया जा सके कि रोबोट को अभी क्या करना चाहिए। यह "करने वाला" (doer) है।
- "जनरेशन" विशेषज्ञ (GEN): यह एक सपने देखने वाला है। यह वर्तमान दृश्य और रोबोट के इच्छित कार्य को देखता है, और फिर पूछता है, "यदि मैं यह करता हूँ, तो एक सेकंड में रसोई कैसी दिखेगी?" यह भविष्य की भविष्यवाणी करता है।
WorldBagel इन दोनों विशेषज्ञों को एक ही नोटबुक साझा करने के लिए मजबूर करता है। वे केवल साथ-साथ काम नहीं करते; वे एक-दूसरे से सीखते हैं। भविष्य की भविष्यवाणी करने की कोशिश करके, रोबोट वर्तमान को समझने में बेहतर हो जाता है।
2. गुप्त नुस्खा: "फूरियर" (Fourier) क्रियाएं
रोबोट सुचारू और निरंतर तरीके से चलते हैं (जैसे हवा में तैरता हुआ हाथ), लेकिन कंप्यूटर आमतौर पर चरणों या ब्लॉक्स में सोचते हैं। शोध पत्र एक चतुर तकनीक पेश करता है जिसे फूरियर फीचर टोकेनाइजेशन (Fourier Feature Tokenization) कहा जाता है।
कल्पना कीजिए कि आप एक चिकनी लहर (smooth wave) का वर्णन करने की कोशिश कर रहे हैं। आप इसे टेढ़े-मेढ़े लेगो ब्लॉक्स (discretization) के साथ बनाने की कोशिश कर सकते हैं, लेकिन यह ऊबड़-खाबड़ और गलत दिखेगा। या, आप उस लहर का वर्णन संगीत के विशिष्ट स्वरों (frequencies) का उपयोग करके कर सकते हैं जो, एक साथ बजने पर, उस चिकनी लहर को पूरी तरह से पुन: निर्मित करते हैं।
WorldBagel रोबोट की गतिविधियों के लिए इस "संगीत के स्वर" वाले दृष्टिकोण का उपयोग करता है। यह रोबोट की सुचारू भौतिक क्रियाओं को आवृत्तियों (frequencies) की एक संरचित भाषा में अनुवादित करता है। इससे रोबोट को निम्नलिखित लाभ मिलते हैं:
- अपनी गतिविधियों की बहुत अधिक सटीकता के साथ भविष्यवाणी करना।
- अन्य तरीकों की तुलना में कार्य के "आकार" को बेहतर ढंग से समझना।
3. "सीक्वेंस प्लान" (द स्टोरीटेलर)
इस रोबोट को सिखाने के लिए, शोधकर्ताओं ने केवल रैंडम डेटा नहीं डाला। उन्होंने सीखने को एक कहानी की किताब की तरह व्यवस्थित किया जिसमें सीक्वेंस प्लान (Sequence Plan) नामक एक विशिष्ट संरचना है।
एक कॉमिक स्ट्रिप की कल्पना करें जिसके पैनल आपस में मिले हुए हैं। कभी-कभी रोबोट पहले चित्र देखता है, फिर निर्देश, फिर क्रिया, और फिर परिणाम। अन्य समय में, वह कारण समझने के लिए पहले परिणाम देखता है। WorldBagel प्रशिक्षण के दौरान इन "पैनलों" (दृश्य, शब्द, क्रिया और भविष्य की भविष्यवाणियां) को विभिन्न क्रमों में बदल देता है। यह रोबोट को यह सीखने में मदद करता है कि:
- क्रियाएं दुनिया में बदलाव लाती हैं।
- भाषा उन क्रियाओं का मार्गदर्शन करती है।
- भविष्य, अतीत का एक तार्किक परिणाम है।
4. उन्होंने क्या पाया?
शोधकर्ताओं ने तीन अलग-अलग "रसोईघरों" (रोबोटिक वातावरण) पर WorldBagel का परीक्षण किया:
- LIBBERO: कई अलग-अलग कार्यों के साथ एक जटिल सिमुलेशन।
- Language Table: एक वास्तविक दुनिया की मेज जहाँ एक रोबोट बोले गए आदेशों के आधार पर ब्लॉकों को धकेलता है।
- Franka: एक विशिष्ट रोबोट आर्म के साथ एक भौतिकी-प्रधान (physics-heavy) सिमुलेशन।
परिणाम:
- सब कुछ करने में बेहतर: WorldBagel उन रोबोटों की तुलना में कार्य पूरा करने में बेहतर था जो या तो केवल क्रिया पर ध्यान केंद्रित करते थे या केवल भविष्य की भविष्यवाणी करने पर। यह वह "ऑल-राउंडर" था जिसने उन सभी में महारत हासिल की थी।
- तेज़ भविष्यवाणियां: जब वीडियो के अगले फ्रेम के बारे में अनुमान लगाने के लिए पूछा गया, तो WorldBagel अपने प्रतिस्पर्धियों की तुलना में बहुत अधिक सटीक था।
- मजबूत (Sturdier): जब शोधकर्ताओं ने इसमें "शोर" (जैसे रोबोट के हाथ को हिलाना या उसकी गति बदलना) जोड़ा, तो WorldBagel भ्रमित नहीं हुआ। यह भविष्य की सही भविष्यवाणी करता रहा क्योंकि यह केवल दृश्य पैटर्न को नहीं, बल्कि गति की भौतिकी (physics) को समझता था।
निचोड़
यह शोध पत्र तर्क देता है कि विज़न (देखना), भाषा (पढ़ना), क्रिया (करना) और वर्ल्ड मॉडलिंग (भविष्य की कल्पना करना) को एक एकल, एकीकृत प्रणाली में संयोजित करके, रोबोट तेजी से सीखते हैं और अधिक विश्वसनीय बनते हैं।
WorldBagel साबित करता है कि यदि आप एक रोबोट को उसके कार्यों के परिणामों की कल्पना करना सिखाते हैं, तो वह बहुत अधिक स्मार्ट और सक्षम कार्यकर्ता बन जाता है। कोड और मॉडल को जारी किया जाना तय है ताकि अन्य लोग इस "एकीकृत" दृष्टिकोण पर निर्माण कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।