UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning
UniJEPA एक एकीकृत रोबोट नीति ढांचा है जो निरंतर और असतत (continuous and discrete) निरूपणों को सीखने के लिए निर्देशात्मक वीडियो पर बड़े पैमाने पर प्रीट्रेनिंग का लाभ उठाता है, जिससे मौजूदा विजन-लैंग्वेज और जनरेटिव दृष्टिकोणों की तुलना में सिमुलेशन और वास्तविक दुनिया के आउट-ऑफ-डिस्ट्रीब्यूशन कार्यों दोनों में बेहतर प्रदर्शन सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाने की कोशिश कर रहे हैं। यह शोध पत्र एक नई विधि पेश करता है जिसे UniJEPA (यूनिफाइड जॉइंट एम्बेडिंग प्रेडिक्शन एंड एक्शन) कहा जाता है, ताकि इन रोबोट्स को अधिक स्मार्ट, लचीला और उन चीजों को संभालने में बेहतर बनाया जा सके जिन्हें उन्होंने पहले कभी नहीं देखा है।
यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:
समस्या: "दो सिरों वाला" रोबोट
वर्तमान में, रोबोट के दिमाग आमतौर पर दो समूहों में बँटे होते हैं, और दोनों की एक कमजोरी होती है:
- "बातूनी" (विज़न-लैंग्वेज मॉडल्स): ये रोबोट भाषा और चित्रों को समझने में बहुत अच्छे होते हैं। यदि आप कहते हैं, "लाल कप उठाओ," तो वे जानते हैं कि कप क्या है और "लाल" का क्या अर्थ है। लेकिन वे भौतिकी (फिजिक्स) का अनुमान लगाने में खराब हैं। उन्हें सहज रूप से यह नहीं पता होता कि यदि वे कप को बहुत ज़ोर से पकड़ते हैं तो वह कैसे डगमगाएगा या मेज पर कैसे लुढ़केगा।
- "अनुमान लगाने वाला" (जेनरेटिव मॉडल्स): ये रोबोट यह अनुमान लगाने में माहिर होते हैं कि आगे क्या होगा। यदि वे देखते हैं कि एक गेंद लुढ़क रही है, तो वे अनुमान लगा सकते हैं कि एक सेकंड में वह कहाँ होगी। लेकिन उनमें अक्सर "कॉमन सेंस" या भाषा की समझ की कमी होती है। वे शायद यह जान लें कि कैसे हिलना है, लेकिन वे यह नहीं समझ पाते कि वे क्यों हिल रहे हैं या इंसान ने वास्तव में उनसे क्या करने को कहा है।
अधिकांश रोबोट या तो एक का उपयोग करते हैं, या दूसरे का, या वे उन्हें इस तरह से मिलाने की कोशिश करते हैं जिससे दोनों के बेहतरीन हिस्सों का नुकसान हो जाता है।
समाधान: "द्विभाषी स्वप्नद्रष्टा" (UniJEPA)
UniJEPA एक ऐसे रोबोट की तरह है जो एक साथ दो भाषाएँ बोलना और दो तरह से सपने देखना सीखता है। यह "बातूनी" और "अनुमान लगाने वाले" को एक ही मस्तिष्क में जोड़ देता है।
इसे कार चलाना सीखने वाले एक छात्र की तरह समझें:
- डिस्क्रीट लर्निंग (The "Talker"): यह सड़क के नियमों और शब्दावली को सीखने जैसा है। "स्टॉप साइन का मतलब रुकना है," "हरा मतलब जाना है।" रोबट निर्देशों को समझने और जो वह देखता है उसे शब्दों में वर्णित करने में सीखता है।
- कंटीन्यूअस लर्निंग (The "Dreamer"): यह कार के एहसास को सीखने जैसा है। यह केवल नियमों के बारे में नहीं है; यह गति के सुचारू प्रवाह की भविष्यवाणी करने के बारे में भी है। यदि आप स्टीयरिंग को थोड़ा घुमाते हैं, तो कार कैसे मुड़ेगी? UniJEPA भविष्य के दृश्य को एक धुंधले वीडियो के रूप में नहीं, बल्कि एक उच्च-स्तरीय "एहसास" या मानचित्र के रूप में भविष्यवाणी करना सीखता है कि आगे क्या होने वाला है।
उन्होंने इसे कैसे प्रशिक्षित किया (दो-चरणीय प्रक्रिया)
चरण 1: "लाइब्रेरी और मूवी थिएटर" चरण (प्री-ट्रेनिंग)
इससे पहले कि रोबोट वास्तव में किसी चीज़ को छुए, वे उसे भारी मात्रा में डेटा "पढ़ने" और "देखने" देते हैं।
- उन्होंने इसे मनुष्यों और रोबोटों द्वारा कार्य करने (जैसे दराज खोलना या खिलौने उठाना) के 10 लाख से अधिक वीडियो खिलाए।
- ट्रिक: उन्होंने रोबोट को एक साथ दो चीजें करने के लिए कहा:
- प्रश्नों के उत्तर देना: "रोबोट क्या कर रहा है?" (यह इसकी भाषा और समझ को तेज करता है)।
- भविष्यवाणी करना: "यदि रोबोट अपना हाथ इस तरह हिलाता है, तो 1 सेकंड में चित्र कैसा दिखेगा?" (यह इसकी भौतिकी और गति की समझ को तेज करता है)।
- दोनों को करके, रोबोट एक ऐसा मानसिक मॉडल बनाता है जहाँ शब्द और भौतिक गति पूरी तरह से जुड़े होते हैं।
चरण 2: "ड्राइविंग स्कूल" चरण (फाइन-ट्यूनिंग)
एक बार जब रोबोट के पास यह सामान्य ज्ञान आ जाता है, तो वे उसे विशेष रूप से अपने खुद के शरीर को कैसे चलाना है, यह सिखाते हैं।
- वे उसे वास्तविक रोबोट हाथ या हाथ के डेटा दिखाते हैं।
- रोबोट अपने "सपनों" (भविष्य की भविष्यवाणियों) और अपनी "समझ" (भाषा निर्देशों) को सीधे एक्शन टोकन (मोटर चलाने के विशिष्ट कमांड) में अनुवादित करना सीखता है।
- यह एक वास्तविक हाथ को टकराने से बचाने के लिए जटिल गणित को संभालने के लिए एक विशेष "विशेषज्ञ" प्रणाली (विशेषज्ञों की एक टीम की तरह) का उपयोग करता है।
परिणाम: यह क्यों बेहतर है
पेपर में इस रोबोट का दो तरीकों से परीक्षण किया गया:
- एक वीडियो गेम में (सिमुलेशन): उन्होंने इसे ऐसे कार्य दिए जो उसने पहले कभी नहीं देखे थे, जैसे किसी विशिष्ट वस्तु को एक विशिष्ट तरीके से हिलाना। UniJEPA ने अन्य सभी शीर्ष रोबोटों को काफी बड़े अंतर से पीछे छोड़ दिया (लगभग 9-12% बेहतर)।
- वास्तविक दुनिया में: उन्होंने इसे एक वास्तविक रोबोट हाथ और एक शानदार 12-उंगलियों वाले रोबोट हाथ पर रखा।
- जादू: जब उन्होंने रोबोट को एक पूरी तरह से नई वस्तु (जैसे, एक खिलौना जिसे उसने पहले कभी नहीं देखा, या एक अजीब रंग) के साथ कार्य दिया, तो UniJEPA भ्रमित नहीं हुआ। क्योंकि इसने केवल विशिष्ट चित्रों को याद करने के बजाय "पकड़ने" और "हिलाने" की अवधारणा सीखी थी, यह प्रतिस्पर्धा की तुलना में इन "आउट-ऑफ-डिस्ट्रीब्यूशन" (अजीब) स्थितियों को बहुत बेहतर तरीके से संभाल सका।
मुख्य बात
UniJEPA एक ऐसा रोबोट मस्तिष्क है जो न केवल निर्देशों को याद करता है और न ही केवल भौतिकी का अनुमान लगाता है। यह भाषा के माध्यम से दुनिया को समझने के साथ-साथ गति के माध्यम से भविष्य का अनुकरण करने का काम करता है। यह दोहरा दृष्टिकोण इसे एक "जनरलिस्ट" बनाता है—एक ऐसा रोबोट जो हर बार शून्य से फिर से प्रशिक्षित किए बिना नए कार्यों और नई वस्तुओं के अनुकूल हो सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।