DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos
DreamDojo एक फाउंडेशन वर्ल्ड मॉडल है जिसे 44,000 घंटों के एगोसेंट्रिक मानव वीडियो पर प्रशिक्षित किया गया है जो निरंतर लेटेंट एक्शन्स के माध्यम से विविध दक्ष इंटरैक्शन सीखता है, जिससे ओपन-वर्ल्ड, कॉन्टैक्ट-रिच वातावरण में जनरलइस्ट रोबोट्स के लिए रियल-टाइम सिमुलेशन, सटीक एक्शन कंट्रोलेबिलिटी और प्रभावी पॉलिसी प्लानिंग सक्षम होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को वह सब कुछ करना सिखाना चाहते हैं जो एक इंसान कर सकता है: खाना बनाना, सफाई करना, चीजें ठीक करना और खिलौनों के साथ खेलना। समस्या यह है कि रोबोट महंगे होते हैं, आसानी से टूट जाते हैं, और हमारे पास उन्हें सभी कौशल सिखाने के लिए रोबोट वीडियो के पर्याप्त घंटे नहीं हैं।
DreamDojo रोबोट्स के लिए एक नया "दिमाग" है जो इसे हल करता है। यह रोबोट वीडियो के बजाय मानव वीडियो (human videos) से सीखकर इस समस्या को सुलझाता है। इसे ऐसे समझें कि एक रोबट YouTube और TikTok पर लोगों को दैनिक कार्य करते हुए देखकर सीख रहा है, बजाय इसके कि उसे हर कार्य के लिए खुद रोबोट की आवश्यकता हो।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. विशाल पुस्तकालय (डेटा)
आमतौर पर, रोबोट प्रशिक्षण डेटा एक छोटी लाइब्रेरी की तरह होता है जिसमें "लाल ब्लॉक को कैसे उठाएं" पर केवल कुछ किताबें होती हैं। DreamDojo का पुस्तकालय एक विशाल, अनंत पुस्तकालय है जिसमें 44,000 घंटों के मानव वीडियो शामिल हैं।
- पैमाना (The Scale): यह एक साधारण नोटबुक की तुलना पूरी लाइब्रेरी ऑफ कांग्रेस से करने जैसा है।
- विविधता (The Variety): इसमें रसोई में खाना बनाने से लेकर गैरेज में कार ठीक करने तक सब कुछ शामिल है, जिसमें हजारों अलग-अलग वस्तुएं और कौशल शामिल हैं।
- गुप्त सूत्र (The Secret Sauce): चूंकि इन वीडियो के साथ "रोबोट निर्देश" जुड़े नहीं होते हैं, इसलिए टीम ने Latent Actions नामक एक विशेष अनुवादक (translator) का आविष्कार किया। कल्पना कीजिए कि आप किसी को जार खोलते हुए देख रहे हैं। भले ही रोबोट सटीक मांसपेशियों की हरकतें नहीं देख सकता, लेकिन यह अनुवादक जार और हाथ की गति को देखकर "घुमाने और खींचने" के इरादे (intent) और भौतिकी (physics) को समझ लेता है। यह वीडियो को एक सार्वभौमिक निर्देश पुस्तिका में बदल देता है जिसे कोई भी रोबोट समझ सकता है।
2. सिम्युलेटर (विश्व मॉडल - The World Model)
एक बार जब रोबोट का दिमाग इन वीडियो से सीख जाता है, तो यह एक World Model बन जाता है।
- उपमा (The Analogy): एक वर्ल्ड मॉडल को पायलट के लिए फ्लाइट सिम्युलेटर की तरह समझें। एक पायलट वास्तविक विमान उड़ाने से पहले, सिम्युलेटर में अभ्यास करता है। यदि वह सिम्युलेटर में गलती करता है, तो किसी को नुकसान नहीं पहुँचता।
- DreamDojo कैसे काम करता है: आप DreamDojo को कह सकते हैं, "कल्पना करो कि रोबोट कप की ओर हाथ बढ़ाता है, लेकिन चूक जाता है।" मॉडल फिर एक वीडियो जनरेट करेगा कि आगे क्या होगा। यह भौतिकी (physics) को समझता है: यदि आप कप को धकेलते हैं, तो वह फिसलता है; यदि आप उसे बहुत ज़ोर से धकेलते हैं, तो वह मेज से गिर जाता है। यह उन वस्तुओं या वातावरणों के लिए भी तुरंत परिणाम सिम्युलेट कर सकता है जिन्हें उसने पहले कभी नहीं देखा है।
3. स्पीड बूस्ट (डिस्टिलेशन - Distillation)
मूल "दिमाग" बहुत बुद्धिमान है लेकिन धीमा है, जैसे एक जीनियस प्रोफेसर जिसे गणित की समस्या हल करने में 10 मिनट लगते हैं। रोबोट के वास्तविक समय (real-time) में चलने के लिए, उसे इंसान की तरह तेज़ी से सोचने की आवश्यकता है।
- समाधान: टीम ने Distillation नामक प्रक्रिया का उपयोग किया। उन्होंने उस धीमे, जीनियस प्रोफेसर को लिया और एक तेज़, युवा छात्र (the "Student Model") को उनकी नकल करने के लिए प्रशिक्षित किया।
- परिणाम: छात्र अब 10.81 फ्रेम्स प्रति सेकंड की दर से भविष्य की भविष्यवाणी कर सकता है। यह वास्तविक समय में चलने के लिए पर्याप्त तेज़ है। आप एक VR कंट्रोलर के साथ वर्चुअल रोबोट को नियंत्रित कर सकते हैं, और रोबोट तुरंत प्रतिक्रिया देगा और हिलेगा, बिल्कुल एक वास्तविक व्यक्ति की तरह।
यह क्या कर सकता है? (पेपर के दावों के आधार पर)
पेपर तीन मुख्य तरीकों पर प्रकाश डालता है जिनमें इस तकनीक का उपयोग किया जाता है:
पॉलिसी का परीक्षण करना (रोबोट के लिए "फ्लाइट सिम्युलेटर"):
इससे पहले कि आप एक रोबोट को फल पैक करने के लिए वास्तविक दुनिया में भेजें, आप DreamDojo में उसके "दिमाग" का परीक्षण कर सकते हैं। पेपर दिखाता है कि यदि कोई रोबट रणनीति DreamDojo सिमुलेशन में अच्छी तरह काम करती है, तो वह लगभग निश्चित रूप से वास्तविक दुनिया में भी काम करेगी (99.5% सहसंबंध)। इससे समय बचता है और सीखने के दौरान रोबोट द्वारा चीजें तोड़ने से बचाव होता है।आगे की योजना बनाना (द "चेस प्लेयर"):
जब रोबोट को कोई जटिल कार्य करना होता है, तो वह परिणामों के बारे में "सपना" देखने के लिए DreamDojo का उपयोग कर सकता है। वह सेब पकड़ने के पांच अलग-अलग तरीकों को अपने मन में आजमा सकता है, देख सकता है कि कौन सा तरीका सबसे अच्छा परिणाम देगा, और फिर उस विशिष्ट चाल को निष्पादित कर सकता है। यह रोबोट को कठिन कार्यों में बहुत स्मार्ट और सफल बनाता है।लाइव टेलीऑपरेशन (द "वर्चुअल ट्विन"):
चूंकि मॉडल बहुत तेज़ है, इसलिए एक इंसान वास्तविक समय में वर्चुअल रोबोट को नियंत्रित करने के लिए VR हेडसेट पहन सकता है। यदि इंसान अपना हाथ हिलाता है, तो वर्चुअल रोबोट तुरंत हिलता है। यह इंसानों को दूरस्थ रूप से रोबोट बनने की अनुमति देता है, जो उन कार्यों के लिए उपयोगी है जो सीधे तौर पर इंसानों के लिए बहुत खतरनाक या कठिन हैं।
सारांश
DreamDojo, वास्तविक दुनिया की अव्यवस्थित विविधता और रोबोट की सटीक दुनिया के बीच एक सेतु है। ऑनलाइन मौजूद मानवीय गतिविधियों से सीखकर और क्रियाओं को समझने के लिए एक विशेष "अनुवादक" का उपयोग करके, यह एक ऐसा रोबोट मस्तिष्क बनाता है जो भविष्य की कल्पना कर सकता है, विचारों का सुरक्षित परीक्षण कर सकता है, और वास्तविक समय में कार्य कर सकता है। यह रोबोट को एक कठोर मशीन से बदलकर—जो केवल वही जानता है जो उसे स्पष्ट रूप से सिखाया गया है—एक लचीला एजेंट बना देता है जो समझता है कि दुनिया कैसे काम करती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।