← नवीनतम पेपर
🤖 AI

DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos

DreamDojo एक फाउंडेशन वर्ल्ड मॉडल है जिसे 44,000 घंटों के एगोसेंट्रिक मानव वीडियो पर प्रशिक्षित किया गया है जो निरंतर लेटेंट एक्शन्स के माध्यम से विविध दक्ष इंटरैक्शन सीखता है, जिससे ओपन-वर्ल्ड, कॉन्टैक्ट-रिच वातावरण में जनरलइस्ट रोबोट्स के लिए रियल-टाइम सिमुलेशन, सटीक एक्शन कंट्रोलेबिलिटी और प्रभावी पॉलिसी प्लानिंग सक्षम होती है।

मूल लेखक: Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin, Qianli Ma, Seungjun Nah, Loic Magne, Jiannan Xiang, Yuqi Xie
प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin, Qianli Ma, Seungjun Nah, Loic Magne, Jiannan Xiang, Yuqi Xie, Ruijie Zheng, Dantong Niu, You Liang Tan, K. R. Zentner, George Kurian, Suneel Indupuru, Pooya Jannaty, Jinwei Gu, Jun Zhang, Jitendra Malik, Pieter Abbeel, Ming-Yu Liu, Yuke Zhu, Joel Jang, Linxi "Jim" Fan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को वह सब कुछ करना सिखाना चाहते हैं जो एक इंसान कर सकता है: खाना बनाना, सफाई करना, चीजें ठीक करना और खिलौनों के साथ खेलना। समस्या यह है कि रोबोट महंगे होते हैं, आसानी से टूट जाते हैं, और हमारे पास उन्हें सभी कौशल सिखाने के लिए रोबोट वीडियो के पर्याप्त घंटे नहीं हैं।

DreamDojo रोबोट्स के लिए एक नया "दिमाग" है जो इसे हल करता है। यह रोबोट वीडियो के बजाय मानव वीडियो (human videos) से सीखकर इस समस्या को सुलझाता है। इसे ऐसे समझें कि एक रोबट YouTube और TikTok पर लोगों को दैनिक कार्य करते हुए देखकर सीख रहा है, बजाय इसके कि उसे हर कार्य के लिए खुद रोबोट की आवश्यकता हो।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. विशाल पुस्तकालय (डेटा)

आमतौर पर, रोबोट प्रशिक्षण डेटा एक छोटी लाइब्रेरी की तरह होता है जिसमें "लाल ब्लॉक को कैसे उठाएं" पर केवल कुछ किताबें होती हैं। DreamDojo का पुस्तकालय एक विशाल, अनंत पुस्तकालय है जिसमें 44,000 घंटों के मानव वीडियो शामिल हैं।

  • पैमाना (The Scale): यह एक साधारण नोटबुक की तुलना पूरी लाइब्रेरी ऑफ कांग्रेस से करने जैसा है।
  • विविधता (The Variety): इसमें रसोई में खाना बनाने से लेकर गैरेज में कार ठीक करने तक सब कुछ शामिल है, जिसमें हजारों अलग-अलग वस्तुएं और कौशल शामिल हैं।
  • गुप्त सूत्र (The Secret Sauce): चूंकि इन वीडियो के साथ "रोबोट निर्देश" जुड़े नहीं होते हैं, इसलिए टीम ने Latent Actions नामक एक विशेष अनुवादक (translator) का आविष्कार किया। कल्पना कीजिए कि आप किसी को जार खोलते हुए देख रहे हैं। भले ही रोबोट सटीक मांसपेशियों की हरकतें नहीं देख सकता, लेकिन यह अनुवादक जार और हाथ की गति को देखकर "घुमाने और खींचने" के इरादे (intent) और भौतिकी (physics) को समझ लेता है। यह वीडियो को एक सार्वभौमिक निर्देश पुस्तिका में बदल देता है जिसे कोई भी रोबोट समझ सकता है।

2. सिम्युलेटर (विश्व मॉडल - The World Model)

एक बार जब रोबोट का दिमाग इन वीडियो से सीख जाता है, तो यह एक World Model बन जाता है।

  • उपमा (The Analogy): एक वर्ल्ड मॉडल को पायलट के लिए फ्लाइट सिम्युलेटर की तरह समझें। एक पायलट वास्तविक विमान उड़ाने से पहले, सिम्युलेटर में अभ्यास करता है। यदि वह सिम्युलेटर में गलती करता है, तो किसी को नुकसान नहीं पहुँचता।
  • DreamDojo कैसे काम करता है: आप DreamDojo को कह सकते हैं, "कल्पना करो कि रोबोट कप की ओर हाथ बढ़ाता है, लेकिन चूक जाता है।" मॉडल फिर एक वीडियो जनरेट करेगा कि आगे क्या होगा। यह भौतिकी (physics) को समझता है: यदि आप कप को धकेलते हैं, तो वह फिसलता है; यदि आप उसे बहुत ज़ोर से धकेलते हैं, तो वह मेज से गिर जाता है। यह उन वस्तुओं या वातावरणों के लिए भी तुरंत परिणाम सिम्युलेट कर सकता है जिन्हें उसने पहले कभी नहीं देखा है।

3. स्पीड बूस्ट (डिस्टिलेशन - Distillation)

मूल "दिमाग" बहुत बुद्धिमान है लेकिन धीमा है, जैसे एक जीनियस प्रोफेसर जिसे गणित की समस्या हल करने में 10 मिनट लगते हैं। रोबोट के वास्तविक समय (real-time) में चलने के लिए, उसे इंसान की तरह तेज़ी से सोचने की आवश्यकता है।

  • समाधान: टीम ने Distillation नामक प्रक्रिया का उपयोग किया। उन्होंने उस धीमे, जीनियस प्रोफेसर को लिया और एक तेज़, युवा छात्र (the "Student Model") को उनकी नकल करने के लिए प्रशिक्षित किया।
  • परिणाम: छात्र अब 10.81 फ्रेम्स प्रति सेकंड की दर से भविष्य की भविष्यवाणी कर सकता है। यह वास्तविक समय में चलने के लिए पर्याप्त तेज़ है। आप एक VR कंट्रोलर के साथ वर्चुअल रोबोट को नियंत्रित कर सकते हैं, और रोबोट तुरंत प्रतिक्रिया देगा और हिलेगा, बिल्कुल एक वास्तविक व्यक्ति की तरह।

यह क्या कर सकता है? (पेपर के दावों के आधार पर)

पेपर तीन मुख्य तरीकों पर प्रकाश डालता है जिनमें इस तकनीक का उपयोग किया जाता है:

  1. पॉलिसी का परीक्षण करना (रोबोट के लिए "फ्लाइट सिम्युलेटर"):
    इससे पहले कि आप एक रोबोट को फल पैक करने के लिए वास्तविक दुनिया में भेजें, आप DreamDojo में उसके "दिमाग" का परीक्षण कर सकते हैं। पेपर दिखाता है कि यदि कोई रोबट रणनीति DreamDojo सिमुलेशन में अच्छी तरह काम करती है, तो वह लगभग निश्चित रूप से वास्तविक दुनिया में भी काम करेगी (99.5% सहसंबंध)। इससे समय बचता है और सीखने के दौरान रोबोट द्वारा चीजें तोड़ने से बचाव होता है।

  2. आगे की योजना बनाना (द "चेस प्लेयर"):
    जब रोबोट को कोई जटिल कार्य करना होता है, तो वह परिणामों के बारे में "सपना" देखने के लिए DreamDojo का उपयोग कर सकता है। वह सेब पकड़ने के पांच अलग-अलग तरीकों को अपने मन में आजमा सकता है, देख सकता है कि कौन सा तरीका सबसे अच्छा परिणाम देगा, और फिर उस विशिष्ट चाल को निष्पादित कर सकता है। यह रोबोट को कठिन कार्यों में बहुत स्मार्ट और सफल बनाता है।

  3. लाइव टेलीऑपरेशन (द "वर्चुअल ट्विन"):
    चूंकि मॉडल बहुत तेज़ है, इसलिए एक इंसान वास्तविक समय में वर्चुअल रोबोट को नियंत्रित करने के लिए VR हेडसेट पहन सकता है। यदि इंसान अपना हाथ हिलाता है, तो वर्चुअल रोबोट तुरंत हिलता है। यह इंसानों को दूरस्थ रूप से रोबोट बनने की अनुमति देता है, जो उन कार्यों के लिए उपयोगी है जो सीधे तौर पर इंसानों के लिए बहुत खतरनाक या कठिन हैं।

सारांश

DreamDojo, वास्तविक दुनिया की अव्यवस्थित विविधता और रोबोट की सटीक दुनिया के बीच एक सेतु है। ऑनलाइन मौजूद मानवीय गतिविधियों से सीखकर और क्रियाओं को समझने के लिए एक विशेष "अनुवादक" का उपयोग करके, यह एक ऐसा रोबोट मस्तिष्क बनाता है जो भविष्य की कल्पना कर सकता है, विचारों का सुरक्षित परीक्षण कर सकता है, और वास्तविक समय में कार्य कर सकता है। यह रोबोट को एक कठोर मशीन से बदलकर—जो केवल वही जानता है जो उसे स्पष्ट रूप से सिखाया गया है—एक लचीला एजेंट बना देता है जो समझता है कि दुनिया कैसे काम करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →