← नवीनतम पेपर
💻 computer science

OMG: Omni-Modal Motion Generation for Generalist Humanoid Control

यह शोध पत्र OMG प्रस्तुत करता है, जो एक स्केलेबल, डिफ्यूजन-आधारित फ्रेमवर्क है जो सामान्यज्ञ ह्यूमनॉइड नियंत्रण के लिए एक पदानुक्रमित वास्तुकला को एक सूक्ष्मता से क्यूरेट किए गए डेटासेट के साथ जोड़ता है ताकि भाषा, ऑडियो और संदर्भ गतियों द्वारा अनुकूलित अवस्था-सर्वव्यापी (ओम्नी-मोडल) पूर्ण-शरीर गति उत्पादन को सक्षम बनाया जा सके।

मूल लेखक: Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siqiao Huang, Kun-Ying Lee, Dongming Qiao, Guanqi He, Zhenyu Wang, Yitang Li, Shaoting Zhu, Hang Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "OMG: Omni-Modal Motion Generation for Generalist Humanoid Control" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

मुख्य विचार: रोबोट के लिए एक मस्तिष्क (Brain) और एक सेरिबेलम (Cerebellum)

कल्पना कीजिए कि एक ह्यूमनॉइड रोबोट (जैसे इस अध्ययन में उपयोग किया गया Unitree G1) को नृत्य करना, चलना या हाथ हिलाना सीखने की कोशिश करनी है। पारंपरिक रूप से, इंजीनियरों को एक समय में एक विशिष्ट कौशल सिखाना पड़ता था, जैसे किसी कुत्ते को बैठना या रुकना सिखाना। यदि आप चाहते थे कि रोबोट कुछ नया करे, तो आपको अक्सर शून्य से शुरुआत करनी पड़ती थी या जटिल नियम लिखने पड़ते थे।

इस पेपर के लेखक एक अलग दृष्टिकोण प्रस्तावित करते हैं, जो इस बात से प्रेरित है कि मानव शरीर कैसे काम करता है। वे रोबोट के नियंत्रण तंत्र (control system) को दो भागों में विभाजित करते हैं:

  1. मस्तिष्क (OMG-DiT): यह "प्लानर" (planner) है। यह उच्च-स्तरीय विचारों (जैसे "हाथ हिलाओ" या बज रहा संगीत) को लेता है और यह तय करता है कि रोबोट को आगे क्या करना चाहिए।
  2. सेरिबेलम (Motion Tracker): यह "मसल्स मेमोरी" (muscle memory) है। यह मस्तिष्क से योजना लेता है और यह सुनिश्चित करता है कि रोबोट के जोड़ वास्तव में सुचारू रूप से चलें और वह गिर न जाए।

यह पेपर एक बहुत अधिक स्मार्ट "मस्तिष्क" बनाने पर केंद्रित है जो एक साथ कई अलग-अलग प्रकार के निर्देशों को समझ सके।

समस्या: बहुत सारी बोलियाँ, लेकिन पर्याप्त डेटा नहीं

इस पेपर से पहले, रोबोट मोशन डेटा एक ऐसी लाइब्रेरी की तरह था जिसमें अलग-अलग भाषाओं में किताबें लिखी थीं, जिनमें से कुछ के पन्ने गायब थे, और कुछ केवल टेढ़े-मेढ़े निशान थे।

  • कुछ डेटा में टेक्स्ट विवरण (text descriptions) थे।
  • कुछ में संगीत था।
  • कुछ में मनुष्यों के नृत्य का वीडियो था।
  • इनमें से कोई भी उस प्रारूप (format) में नहीं था जिसे रोबोट वास्तव में उपयोग कर सके।

इसे ठीक करने के लिए, टीम ने OMG-Data बनाया। इसे एक विशाल अनुवाद और संपादन परियोजना के रूप में समझें। उन्होंने विभिन्न स्रोतों से 1,000 घंटे से अधिक का मोशन डेटा एकत्र किया, उसे साफ किया, और सब कुछ उनके विशिष्ट रोबोट (Unitree G1) की "भाषा" में अनुवादित किया। उन्होंने यहाँ तक कि एक फिजिक्स सिम्युलेटर का उपयोग किया ताकि हर एक गति की जांच की जा सके और यह सुनिश्चित किया जा सके कि रोबलेट कोई काम करते समय लड़खड़ाए नहीं या अपने जोड़ों को नुकसान न पहुँचा दे।

समाधान: "ओमनी-मोडल" जनरेटर

उनके सिस्टम का मूल OMG-DiT है। आप इसे एक सार्वभौमिक अनुवादक (universal translator) और रचनात्मक निर्देशक (creative director) के मिश्रण के रूप में देख सकते हैं।

यह कैसे काम करता है:
कल्पना कीजिए कि आप एक पार्टी में हैं।

  • टेक्स्ट इनपुट (Text Input): कोई चिल्लाता है, "आगे चलो!" मस्तिष्क इसे समझता है और चलने का रास्ता तय करता है।
  • ऑडियो इनपुट (Audio Input): कोई हिप-हॉप बीट बजाता है। मस्तिष्क लय को सुनता है और उस बीट के साथ मेल खाने वाला नृत्य प्लान करता है।
  • विजुअल इनपुट (Visual Input): कोई अपने हाथ हिलाता है। मस्तिष्क उस लहर (wave) को देखता है और उसकी नकल करने की योजना बनाता है।
  • कॉम्बो इनपुट (Combo Input): कोई कहता है "इस बीट पर नाचो!" और साथ में संगीत बजाता है। मस्तिष्क शब्दों के अर्थ को संगीत की लय के साथ जोड़कर एक अनूठा नृत्य बनाता है।

OMG का जादू यह है कि इसे हर नए प्रकार के निर्देश के लिए फिर से प्रशिक्षित (retrain) करने की आवश्यकता नहीं होती है। यह एक "साझा बैकबोन" (shared backbone - एक केंद्रीय न्यूरल नेटवर्क) का उपयोग करता है जिसने पहले से ही रोबोट के हिलने-डुलने के सामान्य नियमों को सीख लिया है। जब आप इसे किसी नए प्रकार का निर्देश देते हैं (जैसे कोई नया सेंसर या नई भाषा), तो यह उस नए इनपुट को मौजूदा मस्तिष्क से जोड़ने के लिए बस एक छोटा, हल्का "अडैप्टर" (adapter) जोड़ देता है।

प्रमुख उपलब्धियां (उन्होंने क्या सिद्ध किया)

  1. यह एक "फाउंडेशन मॉडल" है: जिस तरह LLMs (Large Language Models) भारी मात्रा में टेक्स्ट से सीखकर निबंध, कोड और कविताएं लिख सकते हैं, इस मॉडल ने भारी मात्रा में मोशन डेटा से सीखा है। इस कारण, यह बहुत कम अतिरिक्त प्रशिक्षण के साथ नए कार्यों को संभाल सकता है।

    • उपमा: यदि आप किसी इंसान को साइकिल चलाना सिखाते हैं, तो वह किसी ऐसे व्यक्ति की तुलना में बहुत तेज़ी से स्केटबोर्ड चलाना सीख जाएगा जिसने कभी कुछ भी नहीं चलाया। यह रोबोट भी वैसा ही करता है।
  2. जीरो-शॉट कंपोजिशन (Zero-Shot Composition): मॉडल उन निर्देशों को मिला और मिला सकता है जिन्हें उसने पहले कभी एक साथ नहीं देखा है।

    • उदाहरण: यदि इसे टेक्स्ट कमांड पर चलना और संगीत पर नाचना अलग-अलग सिखाया गया था, तो यह एक कमांड का पालन करने में सफल होगा कि "आगे चलो" जबकि वह एक विशिष्ट गाने पर नाच रहा हो, भले ही उसने प्रशिक्षण के दौरान कभी भी उस सटीक संयोजन को न देखा हो।
  3. वास्तविक दुनिया में निष्पादन (Real-World Execution): उन्होंने इसे केवल कंप्यूटर पर सिम्युलेट नहीं किया। उन्होंने इस सिस्टम को एक वास्तविक Unitree G1 रोबोट पर लगाया। रोबोट ऑडियो सुन सकता था, टेक्स्ट पढ़ सकता था, या किसी इंसान को देख सकता था, और बिना गिले तुरंत वास्तविक समय (real-time) में हिलना शुरू कर सकता था।

सरल अंग्रेजी में परिणाम

  • बेहतर गुणवत्ता: जब टेक्स्ट या संगीत के आधार पर हिलने के लिए कहा गया, तो उनका रोबोट पिछले तरीकों की तुलना में अधिक स्वाभाविक और सटीक रूप से चला।
  • तेजी से अनुकूलन (Faster Adaptation): जब उन्होंने रोबोट को एक नया कौशल सिखाने की कोशिश की (जैसे कि "Pico" नामक एक विशिष्ट हैंड-ट्रैकिंग सेंसर का पालन करना), तो प्री-ट्रेंड मॉडल ने बहुत कम डेटा के साथ मिनटों में इसे सीख लिया, जबकि शून्य से प्रशिक्षित मॉडल संघर्ष कर रहा था और उसे बहुत अधिक डेटा की आवश्यकता थी।
  • स्केलेबिलिटी (Scalability): उन्होंने पाया कि "मस्तिष्क" को बड़ा बनाने से (अधिक कंप्यूटिंग पावर जोड़ने से) रोबोट बेहतर तरीके से चलता है, जो यह सुझाव देता है कि डेटा और शक्ति जोड़ने के साथ यह दृष्टिकोण और भी स्मार्ट हो सकता है।

सारांश

यह पेपर OMG प्रस्तुत करता है, जो एक ऐसा सिस्टम है जो ह्यूमनॉइड रोबोट को एक "जनरलिस्ट ब्रेन" (सामान्यज्ञ मस्तिष्क) देता है। हर चाल को हार्ड-कोड करने के बजाय, रोबोट 1,000+ घंटों के डेटा से गति की एक सार्वभौमिक भाषा सीखता है। यह इसे टेक्स्ट, ऑडियो या मानव गति से निर्देश लेने, उन्हें मिलाने और तुरंत सुरक्षित, भौतिक गतिविधियाँ उत्पन्न करने की अनुमति देता है जिसे एक वास्तविक रोबोट निष्पादित कर सके। यह एक कदम है जहाँ रोबोट इंसानों की तरह लचीले ढंग से दुनिया को समझने और प्रतिक्रिया देने में सक्षम हो सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →