DreamControl-v2: Simpler and Scalable Autonomous Humanoid Skills via Trainable Guided Diffusion Priors
यह शोध पत्र DreamControl-v2 प्रस्तुत करता है, जो एक उन्नत ढांचा है जो बिना किसी मैनुअल फ़िल्टरिंग के सरल, स्केलेबल और अधिक सुदृढ़ स्वायत्त लोको-मैनिपुलेशन कौशल को सक्षम करने के लिए मानव और रोबोट डेटा को एकत्रित करके सीधे ह्यूमनॉइड रोबोट के मोशन स्पेस में एक गाइडेड डिफ्यूजन मॉडल को प्रशिक्षित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक नए रोबोट को जटिल काम करना सिखाना चाहते हैं, जैसे कि भारी दराज खोलना, झुककर एक बॉक्स उठाना, या यहाँ तक कि मुक्का मारना। आप हर एक मांसपेशी की हरकत को हाथ से प्रोग्राम नहीं करना चाहते; क्योंकि इसमें बहुत समय लगेगा। इसके बजाय, आप चाहते हैं कि रोबोट पहले उन गतिविधियों की "कल्पना" (dream) करे, और फिर उन्हें निष्पादित करना सीखे।
यह पेपर DreamControl-v2 को पेश करता है, जो मानव सदृश रोबोटों (humanoids) को हिलना-डुलना सिखाने का एक नया तरीका है। यह समझने के लिए कि यह क्यों खास है, आइए पुराने तरीके बनाम नए तरीके को देखें।
पुराना तरीका: "अनुवादक" की समस्या (DreamControl v1)
कल्पना कीजिए कि आप एक निर्देशक हैं जो एक रोबोट अभिनेता को एक दृश्य निभाने के लिए सिखाने की कोशिश कर रहे हैं।
- स्क्रिप्ट: आपके पास एक मानव अभिनेता के लिए लिखी गई स्क्रिप्ट है (एक मानव मोशन डेटासेट)।
- अनुवाद: आप एक अनुवादक को नियुक्त करते हैं जो इंसान की गतिविधियों को रोबोट की गतिविधियों में बदलने का काम करता है।
- गड़बड़ी: अनुवादक त्रुटिपूर्ण है। जब इंसान की स्क्रिप्ट कहती है "2 फीट की ऊंचाई पर हैंडल के लिए हाथ बढ़ाएं," तो अनुवादक रोबोट को 1.5 फीट पर हाथ बढ़ाने के लिए कह सकता है क्योंकि रोबोट का हाथ अलग आकार का है।
- सुधार: आपको रोबोट को देखना पड़ता है, यह महसूस करना पड़ता है कि वह गलत है, और फिर मैन्युअल रूप से अनुवादक को बताना पड़ता है, "ठीक है, अब इंसान को 3 फीट की ऊंचाई पर हैंडल के लिए हाथ बढ़ाने के लिए कहें।"
- लूप: आप इस "अनुमान और जांच" (guess and check) की प्रक्रिया को दर्जनों बार दोहराते हैं जब तक कि रोबोट अंततः सही जगह पर नहीं पहुँच जाता।
यही पिछला संस्करण, DreamControl करता था। इसने एक मानव मोशन AI का उपयोग किया, मानव गतिविधियों को रोबोट की गतिविधियों में बदलने की कोशिश की, और फिर इंसानों को निर्देशों को मैन्युअल रूप से तब तक ट्यून करना पड़ा जब तक कि वह काम न करने लगे। यह धीमा, थकाऊ और स्केलेबल नहीं था।
नया तरीका: "नेटिव स्पीकर" (DreamControl-v2)
DreamControl-v2 अनुवादक को पूरी तरह से हटाकर खेल बदल देता है।
इंसानों की तरह हिलना-डुलना सिखाने और फिर उसे ट्रांसलेट करने के बजाय, शोधकर्ताओं ने AI को सीधे "रोबोट की भाषा" बोलना सिखाया।
उन्होंने इसे इस प्रकार किया:
- लाइब्रेरी: उन्होंने मानव गति के विशाल पुस्तकालयों को लिया (लोग नाचना, चलना, दरवाजे खोलना आदि) और, AI को प्रशिक्षित करने से पहले, गणितीय रूप से उन सभी को "रोबोट की भाषा" में बदल दिया। उन्होंने मूल रूप से मानव गतियों को इस तरह से फिर से लिखा जैसे कि वे हमेशा से एक रोबोट द्वारा ही की गई हों।
- प्रशिक्षण: उन्होंने इस परिवर्तित डेटा पर एक नया AI मॉडल (एक "डिफ्यूजन मॉडल") प्रशिक्षित किया। अब, जब आप इस AI से कहते हैं, "दराज खोलो," तो यह मानव हाथ के बारे में नहीं सोचता; यह एक रोबोटिक हाथ के बारे में सोचता है।
- परिणाम: जब आप निर्देश देते हैं, तो यह AI तुरंत एक सटीक रोबोटिक मूवमेंट तैयार कर देता है। कोई अनुवाद त्रुटि नहीं। कोई "अनुमान और जांच" नहीं।
उपमा: भाषा सीखना
- पुराना तरीका (DreamControl): आप किसी विदेशी देश में खाना ऑर्डर करना चाहते हैं। आप एक अनुवादक से अंग्रेजी में बात करते हैं, जो वेटर से फ्रेंच में बात करता है। वेटर आपको सैंडविच के बजाय सूप दे देता है क्योंकि अनुवादक ने गलत समझा। आपको अनुवादक से बहस करनी पड़ती है, जो फिर से कोशिश करता है।
- नया तरीका (DreamControl-v2): आप सीधे फ्रेंच सीखते हैं। आप वेटर से फ्रेंच में बात करते हैं। आपको वही मिलता है जो आपने ऑर्डर किया था, तुरंत।
यह क्यों महत्वपूर्ण है (इसके "सुपरपावर्स")
यह पेपर इस नए दृष्टिकोण के तीन मुख्य सुपरपावर्स पर प्रकाश डालता है:
- यह स्वचालित है: अब आपको सेटिंग्स को ट्यून करने के लिए किसी इंसान की जरूरत नहीं है। यह सिस्टम अपने आप खराब विचारों को फ़िल्टर कर देता है। यह एक स्व-सुधार करने वाले स्पेलचेकर की तरह है जो आपके संदेश भेजने से पहले ही व्याकरण ठीक कर देता है।
- यह अधिक स्मार्ट है: क्योंकि उन्होंने AI को बहुत सारा मिश्रित डेटा दिया (सिर्फ चलना ही नहीं, बल्कि दराजों और अलमारियों जैसी वस्तुओं के साथ बातचीत करना भी), रोबोट ने विविध प्रकार के कौशल सीखे। यह उस छात्र की तरह है जिसने केवल गणित पढ़ा बनाम उस छात्र की तरह जिसने गणित, भौतिकी और इंजीनियरिंग पढ़ा; दूसरा छात्र अधिक जटिल समस्याओं को हल कर सकता है।
- यह स्केलेबल है: क्योंकि यह प्रक्रिया स्वचालित है, आप रोबोट को तेजी से हजारों नए कौशल सिखा सकते हैं। पुराने तरीके में, एक नया कौशल जोड़ने का मतलब घंटों की मैन्युअल ट्यूनिंग थी। अब, आप बस इसे अधिक डेटा देते हैं, और यह सीख जाता है।
वास्तविक दुनिया का परीक्षण
टीम ने इसका परीक्षण Unitite G1 नामक एक वास्तविक रोबोट पर किया। उन्होंने इसे सिखाया:
- दराज खोलना।
- कुछ उठाने के लिए गहराई तक झुकना (squat)।
- मुक्का मारना।
- ड्रिंक डालना।
- टेबल को वर्टिकल तरीके से पोंछना।
रोबोट केवल ये चीजें करने जैसा दिखा ही नहीं; इसने वास्तव में वास्तविक दुनिया में इन्हें सफलतापूर्वक किया, बिना गिरे या वस्तु को छोड़े।
निष्कर्ष
DreamControl-v2 रोबोटिक्स में एक बड़ी छलांग है क्योंकि यह रोबोटों को एक भद्दे अनुवाद प्रक्रिया के माध्यम से इंसानों की नकल करने के लिए मजबूर करना बंद कर देता है। इसके बजाय, यह एक ऐसा रोबोटिक मस्तिष्क बनाता है जो शुरुआत से ही अपने शरीर को समझता है। यह रोबोटों को सिखाने के कठिन, मैन्युअल काम को एक स्केलेबल, स्वचालित प्रक्रिया में बदल देता है, जो हमें ऐसे रोबोटों के करीब लाता है जो वास्तव में हमारे दैनिक जीवन में हमारी मदद कर सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।