Masquerade: Learning from In-the-wild Human Videos using Data-Editing
मैस्करेड (Masquerade) आर्म इनपेंटिंग (arm inpainting) और रोबोट ओवरले (robot overlay) के माध्यम से इन-द-वाइल्ड (in-the-wild) मानव वीडियो को संपादित करके रोबोट प्रदर्शनों को संश्लेषित करके रोबोट डेटा की कमी को संबोधित करता है, जो एक सह-प्रशिक्षण (co-training) रणनीति को सक्षम बनाता है जो लॉन्ग-होरिज़न द्विपक्षीय कार्यों (long-horizon bimanual tasks) पर मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखाना चाहते हैं, जैसे बर्तन एक के ऊपर एक रखना या आलू छीलना। समस्या यह है कि आपके पास रोबोट को ये काम करते हुए दिखाने वाले हजारों वीडियो नहीं हैं। रोबोट का डेटा रिकॉर्ड करना धीमा, महंगा और विशेष उपकरणों की मांग करने वाला काम है।
हालाँकि, इंटरनेट इंसानों के खाना बनाने के लाखों वीडियो से भरा हुआ है। समस्या यह है कि इंसानों के दिखने और चलने का तरीका रोबोट से बहुत अलग होता है। यदि आप रोबोट को एक चम्मच पकड़ने के लिए मानव हाथ का वीडियो दिखाएंगे, तो रोबोट भ्रमित हो जाएगा क्योंकि उसके पास मानव हाथ नहीं है; उसके पास एक धातु का ग्रिपर (gripper) है। इसे "एम्बॉडिमेंट गैप" (embodiment gap) कहा जाता है।
मास्करेड (Masquerade) इस अंतर को पाटने के लिए एक चतुर तकनीक है। यह कैसे काम करता है, यहाँ इसके सरल चरण दिए गए हैं:
1. "डिजिटल मास्क" (डेटा एडिटिंग)
सोचिए कि शोधकर्ता एक "मास्करेड मास्क" पहने हुए डिजिटल संपादक (editors) हैं। वे मानव खाना बनाने के कच्चे वीडियो लेते हैं और उन्हें एक विशेष प्रक्रिया से गुजारते हैं:
- चरण A: वे AI का उपयोग करके हर फ्रेम में यह पता लगाते हैं कि इंसान के हाथ ठीक कहाँ हैं।
- चरण B: वे "इनपेंटिंग" (जैसे एक जादुई इरेज़र) का उपयोग करके इंसान के हाथों और शरीर को वीडियो से हटा देते हैं।
- चरण C: वे उसी स्थान पर, जहाँ पहले इंसान का हाथ था, डिजिटल रूप से एक सिम्युलेटेड (simulated) रोबोटिक हाथ चिपका देते हैं।
परिणामस्वरूप, एक ऐसा वीडियो बनता है जो ऐसा दिखता है जैसे कोई रोबोट खाना बना रहा हो, भले ही वह मूल रूप से एक इंसान था। उन्होंने मानव वीडियो के 675,000 फ्रेम्स को "रोबोटाइज्ड" प्रदर्शनों में बदल दिया।
2. "अपेंटिस" (प्री-ट्रेनिंग)
अब, उनके पास इन नकली रोबोट वीडियो का एक विशाल पुस्तकालय है। वे इसका उपयोग रोबोट के "दिमाग" (विज़न एनकोडर) को प्रशिक्षित करने के लिए करते हैं।
- पाठ: रोबोट का दिमाग यह सीखता है कि दृश्य को देखकर अगला कदम क्या होगा, और वह भी इन एडिट किए गए वीडियो को देखकर।
- उपमा: यह एक छात्र की तरह है जो एक शेफ के हिलने-डुलने के तरीके पर आधारित हजार कहानियाँ पढ़ रहा है, भले ही उस छात्र ने कभी चाकू पकड़ा ही न हो। वे गति की अवधारणा (concept) को सीख रहे हैं।
3. "मेंटर" (को-ट्रेनिंग)
रोबोट को अभी भी अपने स्वयं के शरीर के वास्तविक भौतिक विज्ञान (physics) को सीखने की आवश्यकता है। इसलिए, शोधकर्ता बहुत कम वास्तविक डेटा एकत्र करते हैं: केवल 50 वीडियो जिनमें एक वास्तविक रोबोट एक विशिष्ट रसोई में कार्य कर रहा है।
- ट्विस्ट: इन 50 वास्तविक वीडियो पर केवल प्रशिक्षण देने के बजाय, वे इन 50 वास्तविक वीडियो को हजारों एडिट किए गए मानव वीडियो के साथ एक साथ प्रशिक्षित करते हैं।
- क्यों? यदि वे केवल उन 50 वास्तविक वीडियो पर प्रशिक्षण देते, तो रोबोट बहुत सीमित (rigid) हो जाता और नई रसोई में विफल हो जाता। यदि वे केवल मानव वीडियो पर प्रशिक्षण देते, तो रोबोट अपने स्वयं के धातु के ग्रिपर को नहीं समझ पाता। दोनों को एक साथ करके, रोबोट इंसानों से खाना बनाने का सामान्य "प्रवाह" (flow) सीखता है और 50 वास्तविक उदाहरणों से अपने शरीर का विशिष्ट "अहसास" सीखता है।
परिणाम: किसी भी रसोई में मास्टर शेफ
शोधकर्ताओं ने तीन कठिन कार्यों पर इसका परीक्षण किया (बर्तन स्टैक करना, आलू छीलना, मिर्च झाड़ना) बिल्कुल नई रसोई में जिन्हें रोबोट ने पहले कभी नहीं देखा था।
- प्रतिस्पर्धा: उन्होंने अपने तरीके की तुलना अन्य शीर्ष AI मॉडलों से की, जो या तो कच्चे मानव वीडियो से सीखते थे (बिना एडिटिंग के) या मानक इमेज डेटासेट से सीखते थे।
- जीत: मास्करेड रोबोट अन्य मॉडलों की तुलना में 5 से 6 गुना अधिक सफल रहा।
- मुख्य निष्कर्ष: "जादू" केवल अधिक डेटा होने में नहीं था; यह एडिटिंग में था। जब उन्होंने मानव वीडियो का उपयोग बिना हाथ बदले किया, तो प्रदर्शन गिर गया। रोबोट को प्रभावी ढंग से सीखने के लिए वीडियो में खुद को (या अपने संस्करण को) देखने की आवश्यकता थी।
सारांश
मास्करेड एक रोबोट को एक "सपने" देने जैसा है जहाँ वह उन लाखों कार्यों को करते हुए खुद को देखता है जो उसने वास्तव में कभी नहीं किए हैं। मानव वीडियो को रोबोट वीडियो की तरह बदलकर एडिट करके, और फिर इसे थोड़े से वास्तविक अभ्यास के साथ मिलाकर, रोबोट सामान्यीकरण (generalize) करना सीख जाता है। वह एक पूरी तरह से नई रसोई में जा सकता है और सफलतापूर्वक खाना बना सकता है, भले ही उसे केवल 50 वास्तविक उदाहरणों पर प्रशिक्षित किया गया हो।
यह पेपर क्या दावा नहीं करता है:
- यह दावा नहीं करता कि रोबोट पूर्ण है; एडिटिंग हमेशा 100% सटीक नहीं होती (उदाहरण के लिए, यदि हाथ किसी बर्तन के पीछे छिपा है, तो रोबोट अजीब लग सकता है)।
- यह दावा नहीं करता कि यह हर प्रकार के रोबोट के लिए काम करता है (उन्होंने एक विशिष्ट दो-हाथों वाले सेटअप का उपयोग किया था)।
- यह दावा नहीं करता कि यह रोबोट के घूमने-फिरने की समस्या को हल करता है (प्रयोग में रोबोट का कैमरा और बेस स्थिर था)।
मूल संदेश सरल है: केवल इंसानों को न देखें; वीडियो को एडिट करें ताकि रोबोट को दिखाया जा सके कि वह वही काम कैसे करेगा, और आपको बहुत बेहतर परिणाम मिलेंगे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।