Wh0: Generative World Models as Scalable Sources of Egocentric Human Hand Manipulation Data
यह शोध पत्र Wh0 को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो एगोसेंट्रिक (egocentric) मानव हाथ हेरफेर के वीडियो का एक स्केलेबल और नियंत्रणीय डेटासेट बनाने के लिए जनरेटिव वीडियो वर्ल्ड मॉडल्स का लाभ उठाता है, जिन्हें फिर रोबोट-प्रशिक्षण योग्य सुपरविजन में परिवर्तित किया जाता है ताकि विविध वास्तविक दुनिया के कार्यों में प्री-ट्रेंड विजन-लैंग्वेज-एक्शन मॉडल्स के ज़ीरो-शॉट डेक्सट्रस मैनिपुलेशन प्रदर्शन को महत्वपूर्ण रूप से बढ़ाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को अविश्वसनीय रूप से कुशल, मानव-समान हाथों वाले काम करने के लिए सिखाना चाहते हैं, जैसे कि एक नाजुक टीपॉट (teapot) को उठाना या नल खोलना। आप डेटा की एक क्लासिक "गोल्डिलॉक्स" (Goldilocks) समस्या का सामना करते हैं:
- वास्तविक रोबोट डेटा: आप इंसानों द्वारा सीधे रोबोट को नियंत्रित करने की रिकॉर्डिंग कर सकते हैं। यह रोबोट के लिए एकदम सही है, लेकिन यह एक चम्मच से स्विमिंग पूल भरने जैसा है—इसमें बहुत समय लगता है और यह बेहद महंगा है।
- सिमुलेशन (Simulation): आप रोबot को प्रशिक्षित करने के लिए एक वीडियो गेम दुनिया बना सकते हैं। यह तेज़ और सस्ता है, लेकिन रोबोट अक्सर तब भ्रमित हो जाता है जब वह "गेम" से वास्तविक दुनिया में आता है (जिसे "सिम-टू-रियल" गैप कहा जाता है)।
- वास्तविक मानव वीडियो: आप लोगों को कार्य करते हुए अपने दृष्टिकोण से फिल्मा सकते हैं (जैसे कि उनके सिर पर लगा गोप्रो/GoPro)। इस तरह का डेटा प्रचुर मात्रा में उपलब्ध है, लेकिन रोबोट एक मानव हाथ देखता है, न कि रोबोट का हाथ, और बैकग्राउंड रोबोट के कार्यक्षेत्र से अलग दिखता है।
प्रवेश होता है "Wh0" (उच्चारण: हू) का।
लेखक एक चतुर समाधान प्रस्तावित करते हैं: एक ऐसे AI का उपयोग करें जो अपने स्वयं के वीडियो उत्पन्न करता है।
Wh0 को एक सुपर-पावर्ड मूवी डायरेक्टर के रूप में समझें जिसे कैमरा क्रू की आवश्यकता नहीं है। इसके बजाय, आप इसे एक स्क्रिप्ट (एक भाषा निर्देश जैसे "लाल मग उठाओ"), एक सेट डिज़ाइन (दृश्य), और एक प्रॉप लिस्ट (वस्तुओं की सूची) देते हैं। फिर AI तुरंत एक मानव हाथ द्वारा वह कार्य करने के हजारों वीडियो जेनरेट करता है।
यह प्रक्रिया कैसे काम करती है, यहाँ सरल चरणों में दिया गया है:
1. "मैजिक स्क्रिप्ट" (निर्देश निर्माण)
सिस्टम पहले अपने स्वयं के निर्देश लिखता है। यह केवल "कप उठाओ" नहीं कहता। यह निर्देशों की एक विशाल, विविध लाइब्रेरी बनाता है जैसे "चमकदार लाल मग उठाओ," "भारी हथौड़ा पकड़ो," या "कुचले हुए कागज को बिन में रखें।" यह सुनिश्चित करता है कि रोबोट उन सभी प्रकार की वस्तुओं को संभालना सीखे, जिन्हें उसने पहले नहीं देखा है।
2. "सेट ड्रेसिंग" (दृश्य संरेखण)
यदि AI किसी यादृच्छिक (random) लिविंग रूम में वीडियो बनाता है, तो रोबोट अपने किचन में नेविगेट करना नहीं जान पाएगा। इसलिए, Wh0 रोबोट के वास्तविक कार्यक्षेत्र की एक फोटो लेता है और AI का उपयोग करके उस सटीक फोटो में विशिष्ट वस्तुओं को डाल देता है। यह आपके किचन की एक वास्तविक फोटो लेने और फिर क्रिया फिल्माने से पहले डिजिटल रूप से उस पर एक टीपॉट रखने जैसा है। यह सुनिश्चित करता है कि "बैकग्राउंड" रोबोट की वास्तविकता के साथ पूरी तरह मेल खाता है।
3. "बॉडी स्वैप" (शरीर परिवर्तन)
यह सबसे महत्वपूर्ण ट्रिक है। AI एक कार्य करने के लिए एक मानव हाथ का वीडियो जेनरेट करता है क्योंकि कंप्यूटर के लिए मानव हाथों का विश्लेषण करना आसान होता है। हालाँकि, रोबोट के पास एक मैकेनिकल हाथ है।
Wh0 एक डिजिटल एडिटिंग टूल का उपयोग करके वीडियो में मानव हाथ को एक यथार्थवादी रोबोट हाथ से बदलने के लिए करता है, जो फ्रेम-दर-फ्रेम चलता है। यह बिल्कुल वही मूवमेंट रखता है, लेकिन अब रोबोट खुद को (या अपने जैसे किसी रोबोट को) कार्य करते हुए देखता है। यह "मानव शैली" और "रोबोट शैली" के बीच के अंतर को पाट देता है।
4. "ट्रेनिंग कैंप" (सह-प्रशिक्षण)
फिर रोबोट को दो चीजों के मिश्रण का उपयोग करके प्रशिक्षित किया जाता है:
- "असली" चीजें: वास्तविक फुटेज के बहुत कम क्लिप (लगभग 400 क्लिप) जिनमें इंसानों द्वारा रोबोट को नियंत्रित किया गया है। यह रोबोट को उसके अपने शरीर की सख्त भौतिक सीमाओं को सिखाता है।
- "जेनरेटेड" चीजें: AI-जेनरेटेड वीडियो की विशाल लाइब्रेरी (WM-H डेटासेट)। यह रोबोट को सामान्य रूप से कैसे हिलना है और विभिन्न वस्तुओं को कैसे संभालना है, यह सिखाती है।
परिणाम: एक बड़ी छलांग
पेपर का परीक्षण एक यूनिट्री (Unitility) G1 ह्यूमनॉइड रोबोट पर किया गया जिसके पास कुशल हाथ थे।
- Wh0 के बिना: जब उन्होंने केवल वास्तविक रोबोट डेटा के छोटे से हिस्से पर रोबोट को प्रशिक्षित किया, तो वह नए, अनदेखे कार्यों में केवल 8.3% समय सफल रहा। यह एक ऐसे छात्र की तरह था जिसने एक गणित का सवाल रट लिया लेकिन उसी तरह के मिलते-जुलते सवाल को हल नहीं कर सका।
- Wh0 के साथ: AI-जेनरेटेड वीडियो जोड़ने के बाद, सफलता दर बढ़कर 38.9% हो गई। यह लगभग 5 गुना सुधार है।
मुख्य निष्कर्ष
पेपर तर्क देता है कि आपको रोबोट को शून्य से रोबोट बनना सिखाने की आवश्यकता नहीं है। इसके बजाय, आप पहले उसे "मानव" बनना सिखा सकते हैं (AI द्वारा जेनरेट किए गए मानव वीडियो डेटा का उपयोग करके), और फिर थोड़े से वास्तविक रोबोट डेटा का उपयोग करके उसे धीरे से एक रोबोट बनने के लिए निर्देशित कर सकते हैं।
AI-जेनरेटेड वीडियो एक पुल (bridge) के रूप में कार्य करते हैं। वे स्केलेबल हैं (आप लाखों बना सकते हैं), वे रोबोट के दृश्य के साथ संरेखित हैं (बैकग्राउंड वास्तविक है), और वे रोबोट के शरीर के साथ संरेखित हैं (हाथ को बदला गया है)। यह रोबोट को उन कौशलों को अनलॉक करने की अनुमति देता है जो उसने अपने प्रारंभिक प्रशिक्षण से पहले ही "जान" लिए थे, लेकिन जिन्हें वह पर्याप्त उदाहरण देखने तक लागू नहीं कर पा रहा था।
संक्षेप में: Wh0 का उपयोग एक ऐसा विशाल, कस्टम-मेड "रोबोट ट्रेनिंग वीडियो" लाइब्रेरी बनाने के लिए किया जाता है जिसे बनाना सस्ता है, जो रोबोट के वातावरण के लिए पूरी तरह से अनुकूलित है, और कुशल कौशल सिखाने में अविश्वसनीय रूप से प्रभावी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।