LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model
LOME एक एक्शन-कंडीशन्ड एर्गोसेंट्रिक वर्ल्ड मॉडल है जो स्थानिक क्रियाओं और पर्यावरणीय संदर्भों का संयुक्त रूप से अनुमान लगाकर यथार्थवादी, भौतिक रूप से सुसंगत मानव-वस्तु हेरफेर वाले वीडियो उत्पन्न करता है, जिससे यह AR/VR और रोबोटिक प्रशिक्षण जैसे अनुप्रयोगों के लिए मोशन कंट्रोल और सामान्यीकरण में मौजूदा विधियों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को पानी का गिलास भरना, कॉफी मग उठाना या कपों को एक के ऊपर एक रखना सिखाने की कोशिश कर रहे हैं।
अतीत में, रोबोटों (या कंप्यूटरों) को यह करने के लिए सिखाना ऐसा था जैसे हर बार कार चलाने के लिए शून्य से कार का इंजन बनाने की कोशिश करना। आपको गुरुत्वाकर्षण के भौतिक विज्ञान, मेज के घर्षण और हर कप के सटीक आकार को मैन्युअल रूप से प्रोग्राम करना पड़ता था। यह धीमा, कठोर था, और यदि आप रोबोट को एक अलग कप देते, तो वह भ्रमित हो जाता।
LOME (लर्निंग ह्यूमन-ऑब्जेक्ट मैनिपुलेशन विद एक्शन-कंडीशन्ड एगोसेंट्रिक वर्ल्ड मॉडल) एक नया "जादुई नुस्खा" है जो खेल बदल देता है। इंजन को शून्य से बनाने के बजाय, LOME एक सुपर-स्मार्ट फिल्म डायरेक्टर की तरह है जिसने लाखों घंटों के मानवीय वीडियो देखे हैं और समझ गया है कि दुनिया कैसे काम करती है।
यहाँ बताया गया है कि LOME कैसे काम करता है, जिसे सरल अवधारणाओं में विभाजित किया गया है:
1. "प्रथम-व्यक्ति" परिप्रेक्ष्य (एगोसेंट्रिक)
अधिकांश रोबोट दुनिया को कमरे के कोने में लगी एक सुरक्षा कैमरे की तरह देखते हैं। LOME दुनिया को वैसे ही देखता है जैसे आप देखते हैं: अपनी आँखों से। यह "एगोसेंट्रिक" है, जिसका अर्थ है कि यह समझता है कि जब आप अपने दाहिने हाथ से आगे बढ़ते हैं, तो कप इसलिए हिलता है क्योंकि आपने उसे हिलाया था। यह परिप्रेक्ष्य यह समझने के लिए महत्वपूर्ण है कि हम अपने दैनिक जीवन में वस्तुओं के साथ कैसे बातचीत करते हैं।
2. तीन सामग्रियां
एक इंसान द्वारा कुछ करने (जैसे पानी डालना) का वीडियो बनाने के लिए, LOME को तीन विशिष्ट चीजों की आवश्यकता होती है, जैसे एक शेफ को रेसिपी, सामग्री और खाना पकाने की शैली की आवश्यकता होती है:
- दृश्य (एक फोटो): आप इसे एक शुरुआती चित्र देते हैं (जैसे, एक मेज जिस पर एक हरे रंग की बोतल और एक मग है)।
- स्क्रिप्ट (टेक्स्ट): आप इसे बताते हैं कि क्या करना है (जैसे, "बोतल से मग में पानी डालें")।
- कोरियोग्राफी (एक्शन मैप): यह असली 'सीक्रेट सॉस' है। केवल "डालने" के लिए कहने के बजाय, LOME एक मानचित्र देखता है कि हर एक सेकंड में आपके हाथ ठीक कहाँ चल रहे हैं। यह एक डांस रूटीन देने जैसा है जिसे डायरेक्टर को फॉलो करना है।
3. "संयुक्त नृत्य" (द सीक्रेट सॉस)
यहीं पर LOME वास्तव में चतुर हो जाता है।
पुराने तरीकों में, कंप्यूटर वीडियो और हाथ की गतिविधियों को अलग-अलग अनुमान लगाने की कोशिश करता था। यह एक पेंटर से एक ऐसे डांसर को पेंट करने के लिए कहने जैसा था जो एक अलग कमरे में स्थिर खड़ा है। परिणाम अक्सर अस्त-व्यस्त होता था: हाथ कप की ओर बढ़ सकता था, लेकिन कप नहीं हिलता, या पानी हवा में से अचानक प्रकट हो जाता।
LOME कुछ अलग करता है। यह हाथ की गति और वीडियो को एक एकल, जुड़े हुए नृत्य के रूप में मानता है।
- उपमा: एक कठपुतली मास्टर (हाथ) और एक कठपुतली (वस्तु) की कल्पना करें। पुराने तरीकों ने मास्टर के विवरण के आधार पर कठपुतली को एनिमेट करने की कोशिश की। LOME संयुक्त संबंध सीखता है। यह समझता है कि क्योंकि हाथ बोतल को घुमाता है, इसलिए पानी जरूर बहेगा। यह केवल उसके दिखने के तरीके को नहीं, बल्कि परस्पर क्रिया के भौतिक विज्ञान को सीखता है।
4. इसे क्या खास बनाता है?
- यह भौतिक विज्ञान को सही ढंग से समझता है: यदि आप LOME को पानी डालने के लिए कहते हैं, तो यह केवल एक नीला प्रवाह नहीं बनाता। यह समझता है कि मग में पानी का स्तर बढ़ना चाहिए, और बोतल में स्तर गिरना चाहिए। यह वास्तविक दुनिया के "कारण और प्रभाव" का अनुकरण करता है।
- यह लचीला है: यदि आप उसे एक लाल सेब उठाने का वीडियो दिखाते हैं, और फिर उसे एक नीला बॉल उठाने के लिए कहते हैं, तो वह यह कर सकता है। उसने विशिष्ट सेब को याद नहीं किया है; उसने "उठाने" की अवधारणा को सीखा है।
- 3D मॉडलिंग की आवश्यकता नहीं है: आमतौर पर, रोबोट की वास्तविक गतिविधियों को बनाने के लिए, आपको हर वस्तु के जटिल 3D ब्लूप्रिंट की आवश्यकता होती है। LOME इसे छोड़ देता है। यह सीधे 2D वीडियो से सीखता है, जिससे यह वास्तविक दुनिया में उपयोग करने के लिए बहुत तेज़ और आसान हो जाता है।
परिणाम
जब आप LOME चलाते हैं, तो यह एक ऐसा वीडियो बनाता है जो किसी वास्तविक व्यक्ति द्वारा कार्य करने जैसा दिखता है।
- हाथ: वे बिल्कुल वहीं चलते हैं जहाँ आपने उन्हें बताया था।
- वस्तुएं: वे वास्तविक रूप से प्रतिक्रिया करती हैं (तरल बहता है, कप एक के ऊपर एक रखे जाते हैं, गिराने पर चीजें गिर जाती हैं)।
- निरंतरता: वीडियो ग्लिच या फ्लिकर नहीं करता है; यह शुरू से अंत तक सुचारू रूप से चलता है।
यह क्यों मायने रखता है?
LOME को वास्तविकता के लिए एक यूनिवर्सल सिम्युलेटर के रूप में सोचें।
- रोबोट के लिए: एक लैब में रोबोट बनाने और उसे फ्रिज खोलने के लिए महीनों तक सिखाने के बजाय, हम LOME का उपयोग हजारों "क्या होगा अगर" वाले परिदृश्यों (वीडियो) को उत्पन्न करने के लिए कर सकते हैं। रोबोट LOME की फिल्में देखकर सीखता है।
- वर्चुअल रियलिटी (VR/AR) के लिए: कल्पना कीजिए कि आप VR चश्मा पहनते हैं और पूछते हैं, "मुझे दिखाओ कि इस लीक होते नल को कैसे ठीक किया जाए।" LOME तुरंत आपके सामने एक मानव को ठीक करते हुए एक फोटो-रियलिस्टिक वीडियो बना सकता है, ताकि आप इसे देखकर सीख सकें।
संक्षेप में, LOME जो हम कहते हैं ("पानी डालें"), जो हम करते हैं (हाथ की हरकतें), और जो होता है (पानी बहता है), के बीच एक सेतु है, जो बिना किसी भौतिक सेट या 3D ब्लूप्रिंट के मानवीय संपर्क का एक वास्तविक मूवी बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।