CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators
CLAP एक नवीन ढांचा है जो विषम इंटरनेट-पैमाने के वीडियो पर प्रशिक्षण देकर विविध रोबोट और मानव स्वरूपों (embodiments) में ज़ीरो-शॉट भौतिक सिमुलेशन को सक्षम बनाता है, जो अवस्था-पश्चात अनुकूलन (few-shot adaptation) और सामान्यीकरण योग्य भौतिक समझ में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक पाठ्यक्रम-आधारित शिक्षण रेसिपी के माध्यम से विसंगत एक्शन स्पेसों का सामंजस्य स्थापित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से भौतिक दुनिया को उस तरह से समझने के लिए संघर्ष कर रहे हैं जैसे इंसान करते हैं। जबकि एक बच्चा सीख जाता है कि यदि मेज से नीचे धकेला जाए तो कप गिर जाएगा या तौलिए के कोनों को खींचकर उसे मोड़ा जा सकता है, रोबोट को इन सरल नियमों में से एक को सीखने के लिए भी हजारों विशिष्ट उदाहरणों की आवश्यकता होती है। यह कठिनाई इस तथ्य से उत्पन्न होती है कि अधिकांश रोबोटिक लर्निंग सिस्टम एक ही प्रकार की मशीन के डेटा पर प्रशिक्षित होते हैं। एक लंबी, पतली भुजा वाला रोबोट, ग्रिपर या मानव हाथ वाले रोबोट की तुलना में भौतिकी को अलग तरह से सीखता है, जिससे एक बाधा उत्पन्न होती है जहाँ एक द्वारा प्राप्त ज्ञान दूसरे के साथ आसानी से साझा नहीं किया जा सकता। इसे दूर करने के लिए, वैज्ञानिकों ने वीडियो जनरेशन मॉडल की ओर देखना शुरू कर दिया है, जो ऐसे कंप्यूटर प्रोग्राम हैं जो किसी दृश्य में आगे क्या होगा, इसकी कल्पना करने में सक्षम हैं। यदि एक रोबोट वीडियो देख सकता है और वस्तुओं की भविष्य की गति का अनुमान लगा सकता है, तो वह उन्हें शारीरिक रूप से आज़माने की आवश्यकता के बिना अपने कार्यों की योजना बना सकता है। हालाँकि, ये प्रेडिक्टिव मॉडल ऐतिहासिक रूप से एकल रोबोट प्रकार तक सीमित रहे हैं, जिससे वे इंटरनेट पर उपलब्ध मानव और रोबोट वीडियो के विशाल, विविध पुस्तकालय से सीखने में असमर्थ रहे हैं।
प्रिंसटन यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इस अंतर को पाटने के लिए CLAP नामक एक नया फ्रेमवर्क विकसित किया है। उनका कार्य यह प्रदर्शित करता है कि एक एकल वीडियो मॉडल मानव और कई अलग-अलग प्रकार के रोबोटों वाले वीडियो के विशाल मिश्रण पर प्रशिक्षण देकर भौतिकी के सार्वभौमिक नियमों को सीख सकता है। मुख्य विचार यह है कि जबकि एक मानव हाथ, एक रोबोटिक आर्म और एक ग्रिपर सभी अलग दिखते हैं, वे वस्तुओं को हिलाते समय एक ही भौतिक नियमों का पालन करते हैं। कंप्यूटर को यह सिखाकर कि क्रिया को कौन या क्या कर रहा है, चाहे वह कुछ भी हो, दृश्य के भविष्य की भविष्यवाणी कैसे की जाए, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई जो दुनिया की अंतर्निहित यांत्रिकी को समझती है न कि केवल एक विशिष्ट मशीन की गतिविधियों को। यह दृष्टिकोण मॉडल को बिना किसी निर्देश वाले अनलेबल इंटरनेट वीडियो और विस्तृत रोबोट डेटा दोनों से सीखने की अनुमति देता है, जिससे चीजों के हिलने और परस्पर क्रिया करने के तरीके की कहीं अधिक समृद्ध समझ विकसित होती है।
शोधकर्ताओं को एक महत्वपूर्ण बाधा का सामना करना पड़ा क्योंकि जिस डेटा का वे उपयोग करना चाहते थे वह अव्यवस्थित और असंगत था। मानव वीडियो के साथ यह निर्देश नहीं आते कि उनके हाथ कैसे हिले, और विभिन्न रोबोट अपनी गतिविधियों को वर्णित करने के लिए अलग-अलग तरीकों का उपयोग करते हैं। इसे हल करने के लिए, टीम ने इन सभी अलग-अलग गति की भाषाओं को एक सामान्य प्रारूप में अनुवाद करने की एक विधि बनाई। उन्होंने तीन मुख्य उपकरणों का उपयोग किया: रोबोट के हाथ की सटीक स्थिति, गति का सरल पाठ्य विवरण (टेक्स्ट डिस्क्रिप्शन), और क्रिया का एक छिपा हुआ, सीखा हुआ प्रतिनिधित्व जिसे कंप्यूटर स्वयं समझ लेता है। सबसे प्रभावी रणनीति एक चरण-दर-चरण सीखने की प्रक्रिया थी। पहले, मॉडल ने अनलेबल वीडियो का उपयोग करके और छिपे हुए एक्शन रिप्रेजेंटेशन का उपयोग करके भौतिकी के बुनियादी नियमों को सीखा। एक बार जब उसने मौलिक गतिशीलता को समझ लिया, तो शोधकर्ताओं ने रोबोट के सटीक लेबल वाले मूवमेंट वाले डेटा का उपयोग करके इसके ज्ञान को परिष्कृत किया। इस दो-चरणीय दृष्टिकोण ने सिस्टम को इंटरनेट वीडियो के विशाल भंडार का उपयोग करने के साथ-साथ वास्तविक रोबोटों को नियंत्रित करने के लिए पर्याप्त सटीक बनाए रखने की अनुमति दी।
इस कार्य के परिणाम दिखाते हैं कि नया सिस्टम उन सर्वश्रेष्ठ मौजूदा मॉडलों के समान और अक्सर उनसे बेहतर प्रदर्शन करता है जो केवल एक ही प्रकार के रोबोट पर प्रशिक्षित किए गए थे। चुनौतीपूर्ण परीक्षण वातावरणों में, मॉडल वीडियो के भविष्य के फ्रेमों की उच्च सटीकता के साथ भविष्यवाणी कर सका, और सही ढंग से सिम्युलेट कर सका कि वस्तुएं कैसे गिरेंगी, फिसलेंगी या हेरफेर की जाएंगी। महत्वपूर्ण रूप से, सिस्टम इस ज्ञान को हर नए रोबोट के लिए पुन: प्रशिक्षित किए बिना वास्तविक दुनिया के कार्यों में सामान्यीकृत करने में सक्षम था। जब एक सिंगल-आर्म रोबोट पर परीक्षण किया गया, तो सिस्टम ने टेप, मछली या लॉबस्टर जैसी विभिन्न वस्तुओं को उठाने के लिए अपने कार्यों की योजना बनाने में सफलतापूर्वक मदद की, और मानक रोबic पॉलिसियों से बेहतर प्रदर्शन किया। इससे भी अधिक प्रभावशाली बात यह है कि सिस्टम को एक दो-भुजाओं वाले रोबोट और एक मानवोïde रोबोट पर लागू किया जा सकता था जिसकी शारीरिक संरचना अलग थी, जबकि उसे उन विशिष्ट मशीनों के डेटा पर कभी प्रशिक्षित नहीं किया गया था। केवल मॉडल की अंतिम परत को नए रोबोट की गतिविधियों से मेल खाने के लिए समायोजित करके, सिस्टम ने भौतिकी की अपनी गहरी समझ को बनाए रखा और सटीक भविष्यवाणियां करना जारी रखा।
यह शोध बताता है कि अधिक सक्षम रोबोटों का मार्ग हर नई मशीन के लिए एक अद्वितीय मस्तिष्क बनाने की आवश्यकता नहीं है। इसके बजाय, विविध डेटा के मिश्रण पर प्रशिक्षण देकर, एक एकल मॉडल भौतिक सिद्धांतों का एक सामान्य सेट सीख सकता है जो लगभग किसी भी एजेंट पर लागू होता है। शोधकर्ताओं ने पाया कि जबकि सापेक्ष गति (relative movements), जो स्थिति के बजाय परिवर्तन का वर्णन करती है, टेक्स्ट-आधारित निर्देशों के लिए अच्छा काम करती थी, सटीक रोबोटिक आर्म्स के नियंत्रण के लिए पूर्ण स्थिति (absolute positions) आवश्यक थी। उन्होंने यह भी खोजा कि जबकि मानव वीडियो मॉडल को भौतिकी के मूल सिद्धांत सिखाने के लिए उत्कृष्ट थे, वास्तविक रोबोट से प्राप्त डेटा उस ज्ञान को सफल वास्तविक दुनिया की क्रियाओं में अनुवादित करने के लिए आवश्यक था। यह कार्य रोबोटों को प्रशिक्षित करने का एक नया तरीका स्थापित करता है, जो अलग-थलग, एकल-उद्देश्य वाली प्रणालियों से हटकर एक अधिक एकीकृत दृष्टिकोण की ओर बढ़ता है जहाँ एक स्वरूप (embodiment) से सीखा गया ज्ञान सीधे दूसरे को लाभ पहुँचा सकता है। हालांकि यह प्रणाली पूर्ण नहीं है और कभी-कभी इसकी भविष्यवाणियों में त्रुटियां हो सकती हैं, लेकिन यह अवलोकन और कल्पना के माध्यम से मशीनों को भौतिक दुनिया को समझने के लिए सिखाने की दिशा में एक महत्वपूर्ण कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।