OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining
यह शोध पत्र OpenWAM को प्रस्तुत करता है, जो एक खुला और मॉड्यूलर अनुसंधान स्टैक है जो मुख्य डिज़ाइन सिद्धांतों को प्राप्त करने के लिए नियंत्रित प्रयोगों के माध्यम से वर्ल्ड-एक्शन मॉडल प्रीट्रेनिंग की व्यवस्थित रूप से जांच करता है, जिसका समापन 6,400 घंटों के विविध एम्बोडीड डेटा पर प्रशिक्षित उच्च-प्रदर्शन वाले OpenWAM- मॉडल की रिलीज़ के साथ होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
बुद्धिमत्ता केवल दुनिया को देखने के बारे में नहीं है; यह यह जानने के बारे में है कि इसे कैसे बदला जाए। दशकों से, वैज्ञानिकों ने ऐसे कंप्यूटर सिस्टम बनाए हैं जो एक तस्वीर में वस्तुओं को पहचान सकते हैं या एक वाक्य में दृश्य का वर्णन कर सकते हैं। हाल ही में, उन्होंने ऐसे मॉडल बनाए हैं जो कल्पना कर सकते हैं कि एक दृश्य समय के साथ कैसे विकसित होगा, यानी पिछले फ्रेम के आधार पर वीडियो के अगले फ्रेम की भविष्यवाणी कर सकते हैं। ये सिस्टम दुनिया के भौतिक विज्ञान (फिजिक्स) को सीखते हैं—जैसे कि एक कप कैसे गिरता है, एक दरवाजा कैसे झूलता है—विशाल मात्रा में वीडियो देखकर। हालाँकि, दुनिया को देखने और उसके भीतर कार्य करने के बीच एक अंतर है। एक रोबोट को केवल इस बात की भविष्यवाणी की आवश्यकता नहीं होती कि क्या होगा; उसे यह जानने की आवश्यकता है कि कौन सी विशिष्ट गतिविधियाँ उस भविष्यवाणी को सच करने के लिए आवश्यक हैं। यही 'एम्बोडीड लर्निंग' (embodied learning) की चुनौती है: एक दृश्य भविष्य को समझने और उस तक पहुँचने के लिए भौतिक क्रियाओं को उत्पन्न करने के बीच के अंतर को पाटना।
शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए 'ओपनWAM' (OpenWAM) नामक एक नया दृष्टिकोण पेश किया है। एक एकल, कठोर रोबोट मस्तिष्क बनाने के बजाय जिसे बदलना या समझना कठिन हो, उन्होंने एक खुला, मॉड्यूलर सिस्टम बनाया जो एक रोबोट नियंत्रक के डिजाइन को बदलने योग्य हिस्सों के एक सेट की तरह मानता है। उन्होंने रोबोट को कार्य करने के लिए सिखाने के जटिल कार्य को तीन अलग-अलग प्रश्नों में विभाजित किया: रोबोट को वीडियो देखकर कौन सा ज्ञान विरासत में मिलना चाहिए, रोबोट की दुनिया की समझ और उसकी गति करने की क्षमता को एक साथ कैसे काम करना चाहिए, और इस सीखने को विभिन्न प्रकार के रोबोटों और वातावरणों में कैसे स्केल किया जा सकता है? इन प्रश्नों के उत्तर नियंत्रित प्रयोगों के माध्यम से देकर, उन्होंने सिद्धांतों का एक समूह निकाला जिसने 'OpenWAM-α' के निर्माण का मार्ग प्रशस्त किया, जो एक शक्तिशाली नया मॉडल है जो सिमुलेटेड और वास्तविक दुनिया दोनों में वस्तुओं के हेरफेर (manipulate) को सीख सकता है।
शोधकर्ताओं ने शुरुआत इस सवाल से की कि रोबोट को किस प्रकार के "विश्व ज्ञान" (world knowledge) के साथ शुरुआत करनी चाहिए। उन्होंने परीक्षण किया कि क्या रोबोट को एक विशाल वीडियो जनरेटर से सीखना चाहिए जिसने लाखों घंटों का फुटेज देखा है, या क्या उसे एक सरल विजुअल एनकोडर पर भरोसा करना चाहिए। उन्होंने पाया कि सर्वोत्तम परिणाम एक बड़े, पूर्व-प्रशिक्षित वीडियो जनरेटर का उपयोग करने से मिले। यह मॉडल पहले से ही समझता है कि वस्तुएं कैसे चलती हैं और परस्पर क्रिया करती हैं, जिससे एक समृद्ध शुरुआत मिलती है। हालाँकि, केवल इस वीडियो मॉडल के साथ एक रोबलेट हाथ जोड़ देना पर्याप्त नहीं था। शोधकर्ताओं ने पाया कि रोबोट को जो वह देखता है, उसे एक संक्षिप्त और कुशल तरीके से दर्शाने की आवश्यकता है। उन्होंने दृश्य जानकारी को एक छोटे, अधिक प्रबंधनीय रूप में संकुचित करने के विभिन्न तरीकों का परीक्षण किया, और पाया कि एक विशिष्ट प्रकार का संपीड़न (compression) जो दुनिया के आवश्यक विवरणों को बनाए रखता है और शोर (noise) को हटा देता है, सबसे अच्छा काम करता है। इसने रोबोट को डेटा से अभिभूत हुए बिना दृश्य के महत्वपूर्ण हिस्सों पर ध्यान केंद्रित करने की अनुमति दी।
इसके बाद, टीम ने जांच की कि रोबोट के "मस्तिष्क" को उसकी दुनिया की समझ को उसकी गति करने की क्षमता से जोड़ने के लिए कैसे संरचित किया जाना चाहिए। उन्होंने विभिन्न वास्तुशिल्प डिजाइनों की तुलना की, जिनमें वे मॉडल शामिल थे जहाँ वीडियो और क्रिया भाग पूरी तरह से अलग थे, और वे जहाँ वे गहराई से जुड़े हुए थे। उनके प्रयोगों ने दिखाया कि सबसे प्रभावी डिजाइन एक 'दोहरी प्रणाली' (dual-system) दृष्टिकोण था। इस सेटअप में, मॉडल का एक हिस्सा दुनिया की भविष्य की दृश्य स्थिति की भविष्यवाणी करने पर ध्यान केंद्रित करता है, जबकि एक समर्पित हिस्सा गतिविधियों के अनुक्रम को उत्पन्न करने पर ध्यान केंद्रित करता है। महत्वपूर्ण रूप से, इन दोनों हिस्सों को एक-दूसरे से लगातार बात करने की अनुमति दी गई थी। क्रिया जनरेटर (action generator) क्या करना है यह तय करने के लिए भविष्य की भविष्यवाणी को देख सकता था, और विश्व भविष्यवक्ता (world predictor) होने वाली घटनाओं के अपने विजन को परिष्कृत करने के लिए नियोजित क्रियाओं का उपयोग कर सकता था। इस निरंतर, दो-तरफा बातचीत ने मॉडल को केवल देखने और कार्य करने को साथ-साथ सीखने के बजाय, उनके बीच एक वास्तविक तालमेल सीखने की अनुमति दी।
शोधकर्ताओं ने यह भी पता लगाया कि इन मॉडलों को विभिन्न प्रकार के डेटा का उपयोग करके कैसे प्रशिक्षित किया जाए। उनके पास दो मुख्य स्रोत थे: मनुष्यों द्वारा किए जाने वाले कार्यों के प्रथम-व्यक्ति परिप्रेक्ष्य (first-person perspective) से वीडियो, जो विविध दृश्य प्रदान करते हैं लेकिन कोई रोबोट क्रिया डेटा नहीं देते, और वास्तविक रोबोटों द्वारा किए गए कार्यों की रिकॉर्डिंग, जो सटीक गति निर्देश प्रदान करती है लेकिन कम प्रकार के दृश्यों को कवर करती है। उन्होंने परीक्षण किया कि क्या केवल रोबोट डेटा, केवल मानव डेटा, या दोनों के मिश्रण पर प्रशिक्षण देना बेहतर है। उन्होंने पाया कि एक ही प्रशिक्षण सत्र में दोनों स्रोतों को मिलाना सबसे शक्तिशाली रणनीति थी। मानव वीडियो ने मॉडल को दुनिया की व्यापक विविधता के बारे में सिखाया, जबकि रोबोट डेटा ने उस ज्ञान को भौतिक वास्तविकता में स्थापित किया। इस संयोजन ने मॉडल को नए, अनदेखे स्थितियों में बहुत बेहतर तरीके से सामान्यीकरण (generalize) करने की अनुमति दी, बजाय इसके कि उसे केवल एक प्रकार के डेटा पर प्रशिक्षित किया जाता।
इन सिद्धांतों का उपयोग करते हुए, टीम ने 50 करोड़ (500 मिलियन) फ्रेम के वीडियो और रोबोट डेटा पर प्रशिक्षित 'OpenWAM-α' बनाया। उन्होंने इस मॉडल का परीक्षण आठ अलग-अलग सिमुलेशन बेंचमार्क और सिंगल आर्म, टू-आर्म और यहाँ तक कि डेक्सट्रस (dexterous) हाथों वाले वास्तविक रोबोटों पर किया। परिणाम सुसंगत और प्रभावशाली थे। सिमुलेशन में, मॉडल ने ब्लॉक रखने से लेकर जटिल वस्तुओं के हेरफेर तक, कार्यों की एक विस्तृत श्रृंखला में शीर्ष स्तर पर प्रदर्शन किया। जब इसे वास्तविक दुनिया में ले जाया गया, तो इसने उच्च प्रदर्शन बनाए रखा, और उन भौतिक रोबोटों पर सफलतापूर्वक कार्य पूरे किए जिन्हें उसने पहले कभी नहीं देखा था। मॉडल ने नए वातावरणों के अनुकूल होने में विशेष शक्ति दिखाई, जो यह सुझाव देती है कि वीडियो-आधारित विश्व ज्ञान और क्रिया-आधारित ग्राउंडिंग का संयोजन एक मजबूत आधार बनाता है।
सबसे महत्वपूर्ण निष्कर्षों में से एक यह था कि यह दृष्टिकोण अन्य लोकप्रिय विधियों की तुलना में कैसा रहा। कुछ सिस्टम भाषा और दृश्य समझ पर बहुत अधिक निर्भर करते हैं लेकिन भविष्य को स्पष्ट रूप से मॉडल नहीं करते, जबकि अन्य शुद्ध रूप से गति के यांत्रिकी (mechanics) पर ध्यान केंद्रित करते हैं। शोधकर्ताओं ने पाया कि उनका वीडियो-आधारित दृष्टिकोण प्रशिक्षण डेटा को फिट करने और परिचित सेटिंग्स में अच्छा प्रदर्शन करने में उत्कृष्ट था, जबकि अन्य विधियाँ कभी-कभी पूरी तरह से नए, अराजक वातावरणों में बेहतर सामान्यीकरण करती थीं। हालाँकि, उन्होंने निष्कर्ष निकाला कि कोई भी दृष्टिकोण अपने आप में पूर्ण नहीं है। भविष्य की प्रगति की कुंजी दोनों की शक्तियों को जोड़ना है: क्रिया को निर्देशित करने के लिए वीडियो जनरेशन के समृद्ध दृश्य और भौतिक पूर्वाग्रहों (priors) का उपयोग करना, जबकि यह सुनिश्चित करना कि सिस्टम को विविध, उच्च-गुणवत्ता वाले डेटा पर प्रशिक्षित किया गया है जो वास्तविक दुनिया की चुनौतियों की पूरी सीमा को कवर करता है।
OpenWAM प्रोजेक्ट केवल एक नया रोबोट नियंत्रक प्रस्तुत नहीं करता है; यह वैज्ञानिक समुदाय के लिए एक पूर्ण टूलकिट प्रदान करता है। बुनियादी ढांचे, प्रशिक्षण डेटा और मूल्यांकन प्रोटोकॉल को जारी करके, शोधकर्ताओं ने विश्व-क्रिया (world-action) मॉडलों के विकास को एक पारदर्शी, पुनरुत्पादक विज्ञान में बदल दिया है। यह अन्य वैज्ञानिकों को विशिष्ट विचारों का परीक्षण करने, घटकों को बदलने और यह समझने की अनुमति देता है कि कुछ डिज़ाइन दूसरे से बेहतर क्यों काम करते हैं। यह कार्य सुझाव देता है कि अधिक सक्षम रोबोटों का मार्ग बड़े, अपारदर्शी सिस्टम बनाने के माध्यम से नहीं है, बल्कि यह समझने के माध्यम से है कि ज्ञान और सीखने के विभिन्न हिस्से एक दूसरे के साथ कैसे परस्पर क्रिया करते हैं। रोबोट के मन को कंपोजेबल (composable) भागों के संग्रह के रूप में मानकर, शोधकर्ताओं ने कृत्रिम बुद्धिमत्ता में व्यवस्थित अन्वेषण के एक नए युग के द्वार खोल दिए हैं, जहाँ प्रत्येक डिज़ाइन विकल्प का परीक्षण, मापन और सुधार किया जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।