← नवीनतम पेपर
💻 computer science

OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

यह शोध पत्र OpenWAM को प्रस्तुत करता है, जो एक खुला और मॉड्यूलर अनुसंधान स्टैक है जो मुख्य डिज़ाइन सिद्धांतों को प्राप्त करने के लिए नियंत्रित प्रयोगों के माध्यम से वर्ल्ड-एक्शन मॉडल प्रीट्रेनिंग की व्यवस्थित रूप से जांच करता है, जिसका समापन 6,400 घंटों के विविध एम्बोडीड डेटा पर प्रशिक्षित उच्च-प्रदर्शन वाले OpenWAM-α\alpha मॉडल की रिलीज़ के साथ होता है।

मूल लेखक: Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu
प्रकाशित 2026-09-09
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu, Zijie Zhu, Ning Gao, Xiaowei Chi, Guanqi He, Shanghang Zhang, Hao Dong, Lin Shao, Hang Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बुद्धिमत्ता केवल दुनिया को देखने के बारे में नहीं है; यह यह जानने के बारे में है कि इसे कैसे बदला जाए। दशकों से, वैज्ञानिकों ने ऐसे कंप्यूटर सिस्टम बनाए हैं जो एक तस्वीर में वस्तुओं को पहचान सकते हैं या एक वाक्य में दृश्य का वर्णन कर सकते हैं। हाल ही में, उन्होंने ऐसे मॉडल बनाए हैं जो कल्पना कर सकते हैं कि एक दृश्य समय के साथ कैसे विकसित होगा, यानी पिछले फ्रेम के आधार पर वीडियो के अगले फ्रेम की भविष्यवाणी कर सकते हैं। ये सिस्टम दुनिया के भौतिक विज्ञान (फिजिक्स) को सीखते हैं—जैसे कि एक कप कैसे गिरता है, एक दरवाजा कैसे झूलता है—विशाल मात्रा में वीडियो देखकर। हालाँकि, दुनिया को देखने और उसके भीतर कार्य करने के बीच एक अंतर है। एक रोबोट को केवल इस बात की भविष्यवाणी की आवश्यकता नहीं होती कि क्या होगा; उसे यह जानने की आवश्यकता है कि कौन सी विशिष्ट गतिविधियाँ उस भविष्यवाणी को सच करने के लिए आवश्यक हैं। यही 'एम्बोडीड लर्निंग' (embodied learning) की चुनौती है: एक दृश्य भविष्य को समझने और उस तक पहुँचने के लिए भौतिक क्रियाओं को उत्पन्न करने के बीच के अंतर को पाटना।

शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए 'ओपनWAM' (OpenWAM) नामक एक नया दृष्टिकोण पेश किया है। एक एकल, कठोर रोबोट मस्तिष्क बनाने के बजाय जिसे बदलना या समझना कठिन हो, उन्होंने एक खुला, मॉड्यूलर सिस्टम बनाया जो एक रोबोट नियंत्रक के डिजाइन को बदलने योग्य हिस्सों के एक सेट की तरह मानता है। उन्होंने रोबोट को कार्य करने के लिए सिखाने के जटिल कार्य को तीन अलग-अलग प्रश्नों में विभाजित किया: रोबोट को वीडियो देखकर कौन सा ज्ञान विरासत में मिलना चाहिए, रोबोट की दुनिया की समझ और उसकी गति करने की क्षमता को एक साथ कैसे काम करना चाहिए, और इस सीखने को विभिन्न प्रकार के रोबोटों और वातावरणों में कैसे स्केल किया जा सकता है? इन प्रश्नों के उत्तर नियंत्रित प्रयोगों के माध्यम से देकर, उन्होंने सिद्धांतों का एक समूह निकाला जिसने 'OpenWAM-α' के निर्माण का मार्ग प्रशस्त किया, जो एक शक्तिशाली नया मॉडल है जो सिमुलेटेड और वास्तविक दुनिया दोनों में वस्तुओं के हेरफेर (manipulate) को सीख सकता है।

शोधकर्ताओं ने शुरुआत इस सवाल से की कि रोबोट को किस प्रकार के "विश्व ज्ञान" (world knowledge) के साथ शुरुआत करनी चाहिए। उन्होंने परीक्षण किया कि क्या रोबोट को एक विशाल वीडियो जनरेटर से सीखना चाहिए जिसने लाखों घंटों का फुटेज देखा है, या क्या उसे एक सरल विजुअल एनकोडर पर भरोसा करना चाहिए। उन्होंने पाया कि सर्वोत्तम परिणाम एक बड़े, पूर्व-प्रशिक्षित वीडियो जनरेटर का उपयोग करने से मिले। यह मॉडल पहले से ही समझता है कि वस्तुएं कैसे चलती हैं और परस्पर क्रिया करती हैं, जिससे एक समृद्ध शुरुआत मिलती है। हालाँकि, केवल इस वीडियो मॉडल के साथ एक रोबलेट हाथ जोड़ देना पर्याप्त नहीं था। शोधकर्ताओं ने पाया कि रोबोट को जो वह देखता है, उसे एक संक्षिप्त और कुशल तरीके से दर्शाने की आवश्यकता है। उन्होंने दृश्य जानकारी को एक छोटे, अधिक प्रबंधनीय रूप में संकुचित करने के विभिन्न तरीकों का परीक्षण किया, और पाया कि एक विशिष्ट प्रकार का संपीड़न (compression) जो दुनिया के आवश्यक विवरणों को बनाए रखता है और शोर (noise) को हटा देता है, सबसे अच्छा काम करता है। इसने रोबोट को डेटा से अभिभूत हुए बिना दृश्य के महत्वपूर्ण हिस्सों पर ध्यान केंद्रित करने की अनुमति दी।

इसके बाद, टीम ने जांच की कि रोबोट के "मस्तिष्क" को उसकी दुनिया की समझ को उसकी गति करने की क्षमता से जोड़ने के लिए कैसे संरचित किया जाना चाहिए। उन्होंने विभिन्न वास्तुशिल्प डिजाइनों की तुलना की, जिनमें वे मॉडल शामिल थे जहाँ वीडियो और क्रिया भाग पूरी तरह से अलग थे, और वे जहाँ वे गहराई से जुड़े हुए थे। उनके प्रयोगों ने दिखाया कि सबसे प्रभावी डिजाइन एक 'दोहरी प्रणाली' (dual-system) दृष्टिकोण था। इस सेटअप में, मॉडल का एक हिस्सा दुनिया की भविष्य की दृश्य स्थिति की भविष्यवाणी करने पर ध्यान केंद्रित करता है, जबकि एक समर्पित हिस्सा गतिविधियों के अनुक्रम को उत्पन्न करने पर ध्यान केंद्रित करता है। महत्वपूर्ण रूप से, इन दोनों हिस्सों को एक-दूसरे से लगातार बात करने की अनुमति दी गई थी। क्रिया जनरेटर (action generator) क्या करना है यह तय करने के लिए भविष्य की भविष्यवाणी को देख सकता था, और विश्व भविष्यवक्ता (world predictor) होने वाली घटनाओं के अपने विजन को परिष्कृत करने के लिए नियोजित क्रियाओं का उपयोग कर सकता था। इस निरंतर, दो-तरफा बातचीत ने मॉडल को केवल देखने और कार्य करने को साथ-साथ सीखने के बजाय, उनके बीच एक वास्तविक तालमेल सीखने की अनुमति दी।

शोधकर्ताओं ने यह भी पता लगाया कि इन मॉडलों को विभिन्न प्रकार के डेटा का उपयोग करके कैसे प्रशिक्षित किया जाए। उनके पास दो मुख्य स्रोत थे: मनुष्यों द्वारा किए जाने वाले कार्यों के प्रथम-व्यक्ति परिप्रेक्ष्य (first-person perspective) से वीडियो, जो विविध दृश्य प्रदान करते हैं लेकिन कोई रोबोट क्रिया डेटा नहीं देते, और वास्तविक रोबोटों द्वारा किए गए कार्यों की रिकॉर्डिंग, जो सटीक गति निर्देश प्रदान करती है लेकिन कम प्रकार के दृश्यों को कवर करती है। उन्होंने परीक्षण किया कि क्या केवल रोबोट डेटा, केवल मानव डेटा, या दोनों के मिश्रण पर प्रशिक्षण देना बेहतर है। उन्होंने पाया कि एक ही प्रशिक्षण सत्र में दोनों स्रोतों को मिलाना सबसे शक्तिशाली रणनीति थी। मानव वीडियो ने मॉडल को दुनिया की व्यापक विविधता के बारे में सिखाया, जबकि रोबोट डेटा ने उस ज्ञान को भौतिक वास्तविकता में स्थापित किया। इस संयोजन ने मॉडल को नए, अनदेखे स्थितियों में बहुत बेहतर तरीके से सामान्यीकरण (generalize) करने की अनुमति दी, बजाय इसके कि उसे केवल एक प्रकार के डेटा पर प्रशिक्षित किया जाता।

इन सिद्धांतों का उपयोग करते हुए, टीम ने 50 करोड़ (500 मिलियन) फ्रेम के वीडियो और रोबोट डेटा पर प्रशिक्षित 'OpenWAM-α' बनाया। उन्होंने इस मॉडल का परीक्षण आठ अलग-अलग सिमुलेशन बेंचमार्क और सिंगल आर्म, टू-आर्म और यहाँ तक कि डेक्सट्रस (dexterous) हाथों वाले वास्तविक रोबोटों पर किया। परिणाम सुसंगत और प्रभावशाली थे। सिमुलेशन में, मॉडल ने ब्लॉक रखने से लेकर जटिल वस्तुओं के हेरफेर तक, कार्यों की एक विस्तृत श्रृंखला में शीर्ष स्तर पर प्रदर्शन किया। जब इसे वास्तविक दुनिया में ले जाया गया, तो इसने उच्च प्रदर्शन बनाए रखा, और उन भौतिक रोबोटों पर सफलतापूर्वक कार्य पूरे किए जिन्हें उसने पहले कभी नहीं देखा था। मॉडल ने नए वातावरणों के अनुकूल होने में विशेष शक्ति दिखाई, जो यह सुझाव देती है कि वीडियो-आधारित विश्व ज्ञान और क्रिया-आधारित ग्राउंडिंग का संयोजन एक मजबूत आधार बनाता है।

सबसे महत्वपूर्ण निष्कर्षों में से एक यह था कि यह दृष्टिकोण अन्य लोकप्रिय विधियों की तुलना में कैसा रहा। कुछ सिस्टम भाषा और दृश्य समझ पर बहुत अधिक निर्भर करते हैं लेकिन भविष्य को स्पष्ट रूप से मॉडल नहीं करते, जबकि अन्य शुद्ध रूप से गति के यांत्रिकी (mechanics) पर ध्यान केंद्रित करते हैं। शोधकर्ताओं ने पाया कि उनका वीडियो-आधारित दृष्टिकोण प्रशिक्षण डेटा को फिट करने और परिचित सेटिंग्स में अच्छा प्रदर्शन करने में उत्कृष्ट था, जबकि अन्य विधियाँ कभी-कभी पूरी तरह से नए, अराजक वातावरणों में बेहतर सामान्यीकरण करती थीं। हालाँकि, उन्होंने निष्कर्ष निकाला कि कोई भी दृष्टिकोण अपने आप में पूर्ण नहीं है। भविष्य की प्रगति की कुंजी दोनों की शक्तियों को जोड़ना है: क्रिया को निर्देशित करने के लिए वीडियो जनरेशन के समृद्ध दृश्य और भौतिक पूर्वाग्रहों (priors) का उपयोग करना, जबकि यह सुनिश्चित करना कि सिस्टम को विविध, उच्च-गुणवत्ता वाले डेटा पर प्रशिक्षित किया गया है जो वास्तविक दुनिया की चुनौतियों की पूरी सीमा को कवर करता है।

OpenWAM प्रोजेक्ट केवल एक नया रोबोट नियंत्रक प्रस्तुत नहीं करता है; यह वैज्ञानिक समुदाय के लिए एक पूर्ण टूलकिट प्रदान करता है। बुनियादी ढांचे, प्रशिक्षण डेटा और मूल्यांकन प्रोटोकॉल को जारी करके, शोधकर्ताओं ने विश्व-क्रिया (world-action) मॉडलों के विकास को एक पारदर्शी, पुनरुत्पादक विज्ञान में बदल दिया है। यह अन्य वैज्ञानिकों को विशिष्ट विचारों का परीक्षण करने, घटकों को बदलने और यह समझने की अनुमति देता है कि कुछ डिज़ाइन दूसरे से बेहतर क्यों काम करते हैं। यह कार्य सुझाव देता है कि अधिक सक्षम रोबोटों का मार्ग बड़े, अपारदर्शी सिस्टम बनाने के माध्यम से नहीं है, बल्कि यह समझने के माध्यम से है कि ज्ञान और सीखने के विभिन्न हिस्से एक दूसरे के साथ कैसे परस्पर क्रिया करते हैं। रोबोट के मन को कंपोजेबल (composable) भागों के संग्रह के रूप में मानकर, शोधकर्ताओं ने कृत्रिम बुद्धिमत्ता में व्यवस्थित अन्वेषण के एक नए युग के द्वार खोल दिए हैं, जहाँ प्रत्येक डिज़ाइन विकल्प का परीक्षण, मापन और सुधार किया जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →