← नवीनतम पेपर
💻 computer science

Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation

Zeva एक नवीन ढांचा (framework) है जो रोबोट के भौतिक अनुभवों से कारण संबंधी अंतःक्रियाओं (causal interactions) को एक द्वि-समय-पैमाने वाली स्मृति (dual-timescale memory) में निकालकर सामान्यीकृत एम्बोडीड मैनिपुलेशन (generalizable embodied manipulation) को सक्षम बनाता है, जिससे एक फ्रोजन पॉलिसी मॉडल बिना ग्रेडिएंट अपडेट की आवश्यकता के, इन-कॉन्टेक्स्ट लर्निंग के माध्यम से विभिन्न कार्यों में अपने प्रदर्शन को विकसित और बेहतर बनाने में सक्षम होता है।

मूल लेखक: Fu Chen, Xin Ding, Bingjia Huang, Xiangyu Li, Mingju Wang, Jiawei He, Kun Li, Wei Sun, Yunxin Liu, Hao Wu, Ting Cao

प्रकाशित 2026-09-01
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fu Chen, Xin Ding, Bingjia Huang, Xiangyu Li, Mingju Wang, Jiawei He, Kun Li, Wei Sun, Yunxin Liu, Hao Wu, Ting Cao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट लंबे समय से कारखानों के उस्ताद रहे हैं, जहाँ वे एक ही गति को पूर्ण सटीकता के साथ हजारों बार दोहराते हैं। लेकिन यदि उन्हें उस नियंत्रित वातावरण से बाहर निकालकर एक वास्तविक रसोई या प्रयोगशाला में लाया जाए, तो वे अक्सर लड़खड़ा जाते हैं। भौतिक दुनिया अव्यवस्थित है; वस्तुएं खिसकती हैं, सतह असमान होती है, और एक ग्रिपर जिस तरह से पानी के गिलास को महसूस करता है, वह धातु के कप को महसूस करने से अलग होता है। वर्षों से, रोबोटों को सिखाने का प्रमुख तरीका उन्हें लैब से बाहर निकलने से पहले वीडियो और डेटा की विशाल मात्रा खिलाना रहा है, इस उम्मीद में कि वे किसी भी चीज़ को संभालने के लिए पर्याप्त सामान्य नियम सीख लेंगे। फिर भी, जब ये रोबोट ऐसी स्थिति का सामना करते हैं जो उन्होंने पहले कभी नहीं देखी होती, तो वे अक्सर विफल हो जाते हैं क्योंकि उनका आंतरिक "मस्तिष्क" उस क्षण की नई भौतिकी (physics) के अनुकूल नहीं हो पाता। वे उन्हें दिए गए ज्ञान के साथ ही बंधे रह जाते हैं, और अपनी गलतियों से होते हुए सीखने में असमर्थ होते हैं।

त्सिंहहुआ विश्वविद्यालय और Z-Trans AI के शोधकर्ताओं की एक टीम ने एक अलग रास्ता प्रस्तावित किया है, जहाँ एक रोबोट वास्तविक समय में कारण और प्रभाव (cause and effect) के बारे में सोचना सीखता है। उन्होंने ज़ेवा (Zeva) नामक एक प्रणाली पेश की है, जो एक रोबोट को उसके अंतर्निहित सॉफ़्टवेयर कोड को बदले बिना अपने प्रदर्शन में सुधार करने की अनुमति देती है। रोबोट के मस्तिष्क को फिर से प्रशिक्षित करने के बजाय, जो कि धीमा और जोखिम भरा है, ज़ेवा एक अत्यधिक व्यवस्थित नोटबुक की तरह कार्य करता है। जैसे ही रोबोट किसी कार्य को करने का प्रयास करता है, यह रिकॉर्ड करता है कि उसके हिलने-डुलने पर वास्तव में क्या हुआ: उसने एक विशिष्ट वस्तु देखी, उसने अपना हाथ एक निश्चित तरीके से हिलाया, और वस्तु या तो अपनी जगह पर रही या पलट गई। सिस्टम उस एकल अंतःक्रिया से सबक निकालता है—कार्य और परिणाम के बीच का कारणत्मक संबंध—और उसे संग्रहीत करता है। जब रोबोट उसी कार्य को दोबारा करने की कोशिश करता है, तो वह इस नोटबुक को देखता है, प्रासंगिक सबक ढूंढता है, और अपने अगले कदम को समायोजित करने के लिए उसका उपयोग करता है। यह तुरंत होता है, जिससे रोबोट हर एक प्रयास के साथ बेहतर होता जाता है, भले ही उसका मुख्य प्रोग्रामिंग स्थिर और अपरिवर्तित रहे।

शोधकर्ताओं ने इस विचार का परीक्षण दो बहुत ही अलग दुनियाओं में किया। पहले, उन्होंने रसोई का एक परिष्कृत कंप्यूटर सिमुलेशन उपयोग किया, जो केतली, टोस्टर और मिक्सर जैसी जटिल वस्तुओं से भरी जगह है। इस आभासी वातावरण में, ज़ेवा को पांच अलग-अलग कार्यों का सामना करना पड़ा, जैसे माइक्रोवेव चालू करना या मिक्सर हेड खोलना। परिणाम आश्चर्यजनक थे। जबकि अन्य उन्नत रोबोट प्रणालियाँ लगभग 60 से 72 प्रतिशत बार सफल होती थीं, ज़ेवा ने 76.8 प्रतिशत की सफलता दर हासिल की। इससे भी महत्वपूर्ण बात यह है कि इस प्रणाली ने आत्म-सुधार का एक स्पष्ट पैटर्न दिखाया। किसी कार्य के अपने पहले प्रयास में, रोबोट केवल एक चौथाई समय ही सफल होता था। लेकिन जैसे-जैसे उसे एक ही परिदृश्य को बार-बार करने की अनुमति दी गई, अपने विफलताओं से मिले सबक का उपयोग करके अपने अगले कदमों को निर्देशित किया गया, उसकी सफलता दर लगातार बढ़ती गई। चौथे प्रयास तक, वह 73 प्रतिशत मामलों में सफल हो रहा था। इसने यह सिद्ध कर दिया कि रोबोट केवल भाग्यशाली नहीं हो रहा था; वह वास्तव में अपने कार्यों के भौतिक फीडबैक से सीख रहा था।

यह सुनिश्चित करने के लिए कि यह केवल कंप्यूटर सिमुलेशन का परिणाम नहीं है, टीम ने इस प्रणाली को एक वास्तविक रासायनिक प्रयोगशाला में ले लिया। उन्होंने एक भौतिक रोबोटिक आर्म को नाजुक कांच के बर्तनों, जैसे टेस्ट ट्यूब और बीकर को संभालने और पानी डालने या रसायन तौलने जैसे कार्य करने की क्षमता से लैस किया। यह वातावरण वास्तविक गुरुत्वाकर्षण, घर्षण और कांच टूटने के जोखिम के साथ, सिमुलेशन की तुलना में कहीं अधिक अप्रत्याशित था। यहाँ, ज़ेवा ने फिर से मौजूदा सर्वोत्तम प्रणालियों को पछाड़ दिया। सरल कार्यों में, जैसे टेस्ट ट्यूब उठाना, यह 100 प्रतिशत बार सफल रहा। अधिक जटिल अनुक्रमों में, जैसे नमक का घोल तैयार करना, इसने 70 प्रतिशत की सफलता दर प्राप्त की, जो इसके प्रतिस्पर्धियों से काफी अधिक है। शोधकर्ताओं ने न केवल यह मापा कि रोबोट ने काम पूरा किया या नहीं, बल्कि यह भी मापा कि उसने प्रक्रिया का कितना हिस्सा पूरा किया। यहाँ तक कि जब कार्य कठिन था, ज़ेya ने अन्य किसी भी प्रणाली की तुलना में आवश्यक चरणों में से अधिक चरणों को पूरा किया, जो दर्शाता है कि अंतःक्रिया से सीखने की उसकी क्षमता ने उसे भौतिक दुनिया की अव्यवस्था के बीच रास्ता खोजने में मदद की।

ज़ेवा की सफलता का एक प्रमुख हिस्सा यह है कि वह अपनी स्मृति को कैसे व्यवस्थित करता है। सिस्टम केवल उन सभी चीजों की लंबी सूची संग्रहीत नहीं करता है जो उसने कभी की हैं; वह बहुत अधिक प्रसंस्करण (process) का विषय होगा। इसके बजाय, यह दो प्रकार की स्मृतियों का उपयोग करता है जो एक साथ काम करती हैं। एक अल्पकालिक 'ट्रेस' (trace) है जो पिछले कुछ सेकंड की क्रिया को याद रखता है, जिससे रोबोट को यह समझने में मदद मिलती है कि अभी क्या हो रहा है। दूसरा एक स्थायी स्मृति (persistent memory) है जो पिछले प्रयासों से सबसे उपयोगी सबक रखता है, भले ही वे प्रयास विफल रहे हों। जब रोबोट एक नया प्रयास शुरू करता है, तो वह इस स्थायी स्मृति में एक ऐसी स्थिति खोजता है जो वर्तमान में उसके सामने आ रही स्थिति के समान दिखती है। फिर वह उस पिछले अनुभव को एक मार्गदर्शक के रूप में उपयोग करता है। उदाहरण के लिए, यदि रोबोट ने पहले पानी डालने की कोशिश की थी और कांच बहुत तेजी से झुकने के कारण पलट गया था, तो वह उस विशिष्ट कारण-प्रभाव संबंध को याद रखता है। अगले प्रयास में, वह इस स्मृति का परामर्श लेता है और अपने झुकाव को धीमा कर देता है, जिससे वही गलती होने से बच जाती है। यह प्रक्रिया रोबोट के मुख्य सॉफ़्टवेयर में बिना किसी बदलाव के होती है, जिसका अर्थ है कि रोबोट अपने पूरे मस्तिष्क को फिर से प्रशिक्षित करने की धीमी और खतरनाक प्रक्रिया के बिना तुरंत सीख और अनुकूलित हो सकता है।

शोधकर्ताओं ने यह भी पाया कि यह प्रणाली केवल अपनी गलतियों से ही नहीं, बल्कि मनुष्यों से भी सीख सकती है। एक प्रयोग में, एक मानव ने एक जटिल कार्य के एक सफल प्रयास के माध्यम से रोबोटिक आर्म को शारीरिक रूप से निर्देशित किया। सिस्टम ने उस मानव प्रदर्शन को रिकॉर्ड किया, उससे कारणत्मक सबक निकाले और उन्हें अपनी स्मृति में संग्रहीत किया। जब रोबोट ने फिर अपने आप कार्य करने की कोशिश की, तो उसने उस एकल मानव उदाहरण का उपयोग सीखने को गति देने के लिए किया। इस "वार्म-अप" ने रोबमान को शुरुआत से ही बहुत बेहतर प्रदर्शन करने में मदद की, जिससे इसकी सफलता दर शून्य से शुरू करने की तुलना में 15 प्रतिशत तक बढ़ गई। यह सुझाव देता है कि एक रोबोट एक एकल मानव प्रदर्शन से नया कौशल सीख सकता है और फिर अपने बार-बार किए जाने वाले अभ्यास के माध्यम से उस कौशल को परिष्कृत कर सकता है, जिससे मानव मार्गदर्शन के सर्वश्रेष्ठ गुणों और स्व-विकास की शक्ति का मेल होता है।

अध्ययन ने यह भी देखा कि क्या एक कार्य में रोबोट द्वारा सीखे गए सबक उसे पूरी तरह से अलग कार्य में मदद कर सकते हैं। उन्होंने पाया कि सिस्टम यह पहचान सकता है कि एक नए कार्य में भौतिक प्रभाव पिछले देखे गए प्रभाव के समान है या नहीं। उदाहरण के लिए, पानी डालने के लिए कंटेनर को झुकाने की गति को रसायन मिलाने के लिए कंटेनर को झुकाने की गति के समान पहचाना गया, भले ही वस्तुएं और लक्ष्य अलग हों। कार्यों के बीच ज्ञान को स्थानांतरित करने की यह क्षमता का अर्थ है कि रोबोट को हर बार नई चुनौती का सामना करने पर शून्य से शुरू करने की आवश्यकता नहीं है। वह भौतिक कारण-प्रभाव संबंधों के अपने पुस्तकालय का उपयोग कर सकता है जिसे उसने समय के साथ बनाया है, जिससे वह अधिक बहुमुखी और विभिन्न स्थितियों में सक्षम बनता है।

इन सफलताओं के बावजूद, शोधकर्ता अपने कार्य की सीमाओं के बारे में स्पष्ट हैं। सिस्टम वर्तमान में केवल उन्हीं प्रयासों से सीखता है जो वह एक विशिष्ट कार्य को पूरा करने के प्रयास में करता है। इसमें अभी तक दुनिया के बारे में नई चीजें सीखने के लिए इधर-उधर घूमने की क्षमता नहीं है, जिसे 'सक्रिय अन्वेषण' (active exploration) कहा जाता है। लेखकों का सुझाव है कि भविष्य का कार्य रोबोट को अपने स्वयं के प्रयोग चुनने के लिए सिखाने पर केंद्रित होगा, जो भौतिक दुनिया के बारे में अनिश्चितता को कम करने के लिए जानबूझकर विभिन्न कार्यों को आज़माएगा। तब तक, ज़ेवा एक महत्वपूर्ण प्रगति का प्रतिनिधित्व करता है, जो यह दिखाता है कि एक रोबोट को स्मार्ट होने के लिए फिर से प्रशिक्षित करने की आवश्यकता नहीं है। अपने कार्यों के परिणामों पर ध्यान देकर और यह याद रखकर कि क्या काम आया और क्या नहीं, एक रोबोट अपनी क्षमताओं को विकसित कर सकता है, जिससे हर विफलता को अगले प्रयास के लिए एक सबक में बदला जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →