Memory Anchors for Continual Robot Learning
यह शोध पत्र "मेमोरी एंकर्स" (Memory Anchors) को प्रस्तुत करता है, जो परस्पर विरोधी कार्य निरूपणों (conflicting task representations) द्वारा पहचाने गए पिछले अनुभवों का एक रणनीतिक उपसमुच्चय है, जो जब रिप्ले बफ़र्स में प्राथमिकता प्राप्त करते हैं, तो कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) को महत्वपूर्ण रूप से कम करते हैं और रोबोटों के लिए प्रभावी निरंतर शिक्षण (continual learning) को सक्षम करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक रोबोटिक हाथ कार्यों की एक श्रृंखला को एक के बाद एक सीखना सीख रहा है। वास्तविक दुनिया में, ये कार्य शायद ही कभी अलग-थलग होते हैं; वे अक्सर बहुत समान दिखते हैं लेकिन उनके लिए अलग, कभी-कभी विपरीत गतिविधियों की आवश्यकता होती है। एक रोबोट को जार खोलने के लिए उसे घड़ी की दिशा में (क्लॉकवाइज) घुमाने की आवश्यकता हो सकती है, और फिर बाद में उसे एक अलग जार खोलने के लिए उसे घड़ी की विपरीत दिशा में (काउंटर-क्लॉकवाइज) घुमाने के लिए सीखना पड़ सकता है। चुनौती आर्टिफिशियल इंटेलिजेंस के लिए यह है कि जब वह नया कौशल सीखता है, तो वह अक्सर पुराने के स्मृति को मिटा देता है, जिसे वैज्ञानिक 'कैटास्ट्रोफिक फॉरगेटिंग' (विनाशकारी विस्मृति) कहते हैं। इसे रोकने के लिए, शोधकर्ता आमतौर पर 'एक्सपीरियंस रिप्ले' नामक एक विधि का उपयोग करते हैं, जहाँ रोबोट पुराने और नए डेटा के मिश्रण पर अभ्यास करता है, ठीक वैसे ही जैसे एक छात्र नए परीक्षा के अध्ययन के दौरान अपने पुराने नोट्स को दोहराता है। वर्षों से, मानक दृष्टिकोण यह रहा है कि इन पुराने नोट्स को यादृच्छिक (रैंडम) रूप से चुना जाता है, यह मानते हुए कि अतीत का कोई भी नमूना समान रूप से सहायक होता है।
हालाँकि, स्टैनफोर्ड यूनिवर्सिटी और टोयोटा रिसर्च इंस्टीट्यूट के शोधकर्ताओं के एक नए अध्ययन से पता चलता है कि सभी स्मृतियाँ समान नहीं होती हैं। उन्होंने पाया कि रोबोट के अनुभवों के विशाल इतिहास के भीतर, डेटा का एक छोटा, महत्वपूर्ण उपसमुच्चय (सबसेट) मौजूद है जो एक महत्वपूर्ण लंगर (एंकर) के रूप में कार्य करता है, जो पिछले कार्यों के ज्ञान को थामे रखता है। शोधकर्ता इन विशिष्ट स्मक्तियों को "मेमोरी एंकर्स" (स्मृति लंगर) कहते हैं। उनका कार्य दिखाता है कि यदि रोबोट के प्रशिक्षण डेटा में इन एंकर्स का एक छोटा सा हिस्सा भी छूट जाता है, तो रोबोट अपने पुराने कौशल को बहुत तेज़ी से भूल जाता है। इसके विपरीत, यदि प्रशिक्षण डेटा को विशेष रूप से इन स्मृतियों के साथ समृद्ध किया जाता है, तो रोबोट पुराने कार्यों को खोए बिना नए, परस्पर विरोधी कार्यों को सीख सकता है। यह खोज ध्यान को केवल अधिक डेटा एकत्र करने से हटाकर, रोबोट की बढ़ती बुद्धिमत्ता की रक्षा करने के लिए अतीत के सबसे महत्वपूर्ण क्षणों को सावधानीपूर्वक चुनने पर केंद्रित करती है।
शोधकर्ताओं ने यह देखते हुए शुरुआत की कि भले ही रोबोट 'एक्सपीरियंस रिप्ले' का उपयोग करते हैं, फिर भी उनका प्रदर्शन इस बात के प्रति आश्चर्यजनक रूप से संवेदनशील है कि वे पुराने डेटा को वास्तव में कैसे चुनते हैं। अपने प्रयोगों में, उन्होंने पाया कि पुराने डेटा के कुछ यादृच्छिक चयनों ने रोबोट को अपने कौशल को पूरी तरह से बनाए रखने की अनुमति दी, जबकि अन्य यादृच्छिक चयनों ने उन्हीं कौशलों को लगभग पूरी तरह से भुला दिया। यह विसंगति एक छिपे हुए पैटर्न की ओर इशारा करती है: कुछ कार्य अनुक्रमिक रूप से सीखने के लिए बहुत कठिन थे क्योंकि वे पिछले कार्यों के साथ दृश्य समानता साझा करते थे लेकिन एक पूरी तरह से अलग शारीरिक क्रिया की मांग करते थे। उदाहरण के लिए, एक रोबकर देख सकता है कि एक कटोरा और एक जार दिखने में समान हैं, लेकिन एक को उठाने की आवश्यकता है और दूसरे को घुमाने की। जब रोबोट नया कार्य सीखता है, तो वस्तु की उपस्थिति के बारे में उसकी आंतरिक समझ पिछले कार्य की समान श्रेणी में ढह सकती है, जिससे किस क्रिया को करना है, इस बारे में भ्रम पैदा होता है।
इसे हल करने के लिए, टीम ने इन महत्वपूर्ण क्षणों की पहचान करने और उन्हें अलग करने के लिए एक विधि विकसित की। उन्होंने उस नए कार्य के विशिष्ट बिंदुओं को देखा जहाँ रोबोट की वर्तमान समझ उसके पहले सीखी गई बातों के साथ सबसे हिंसक रूप से टकराती थी। उन्होंने उन क्षणों को खोजा जहाँ रोबोट की आँखें कुछ परिचित देखती थीं, लेकिन उसका मस्तिष्क जानता था कि उसे कुछ अलग करना है। इन संघर्ष के क्षणों से, उन्होंने रोबोट के अतीत में झाँका और उन विशिष्ट पुराने अनुभवों को निकाला जो भ्रमित करने वाली नई स्थिति के सबसे समान दिखते थे। ये प्राप्त की गई स्मृतियाँ "मेमोरी एंकर्स" हैं। वे एक संदर्भ बिंदु के रूप में कार्य करती हैं, रोबोट को याद दिलाती हैं कि हालांकि वस्तु वैसी ही दिखती है, लेकिन आवश्यक क्रिया अलग है, जिससे प्रभावी रूप से नए सीखने से पुराने को मिटने से रोका जा सके।
टीम ने इस विचार का परीक्षण इन एंकर्स को रोबोट के प्रशिक्षण डेटा से जानबूझकर हटाकर किया। परिणाम स्पष्ट थे: जब उन्होंने सर्वश्रेष्ठ एंकर्स के केवल दस प्रतिशत को बाहर कर दिया, तो रोबोट द्वारा पिछले कार्यों को भूलने की दर चार गुना से अधिक बढ़ गई। इसने सिद्ध किया कि स्मृतियों का एक बहुत छोटा समूह ही उसके इतिहास को संरक्षित करने के लिए भारी काम कर रहा था। दूसरे परीक्षण सेट में, उन्होंने इसके विपरीत किया: उन्होंने एक मानक प्रशिक्षण बफर लिया और उसे अतिरिक्त मेमोरी एंकर्स से भर दिया। इस सरल समायोजन ने कठिन, परस्पर विरोधी कार्यों को भूलने की दर को साठ प्रतिशत कम कर दिया। रोबमा सफलतापूर्वक तीसरे कार्य में महारत हासिल करने के बाद भी पहले कार्य को करने की अपनी क्षमता बनाए रखते हुए, कार्यों की एक श्रृंखला को सीखने में सक्षम रहा।
यह सुनिश्चित करने के लिए कि यह केवल एक सिमुलेशन नहीं था, शोधकर्ताओं ने अपने तरीके को एक प्रयोगशाला में वास्तविक रोबोटिक हाथ तक पहुँचाया। उन्होंने समान दिखने वाले जार वाले कार्यों की एक श्रृंखला स्थापित की जिनमें अलग-अलग खोलने की रणनीतियाँ शामिल थीं: एक को घड़ी की विपरीत दिशा में घुमाना था, दूसरा घड़ी की दिशा में, और तीसरा सीधा उठाना था। बिना उनके विशेष तरीके के, रोबोट पहला कार्य सीखता, फिर दूसरे को सीखते समय उसे पूरी तरह से भूल जाता, या पहले को बिगाड़ने के डर से दूसरा सीखने में विफल हो जाता। जब उन्होंने 'मेमोरी एंकर' रणनीति लागू की, तो रोबोट ने सफलतापूर्वक तीनों कार्यों को क्रमवार सीखा। इसने एक ऐसा सफलता दर प्राप्त किया जो एक ऐसे रोबोट की तुलना में 1.7 गुना अधिक था जिसे पुराने डेटा के मानक, यादृच्छिक मिश्रण के साथ प्रशिक्षित किया गया था। रोबोट ने जारों के बीच सूक्ष्म अंतर को पहचानना और प्रत्येक के लिए सही गति को निष्पादित करना सीखा, जिससे साबित हुआ कि एंकर्स ने उसे पुराने को याद रखने के साथ-साथ नए को सीखने के बीच संतुलन बनाने में मदद की।
इस अध्ययन ने यह भी पता लगाया कि यह विभिन्न प्रकार के रोबोटिक मस्तिष्क के साथ कैसे काम करता है, जिसमें बड़े, पूर्व-प्रशिक्षित मॉडल भी शामिल हैं जो पहले से ही काफी स्मार्ट हैं। यहाँ तक कि इन उन्नत प्रणालियों के लिए भी, जो सामान्य रूप से बेहतर याद रखने में सक्षम हैं, प्रशिक्षण डेटा सीमित होने पर मेमोरी एंकर्स की उपस्थिति ने महत्वपूर्ण अंतर पैदा किया। शोधकर्ताओं ने पाया कि ये मॉडल भी तब भूलने से ग्रस्त थे जब महत्वपूर्ण एंकर्स गायब थे, और एंकर्स जोड़ने पर उनमें सुधार हुआ। यह सुझाव देता है कि यह सिद्धांत मशीनों के अनुभव से सीखने के तरीके के लिए मौलिक है, चाहे सॉफ्टवेयर की जटिलता कुछ भी हो। मुख्य बात केवल डेटा होना नहीं है, बल्कि सही समय पर सही डेटा होना है ताकि नए सीखने के अराजक माहौल के खिलाफ एक स्टेबलाइजर के रूप में कार्य किया जा सके।
यह शोध इस बारे में सोचने का एक नया तरीका प्रदान करता है कि मशीनें अपने अतीत को खोए बिना समय के साथ कैसे स्मार्ट बन सकती हैं। यह सुझाव देता है कि जंगल में निरंतर सीखने में सक्षम रोबोट का मार्ग केवल उसे अधिक जानकारी खिलाने के बारे में नहीं है, बल्कि उसे उन विशिष्ट क्षणों को पहचानने और महत्व देने के बारे में है जहाँ उसका अतीत और वर्तमान टकराते हैं। इन मेमोरी एंकर्स की पहचान करके, इंजीनियर ऐसी प्रणालियाँ बना सकते हैं जो अधिक मजबूत हों, और भौतिक दुनिया की अव्यवस्थित, ओवरलैपिंग वास्तविकता को संभालने में सक्षम हों। यह कार्य इस क्षेत्र को आगे बढ़ाता है कि निरंतर सीखने की यात्रा में, स्मृति की मात्रा से कहीं अधिक उसकी गुणवत्ता मायने रखती है, और अतीत के कुछ अच्छी तरह से चुने गए क्षण रोबोट की बुद्धिमत्ता के भविष्य को सुरक्षित कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।