Sandwich-Residuals: Parameter-Efficient Test-time Adaptation of World Models
यह शोध पत्र 'सैंडविच-रेसिडुअल्स' (Sandwich-Residuals) को प्रस्तुत करता है, जो लेटेंट वर्ल्ड मॉडल्स के लिए एक पैरामीटर-कुशल टेस्ट-टाइम एडेप्टेशन विधि है जो प्रीट्रेंड वेट्स को फ्रीज करती है और केवल छोटे रेसिडुअल करेक्शन्स को सेल्फ-सुपरवाइज्ड प्रेडिक्शन एरर्स का उपयोग करके ऑनलाइन सीखती है, जिससे वितरण बदलावों (distribution shifts) के तहत सफलता दर में उल्लेखनीय सुधार होता है और मौजूदा दृष्टिकोणों की तुलना में 97-99% कम पैरामीटर्स को एडेप्ट किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
ऐसे रोबोट जो अपनी गतिविधियों की योजना स्वयं बना सकते हैं, अक्सर दुनिया कैसे काम करती है, इसके एक आंतरिक मानचित्र (internal map) पर निर्भर करते हैं। कल्पना कीजिए कि एक रोबोटिक हाथ मेज पर एक ब्लॉक को धकेलने की कोशिश कर रहा है। केवल वर्तमान में जो वह देखता है उस पर प्रतिक्रिया करने के बजाय, एक स्मार्ट रोबोट एक मानसिक मॉडल बनाता है जो यह भविष्यवाणी करता है कि यदि वह अपने हाथ को एक निश्चित तरीके से घुमाता है तो क्या होगा। वह यह सीखना जाता है कि, "यदि मैं यहाँ धकेलता हूँ, तो ब्लॉक वहाँ फिसलेगा।" यह मानसिक मॉडल, जिसे अक्सर 'वर्ल्ड मॉडल' कहा जाता है, रोबोट को वास्तव में हिलने से पहले अपने मन में भविष्य की क्रियाओं का अनुकरण (simulate) करने की अनुमति देता है, जिससे उसे गलतियाँ करने से बचने और अपने लक्ष्यों तक कुशलतापूर्वक पहुँचने में मदद मिलती है। इन मॉडलों को आमतौर पर एक नियंत्रित वातावरण में प्रशिक्षित किया जाता है, जैसे कि कंप्यूटर सिमुलेशन में, जहाँ प्रकाश एकदम सही होता है और भौतिकी (physics) सुसंगत होती है। हालाँकि, वास्तविक दुनिया अव्यवस्थित होती है। जब सिमुलेशन में प्रशिक्षित एक रोबोट को एक नए कमरे में रखा जाता है जहाँ रोशनी अलग है, या जब मेज की सतह फिसलन भरी हो जाती है, तो रोबोट का आंतरिक मानचित्र गलत हो सकता है। इसके द्वारा की गई भविष्यवाणियाँ वास्तविकता से मेल नहीं खातीं, और रोबोट अपना कार्य पूरा करने में विफल रहता है। वर्षों से, इस समस्या का मानक समाधान रोबोट के मस्तिष्क के कुछ हिस्सों को उसके काम करते समय फिर से प्रशिक्षित करना रहा है, जो नई स्थितियों के अनुकूल होने के लिए लाखों आंतरिक सेटिंग्स को बदल देता है। यह प्रक्रिया भारी, धीमी है, और इसके लिए रोबोट को चीजों के हिलने-डुलने के अपने समझ को लगातार फिर से लिखने की आवश्यकता होती है।
शोधकर्ताओं की एक टीम ने इस समस्या को ठीक करने का एक बहुत हल्का तरीका खोजा है। रोबोट को उसके पूरे आंतरिक मानचित्र को फिर से लिखने के लिए कहने के बजाय, उन्होंने पाया कि केवल उन किनारों (edges) को समायोजित करना पर्याप्त है जहाँ रोबोट अपने इनपुट पढ़ता है और अपने आउटपुट लिखता है। एक नए अध्ययन में, शोधकर्ताओं ने एक विधि पेश की जिसे वे "सैंडविच-रेसिडुअल्स" (Sandwich-Residuals) कहते हैं। उन्होंने एक ऐसे रोबोट को लिया जिसने पहले से ही सिमुलेशन में चलना सीख लिया था और उसके आंतरिक मस्तिष्क को पूरी तरह से फ्रीज (freeze) कर दिया, जिससे उसकी लाखों सीखी हुई सेटिंग्स में से किसी को भी बदलने से रोका जा सके। फिर, उन्होंने सॉफ्टवेयर की दो बहुत छोटी, लचीली परतें जोड़ीं: एक जो रोबोट के मस्तिष्क में आने वाली जानकारी को ट्यून करती है, और दूसरी जो रोबोट से निकलने वाली भविष्यवाणियों को ट्यून करती है। ये छोटी परतें सैंडविच की फिलिंग की तरह काम करती हैं, जो जमे हुए कोर के चारों ओर लिपटी होती हैं। जैसे ही रोबोट हिलने की कोशिश करता है और गलतियाँ करता है, ये छोटी परतें बिना अंदर के भारी, पूर्व-प्रशिक्षित मस्तिष्क को छुए, चलते-चलते त्रुटियों को सुधारना सीख जाती हैं। रोबोट यह कहना सीख जाता है, "मेरा मस्तिष्क सोचता है कि ब्लॉक यहाँ जाएगा, लेकिन मेरी नई सुधार परत जानती है कि फर्श फिसलन भरा है, इसलिए मैं अपने प्लान को बदलकर उसे वहाँ भेजने के लिए समायोजित कर दूँगा।"
शोधकर्ताओं ने इस विचार का परीक्षण विभिन्न चुनौतीपूर्ण कार्यों पर किया, जिसमें भूलभुलैया (mazes) में रास्ता खोजना और विभिन्न आकारों की वस्तुओं को धकेलना शामिल था। उन्होंने अपने तरीके की तुलना मानक दृष्टिकोण से की, जिसमें रोबोट के आंतरिक मस्तिष्क को अपडेट करना शामिल है, और एक ऐसे रोबोट से भी जिसकी कोई समायोजन नहीं की गई थी। इक्कीस अलग-अलग परीक्षण परिदृश्यों में, "सैंडविच" विधि का उपयोग करने वाला रोबोट 65 प्रतिशत बार लक्ष्य तक पहुँचने में सफल रहा। यह अन-एडजस्टेड रोबोट की तुलना में एक महत्वपूर्ण सुधार था, जो केवल 49 प्रतिशत बार सफल हुआ। अधिक महत्वपूर्ण बात यह है कि नया तरीका मानक दृष्टिकोण के लगभग बराबर प्रदर्शन करता है जो रोबोट के मस्तिष्क को फिर से लिखता है, जो लगभग 68 प्रतिशत बार सफल हुआ था। मुख्य अंतर दक्षता (efficiency) में निहित है। मानक पद्धति को नई स्थितियों के अनुकूल होने के लिए लगभग दस मिलियन सेटिंग्स को अपडेट करना पड़ा। इसके विपरीत, नए तरीके को केवल लगभग एक लाख सेटिंग्स को समायोजित करने की आवश्यकता थी। इसका अर्थ है कि नया दृष्टिकोण पुराने तरीके की तुलना में आवश्यक गणनात्मक प्रयास (computational effort) के तीन प्रतिशत से भी कम का उपयोग करके अनुकूलित होता है, फिर भी यह सफलता के लगभग समान स्तर प्राप्त करता है।
अध्ययन ने इस पर भी गौर किया कि क्या होता है जब रोबोट को एक साथ कई समस्याओं का सामना करना पड़ता है, जैसे कि प्रकाश में बदलाव के साथ-साथ वस्तुओं के वजन में बदलाव। इन कठिन "कंपाउंड" (compound) स्थितियों में, नया तरीका और भी प्रभावशाली था। यह अन-एडजस्टेड रोबोट की तुलना में 1.9 गुना अधिक बार सफल हुआ, जबकि भारी, मस्तिष्क-अपडेट करने वाली पद्धति के समान प्रभावी बना रहा। शोधकर्ताओं ने पाया कि सुधार के प्रकार का प्रकार विशिष्ट समस्या पर निर्भर करता था। जब रोबोट भूलभुलैया में घूम रहा था और गति की भौतिकी बदल गई, तो वह परत जिसने उसके द्वारा किए गए अनुमानों को सुधारा, उसने अधिकांश काम किया। जब रोबोट वस्तुओं को धकेल रहा था और कंट्रोलर अधिक संवेदनशील हो गया, तो इनपुट कमांड को समायोजित करने वाली परत अधिक महत्वपूर्ण थी। दोनों परतों को रखने से, सिस्टम विविध प्रकार के अप्रत्याशित परिवर्तनों को बिना यह जाने कि किस तरह की समस्या का सामना करना पड़ेगा, संभालने में सक्षम था।
यह सिद्ध करने के लिए कि यह विचार सरल भूलभुलैया वाले खेलों से परे भी काम करता है, शोधकर्ताओं ने इसे त्रि-आयामी (3D) स्थान में एक क्यूब को हिलाने वाले वास्तविक दुनिया के स्टाइल के रोबोटिक आर्म से जुड़े एक अधिक जटिल कार्य पर भी लागू किया। इस कार्य के लिए उन्होंने एक अलग प्रकार के रोबोट मस्तिष्क का उपयोग किया, जो पिछले डिज़ाइन के बजाय दृश्य पैटर्न (visual patterns) पर निर्भर करता है। इस अलग आर्किटेक्चर के बावजूद, वही "सैंडविच" सिद्धांत काम आया। रोबोट प्रकाश व्यवस्था, कैमरा एंगल और अपने स्वयं के मोटरों की शक्ति में बदलाव के अनुकूल होने में सक्षम था। प्रत्येक परीक्षण मामले में जहाँ स्थितियाँ बदलीं, नए तरीके ने कुछ न करने की तुलना में रोबोट के प्रदर्शन में सुधार किया, जबकि अन्य तरीकों ने कभी-कभी रोबोट के प्रदर्शन को खराब भी कर दिया। यह सुझाव देता है कि अनुकूलन करने की क्षमता के लिए हमेशा यह आवश्यक नहीं है कि रोबमाट दुनिया को समझने के अपने तरीके को मौलिक रूप से बदले। कभी-कभी, केवल एक छोटा, लचीला फिल्टर जोड़ना ही काफी होता है जो रोबोट को अपनी वर्तमान स्थिति को सही ढंग से समझने में मदद करे।
ये निष्कर्ष सुझाव देते हैं कि हम भविष्य में रोबोटों को कैसे बना सकते हैं। लंबे समय तक, यह धारणा रही है कि यदि रोबोट का वातावरण बदलता है, तो भौतिकी के उसके आंतरिक मॉडल को मेल खाने के लिए फिर से लिखना आवश्यक है। यह शोध पत्र दिखाता है कि यह धारणा हमेशा आवश्यक नहीं है। यदि दुनिया के बारे में रोबोट की मूल समझ अभी भी काफी हद तक सही है, तो वह बस अपनी वास्तविक स्थिति में फिट होने के लिए अपने इनपुट और आउटपुट को समायोजित करना सीख सकता है। यह दृष्टिकोण न केवल तेज़ और सस्ता है; यह अधिक स्थिर भी है, क्योंकि यह इस जोखिम से बचाता है कि रोबोट कुछ नया सीखने के प्रयास में वह सब भूल जाए जो वह पहले से जानता है। हालाँकि प्रयोग कंप्यूटर सिमुलेशन में किए गए थे, परिणाम एक ऐसे भविष्य की ओर संकेत करते हैं जहाँ रोबोट नए वातावरण में प्रवेश कर सकते हैं और तुरंत काम शुरू कर सकते हैं, वास्तविक दुनिया के आश्चर्यों को संभालने के लिए छोटे, कुशल समायोजनों का उपयोग कर सकते हैं, बिना अपनी बुद्धिमत्ता के बड़े बदलाव की आवश्यकता के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।