Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control
यह शोध पत्र WA-LQR नामक एक प्रशिक्षण-मुक्त स्टीयरिंग पद्धति प्रस्तावित करता है जो उनके सक्रियण स्थानों (activation spaces) में निम्न-आयामी रैखिक पृथक्करणीयता (low-dimensional linear separability) का लाभ उठाकर वर्ल्ड एक्शन मॉडल्स की वितरण बदलावों (distribution shifts) के विरुद्ध सुदृढ़ता बढ़ाने के लिए यांत्रिक व्याख्यात्मकता (mechanistic interpretability) और इष्टतम नियंत्रण (optimal control) का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को रात का खाना बनाना सिखा रहे हैं। आप नहीं चाहते कि वह केवल एक रेसिपी के चरणों का पालन करे; आप चाहते हैं कि वह रसोई को समझे। आप चाहते हैं कि उसे पता हो कि यदि चूल्हा गर्म होता है, तो पानी उबलने लगता है, और यदि आप एक चम्मच गिराते हैं, तो वह खनक उठता है। यह "वर्ल्ड एक्शन मॉडल्स" (WAMs) का सपना है। ये उन्नत एआई मस्तिष्क हैं जो केवल यह तय नहीं करते कि आगे क्या करना है; वे भविष्य का अनुकरण करते हैं, यह भविष्यवाणी करते हैं कि उनके कार्यों के आधार पर दुनिया कैसे बदलेगी, ठीक वैसे ही जैसे रोबोट के सिर के अंदर एक वीडियो गेम इंजन चल रहा हो।
हालाँकि, इसमें एक पेंच है। ये रोबोट अविश्वसनीय रूप से बुद्धिमान हैं लेकिन आश्चर्यजनक रूप से नाजुक भी हैं। यदि आप रसोई में रोशनी बदल देते हैं, कैमरे को थोड़ा सा हिला देते हैं, या वीडियो फीड में थोड़ा सा स्टैटिक शोर जोड़ देते हैं, तो रोबोट घबरा सकता है और सूप गिरा सकता है। यह एक ऐसे प्रतिभाशाली छात्र की तरह है जो एक शांत डेस्क पर गणित की समस्या को पूरी तरह से हल कर सकता है लेकिन यदि उनके कान के पास एक मक्खी भिनभिनाती है तो जम जाता है। वैज्ञानिकों ने रोबोटों को मेसी (अव्यवस्थित) रसोई के हजारों नए उदाहरणों के साथ फिर से प्रशिक्षित करके इसे ठीक करने की कोशिश की है, लेकिन इसमें बहुत समय लगता है और भारी खर्च आता है। बड़ा सवाल यह है: क्या हम रोबोट के व्यवहार को "रीसेट" बटन दबाए बिना और फिर से शुरू किए बिना, काम करते समय ही तुरंत ठीक कर सकते हैं?
यह शोध पत्र, जिसका शीर्षक "स्टीयरिंग रोबस्टनेस इन टू वर्ल्ड एक्शन मॉडल्स वाया मैकेनिस्टिक इंटरप्रिटेबिलिटी एंड ऑप्टिमल कंट्रोल" है, रोबोट के मस्तिष्क के भीतर झाँककर देखता है कि क्या हम उसे वापस सही रास्ते पर ला सकते हैं। लेखक रोबोट के आंतरिक विचारों (जिन्हें "एक्टिवेशन्स" कहा जाता है) को एक मानचित्र की तरह मानते हैं। वे पूछते हैं: क्या इस मानचित्र पर एक सरल, सीधी रेखा है जो "सही काम करने" और "शोर वाले कैमरे के कारण घबराने" के बीच अंतर करती है? वे पाते हैं कि कुछ रोबोट मॉडल्स के लिए, हाँ, एक स्पष्ट रेखा है। अन्य के लिए, मानचित्र एक उलझा हुआ जाल है।
उन रोबोटों को ठीक करने के लिए जिनके पास एक स्पष्ट रेखा है, लेखक एक नई तरकीब ईजाद करते हैं जिसे WA-LQR कहा जाता है। इसे रोबोट के मस्तिष्क के लिए एक सुपर-स्मार्ट ऑटोपायलट के रूप में समझें। केवल रोबोट के विचारों को एक दिशा में धकेलने के बजाय (जो कि बहुत अधिक या बहुत कम हो सकता है), WA-LQR एक कुशल ड्राइवर की तरह काम करता है जो सड़क से भटकती हुई कार को ठीक करता है। यह लगातार जांचता रहता है कि रोबोट कहाँ सोच रहा है, इसकी तुलना इससे करता है कि शांत रहने के लिए उसे कहाँ सोचना चाहिए, और रोबोट को सही रास्ते पर रखने के लिए छोटे, सटीक समायोजन करता है।
परिणाम उत्साहजनक लेकिन विशिष्ट हैं। जब उन्होंने दो प्रकार के रोबोट मस्तिष्क (Cosmos-Policy और DiT4DiT) पर इसका परीक्षण किया, तो ऑटोपायलट ने कमाल कर दिया। इसने रोबोट को उन कार्यों में सफल होने में मदद की जब कैमरा हिल रहा था, ग्रिपर गलत जगह पर था, या वीडियो स्टैटिक शोर से भरा था। कुछ मामलों में, इसने उनकी सफलता दर को 41% तक बढ़ा दिया। हालाँकि, जब उन्होंने तीसरे प्रकार के रोबोट मस्तिष्क (LingBot-VA) पर इसे आज़माया, तो "मानचित्र" बहुत अधिक उलझा हुआ था जिससे सीधी रेखा ढूँढना मुश्किल था, और ऑटोपायलट ज्यादा मदद नहीं कर सका। यह सुझाव देता है कि हालांकि हम इस ट्रिक से हर रोबोट को ठीक नहीं कर सकते, लेकिन उन रोबोटों के लिए जिनके पास सही आंतरिक संरचना है, हम उन्हें बिना फिर से प्रशिक्षित किए बहुत अधिक मजबूत और विश्वसनीय बना सकते हैं। यह कुछ ऐसा है जैसे यह महसूस करना कि कुछ कारों को बस एक बेहतर स्टीयरिंग व्हील की आवश्यकता होती है, जबकि अन्य को पूरी तरह से नए इंजन की।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।