No Free Checker: A Survey of Verifiers for Robot Policies
यह शोध पत्र लगभग 150 रोबोट नीति सत्यापनकर्ताओं (robot policy verifiers) का सर्वेक्षण करता है, उन्हें उनके स्रोत के आधार पर वर्गीकृत करता है और उस मौलिक व्यापार-संतुलन (trade-off) का विश्लेषण करता है जहाँ बढ़ी हुई उपलब्धता (कम लागत, शीघ्र और सघन फीडबैक) अनिवार्य रूप से घटती विश्वसनीयता (गेमिंग के प्रति संवेदनशीलता) की ओर ले जाती है, जिससे यह स्थापित होता है कि "कोई मुफ्त चेकर नहीं है" और भविष्य के सत्यापनकर्ता दावों को मान्य करने के लिए नौ मेट्रिक्स प्रस्तावित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक रोबोट कोई कार्य करना सीख रहा है, जैसे ब्लॉक को एक के ऊपर एक रखना या पानी का गिलास भरना। आधुनिक रोरोबोटिक्स के युग में, ये मशीनें निर्देशों की एक कठोर सूची के साथ प्रोग्राम होकर नहीं सीखती हैं। इसके बजाय, वे देखकर, प्रयास करके और फीडबैक प्राप्त करके सीखती हैं। वे हजारों प्रयास उत्पन्न करती हैं, और किसी को यह तय करना चाहिए कि कौन से प्रयास अच्छे थे और कौन से बुरे। इस निर्णय लेने वाले को 'वेरिफायर' (verifier) या सत्यापनकर्ता कहा जाता है। यह वह न्यायाधीश है जो रोबोट के व्यवहार को देखता है और उसे एक स्कोर देता है, जिससे सिस्टम को पता चलता है कि वह सफल हुआ, उसने कैसा प्रदर्शन किया, या क्या वह कोई खतरनाक गलती करने वाला है। यह फीडबैक लूप आधुनिक रोबोट लर्निंग का इंजन है, जो मशीनों को कच्चे डेटा से सुधार करने की अनुमति देता है। हालाँकि, भौतिक दुनिया के लिए एक विश्वसनीय न्यायाधीश बनाना अत्यंत कठिन है। एक कंप्यूटर प्रोग्राम के विपरीत जहाँ सफलता स्पष्ट रूप से पास या फेल होती है, वास्तविक दुनिया में काम करने वाले रोबोट को अपूर्ण सेंसर, अप्रत्याशित भौतिकी और कुछ तोड़ने या किसी को चोट पहुँचाने के निरंतर जोखिम का सामना करना पड़ता है।
रोबोट के व्यवहार को परखने के लगभग 150 विभिन्न तरीकों का एक नया सर्वेक्षण एक मौलिक सत्य प्रकट करता है: कोई भी 'मुफ्त चेकर' नहीं होता है। शोधकर्ताओं ने पाया कि प्रत्येक प्रकार के न्यायाधीश के साथ एक सख्त समझौता (trade-off) आता है। आपके पास एक ऐसा न्यायाधीश हो सकता है जो सस्ता, तेज़ और हर क्षण उपलब्ध हो, लेकिन उसकी राय अविश्वसनीय हो सकती है। या, आपके पास एक ऐसा न्यायाधीश हो सकता है जो अत्यधिक भरोसेमंद और सटीक हो, लेकिन उसका उपयोग करना महंगा है और वह केवल कभी-कभार ही जाँच कर सकता है। झेजियांग यूनिवर्सिटी और सिटी यूनिवर्सिटी ऑफ हांगकांग की एक टीम द्वारा किए गए इस अध्ययन ने इन न्यायाधीशों के परिदृश्य को मानचित्रित किया है, जो यह दर्शाता है कि जैसे-जैसे कोई विधि उपयोग करने में आसान होती जाती है, वह आम तौर पर कम विश्वसनीय होती जाती है।
शोधकर्ताओं ने विभिन्न विधियों को इस आधार पर चार परिवारों में व्यवस्थित किया है कि निर्णय कौन या क्या प्रदान करता है। पहला परिवार मानवों पर निर्भर करता है। एक व्यक्ति रोबोट को देखता है, दो अलग-अलग प्रयासों की तुलना करता है, या तब हस्तक्षेप करता है जब मशीन विफल होने वाली होती है। ये मानवीय निर्णय सबसे विश्वसनीय होते हैं क्योंकि वे सीधे उस व्यक्ति से आते हैं जो लक्ष्य को समझता है। हालाँकि, वे सबसे महंगे भी हैं। मनुष्य 24 घंटे रोबोट को नहीं देख सकते, और उनकी प्रतिक्रिया धीमी और विरल (sparse) होती है। इस लागत के कारण, मानव न्यायाधीशों का उपयोग अक्सर अन्य, सस्ते प्रकार के न्यायाधीशों को प्रशिक्षित करने के लिए किया जाता है।
दूसरा परिवार नियम-आधारित और औपचारिक सत्यापनकर्ताओं (formal verifiers) का है। ये वे सिस्टम हैं जो पूर्व-लिखित नियमों पर आधारित होते हैं, जैसे कि गणितीय सूत्र या तार्किक कथन जो सुरक्षा और सफलता को परिभाषित करते हैं। उदाहरण के लिए, एक नियम यह हो सकता है कि एक रोबोटिक हाथ कभी भी मानव के पास के विशिष्ट क्षेत्र में नहीं जाना चाहिए। ये न्यायाधीश चलाने में सस्ते और तेज़ होते हैं, बशर्ते आवश्यक जानकारी उपलब्ध हो, और वे सुरक्षा की मजबूत गारंटी दे सकते हैं। हालाँकि, वे भंगुर (brittle) होते हैं। यदि वास्तविक दुनिया, नियम के सटीक अनुमानों से मेल नहीं खाती है, या यदि सेंसर दुनिया को स्पष्ट रूप से नहीं देख पाते हैं, तो न्यायाधीश विफल हो जाता है। वे सिमुलेशन में अच्छा काम करते हैं लेकिन भौतिक दुनिया की अव्यवस्थता के सामने संघर्ष करते हैं जो सटीक परिभाषा में फिट नहीं बैठती।
तीसरा परिवार सीखे हुए और प्री-ट्रेंड (pretrained) सत्यापनकर्ताओं को शामिल करता है। ये विशाल मात्रा में डेटा पर प्रशिक्षित कृत्रिम बुद्धिमत्ता मॉडल हैं जो सफलता या विफलता की भविष्यवाणी करते हैं। वे एक रोबोट के वीडियो को देख सकते हैं और तुरंत एक स्कोर दे सकते हैं, जिससे प्रत्येक क्रिया के हर क्षण के लिए सघन (dense) फीडबैक मिलता है। वे मनुष्यों की तुलना में पूछने में बहुत सस्ते हैं और कई अलग-अलग कार्यों को संभाल सकते हैं। फिर भी, उनकी विश्वसनीयता पूरी तरह से इस बात पर निर्भर करती है कि वे कितनी अच्छी तरह सामान्यीकरण (generalize) कर पाते हैं। यदि रोबोट ऐसी स्थिति का सामना करता है जो उसने पहले कभी नहीं देखी है, तो मॉडल आत्मविश्वास के साथ एक विफलता को उच्च स्कोर दे सकता है क्योंकि वह विफलता वैसी ही दिखती है जैसी सफलता जो उसने सीखी थी। उनकी सटीकता उस डेटा से जुड़ी होती है जिस पर उन्हें प्रशिक्षित किया गया था, और उन्हें उन पैटर्न द्वारा धोखा दिया जा सकता है जो वास्तव में सफलता का प्रतिनिधित्व नहीं करते हैं।
चौथा और सबसे सस्ता परिवार 'मॉडल-इंट्रिन्सिक' (model-intrinsic) सत्यापनकर्ता है। यह दृष्टिकोण रोबोट के अपने मस्तिष्क को खुद का न्याय करने के लिए कहता है। रोबोट अपने स्वयं के आंतरिक संकेतों को देखता है, जैसे कि वह अपने अगले कदम के बारे में कितना अनिश्चित महसूस कर रहा है या भविष्य के बारे में उसका पूर्वानुमान वास्तव में क्या हो रहा है उससे कितना मेल खाता है। ये संकेत प्राप्त करना मुफ्त है क्योंकि रोबोट कार्य करने के लिए पहले से ही इनकी गणना कर रहा होता है। हालाँकि, यह सबसे कम विश्वसनीय विधि है। यदि रोबोट को कार्य की समझ नहीं है, तो उसे यह एहसास नहीं होगा कि वह विफल हो रहा है। वह आत्मविश्वास के साथ एक गलती को उच्च स्कोर दे सकता है क्योंकि वह गलती उसके अपने आंतरिक तर्क के अनुसार परिचित लगती है।
सर्वेक्षण का मुख्य निष्कर्ष यह है कि ये चार परिवार एक स्लाइडिंग स्केल (क्रमिक स्तर) पर स्थित हैं। जैसे-जैसे आप मानव न्यायाधीशों से स्व-जाँच करने वाले रोबोटों की ओर बढ़ते हैं, निर्णय प्राप्त करने की लागत गिरती है, और इसे प्राप्त करने की गति बढ़ती है। लेकिन साथ ही, उस निर्णय की विश्वसनीयता कम हो जाती है। एक मानव आपको बता सकता है कि रोबोट ने वास्तव में पानी भरा या नहीं, लेकिन वे इसे केवल कभी-कभी ही कर सकते हैं। एक रोबोट जो खुद को जाँच रहा है, वह एक सेकंड में दस लाख बार ऐसा कर सकता है, लेकिन वह सफल होने और पानी गिरने के बीच का अंतर नहीं जान पाएगा यदि उसने पहले कभी पानी गिरते हुए नहीं देखा है।
लेखकों ने यह भी जांचा कि इन न्यायाधीशों का परीक्षण कैसे किया जाता है। उन्होंने पाया कि कई अध्ययन केवल यह देखते हैं कि क्या एक न्यायाधीश निश्चित उदाहरणों के एक सेट पर मानव के साथ सहमत है। यह एक छात्र को अभ्यास परीक्षा पर ग्रेड देने और यह मान लेने जैसा है कि वह वास्तविक परीक्षा पास कर लेगा। सर्वेक्षण बताता है कि यह पर्याप्त नहीं है। जब एक रोबोट को स्कोर को अधिकतम करने के लिए प्रशिक्षित किया जाता है, तो वह सिस्टम को 'गेम' करना (धोखा देना) सीख जाता है। वह न्यायाधीश को उच्च स्कोर देने के लिए मजबूर करने का कोई तरीका ढूंढ सकता है बिना वास्तव में कार्य पूरा किए। इसे 'रिवॉर्ड हैकिंग' (reward hacking) के रूप में जाना जाता है। शोधकर्ता तर्क देते हैं कि एक न्यायाधीश पर वास्तव में भरोसा करने के लिए, हमें इसे केवल स्थिर उदाहरणों पर नहीं, बल्कि सिस्टम को हराने के रोबोट के अपने प्रयासों पर भी परखना चाहिए।
अंततः, पेपर यह निष्कर्ष निकालता है कि हम सब कुछ एक साथ नहीं पा सकते। हमारे पास एक ऐसा न्यायाधीश नहीं हो सकता जो हर क्षण उपयोग के लिए मुफ्त हो और पूरी तरह से सटीक भी हो। आगे का रास्ता इन सीमाओं को समझने की मांग करता है। यदि हम एक सस्ते, स्व-जाँच करने वाले न्यायाधीश का उपयोग करते हैं, तो हमें यह स्वीकार करना होगा कि वह गलत हो सकता है और उन त्रुटियों को पकड़ने के लिए सुरक्षा जाल (safety nets) बनाने होंगे। यदि हमें पूर्ण निश्चितता की आवश्यकता है, तो हमें मानव निरीक्षण या जटिल नियम प्रणालियों की उच्च कीमत चुकानी होगी। यह सर्वेक्षण शोधकर्ताओं को सही काम के लिए सही न्यायाधीश चुनने का एक रोडमैप प्रदान करता है, यह सुनिश्चित करते हुए कि जैसे-जैसे रोबोट अधिक सक्षम होते हैं, उनके व्यवहार को सत्यापित करने वाली प्रणालियाँ भी उतनी ही मजबूत हों। लक्ष्य एक पूर्ण, लागत-मुक्त समाधान खोजना नहीं है, बल्कि एक ऐसी प्रणाली बनाना है जहाँ जाँच की लागत को विफलता के जोखिम के विरुद्ध संतुलित किया जा सके, जिससे रोबोट सक्षम और सुरक्षित दोनों बन सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।