Risk-Aware Preference Learning for Stochastic Outcomes
यह शोध पत्र यह प्रदर्शित करता है कि मानव जोखिम संवेदनशीलता को मॉडल करने के लिए संचयी प्रोस्पेक्ट थ्योरी (Cumulative Prospect Theory) को शामिल करना, पारंपरिक अपेक्षित उपयोगिता धारणाओं की तुलना में स्टोकेस्टिक रोबोट नेविगेशन के लिए प्राथमिकता शिक्षण में रिवॉर्ड फंक्शन रिकवरी में महत्वपूर्ण सुधार करता है और पछतावे (regret) को कम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक विनम्र इंसान की तरह व्यवहार करना सिखाने की कोशिश कर रहे हैं। आप केवल नियमों की एक लंबी सूची नहीं लिख सकते जैसे कि "लोगों को मत मारो" या "तेज़ चलो," क्योंकि जीवन अव्यवस्थित है और इसमें कई आश्चर्यजनक स्थितियाँ होती हैं। इसके बजाय, वैज्ञानिकों ने एक चतुर तरीका खोजा है: रोबोट को चलने के दो अलग-अलग तरीके दिखाएं और एक इंसान से पूछें, "इनमें से कौन सा बेहतर दिखता है?" ऐसा हजारों बार करने से, रोबोट वह छिपा हुआ "स्कोरकार्ड" सीख सकता है जिसे इंसान वास्तव में महत्व देते हैं। इसे प्रिफरेंस-बेस्ड रिवॉर्ड लर्निंग (preference-based reward learning) कहा जाता है।
हालाँकि, अधिकांश अध्येशनों के पीछे एक पेचीदा धारणा छिपी हुई है। यह मानती है कि इंसान पूर्ण कैलकुलेटर की तरह हैं जो केवल स्थिति के अच्छे और बुरे हिस्सों को जोड़ते हैं, और उन्हें इस आधार पर तौलते हैं कि उनके होने की कितनी संभावना है। इसे एक्स्पेक्टेड यूटिलिटी (Expected Utility) कहा जाता है। लेकिन वास्तविक इंसान कैलकुलेटर नहीं होते; हम भावुक होते हैं। हम दुर्लभ आपदाओं (जैसे कार दुर्घटना) के बारे में बहुत अधिक चिंता करते हैं और हमें चीजें खोने का दुख, चीजें पाने की खुशी से कहीं अधिक होता है। यह शोध एक सरल प्रश्न पूछता है: क्या होगा यदि हम एक ऐसे मॉडल का उपयोग करके एक रोबोट को सिखाते हैं जो यह मानता है कि इंसान एक पूर्ण कैलकुलेटर है, जबकि इंसान वास्तव में जोखिम के प्रति संवेदनशील और भावुक निर्णय लेने वाले होते हैं?
यूनिवर्सिटी ऑफ कोलोराडो बोल्डर के शोधकर्ताओं ने इस विचार का परीक्षण करने का निर्णय लिया जहाँ एक रोबोट को पैदल यात्रियों की भीड़ के बीच से गुजरना होता है। इस दुनिया में, रोबोट द्वारा उठाया गया हर कदम कोई एकल, गारंटीकृत पथ नहीं है। इसके बजाय, यह पासा फेंकने जैसा है: रोबोट सुचारू रूप से फिसल सकता है, या वह किसी से टकरा सकता है, या वह फंस सकता है। परिणाम संभावनाओं का एक बादल है, न कि एक सीधी रेखा।
टीम ने दो प्रकार के "शिक्षकों" (वे इंसान जिनके विचारों को रोबोट सीखने की कोशिश करता है) के साथ एक डिजिटल प्रयोग तैयार किया। एक शिक्षक एक "पूर्ण कैलकुलेटर" था जो केवल औसत परिणाम की परवाह करता था (Expected Utility)। दूसरा शिक्षक एक "जोखिम-संवेदनशील" इंसान था जो क्युमुलेटिव प्रॉस्पेक्ट थ्योरी (Cumulative Prospect Theory - CPT) नामक एक जटिल मनोवैज्ञानिक मॉडल का उपयोग करता था। यह मॉडल यह स्पष्ट करता है कि कैसे वास्तविक लोग दुर्लभ, डरावनी घटनाओं की संभावना को बढ़ा-चढ़ाकर देखते हैं और टकराव के दर्द को एक सुचारू पथ की खुशी की तुलना में बहुत अधिक तीव्रता से महसूस करते हैं।
शोधकर्ताओं ने दो प्रकार के "छात्रों" (सीखने वाले एल्गोरिदम) को प्रशिक्षित किया। एक छात्र ने माना कि शिक्षक एक पूर्ण कैलकुलेटर है (EU लर्नर), जबकि दूसरे ने माना कि शिक्षक एक जोखिम-संवेदनशील मानव है (CPT लर्नर)। उन्होंने दोनों छात्रों को हजारों "कौन सा रास्ता बेहतर है?" वाले प्रश्न दिए जो शिक्षकों द्वारा उत्पन्न किए गए थे और देखा कि वे वास्तविक स्कोरकार्ड को कितनी अच्छी तरह सीखते हैं।
उन्होंने अपने सिमुलेशन में क्या पाया, यहाँ बताया गया है। जब शिक्षक एक पूर्ण कैलकुलेटर था, तो कैलकुलेटर-छात्र ने पूरी तरह से सीखा, जबकि जोखिम-संवेदनशील छात्र अतिरिक्त जटिलता के कारण थोड़ा भ्रमित हो गया। लेकिन जब शिक्षक एक जोखिम-संवेदनशील मानव था, तो कैलकुलेटर-छात्र का प्रदर्शन काफी खराब रहा। इसने एक दुर्लभ दुर्घटना के डर को समझाने के लिए रिकवर किए गए स्कोरकार्ड को विकृत करने की कोशिश की, जिससे रोबोट को लगा कि टकराव केवल "थोड़ा बुरा" था, न कि "विनाशकारी," जिसके परिणामस्वरूप एक पक्षपाती रिवॉर्ड मिला। रोबोट ने एक कम सटीक सबक सीखा।
इसके विपरीत, जोखिम-संवेदनशील छात्र (CPT लर्नर) का प्रदर्शन बहुत बेहतर रहा। इसने महसूस किया कि मानव केवल परिणाम को अलग तरह से महत्व नहीं दे रहा था; बल्कि वे अनिश्चितता को अलग तरह से तौल रहे थे। परिणाम के "मूल्य" को जोखिम के "डर" से अलग करके, CPT लर्नर ने काफी कम त्रुटि के साथ एक स्कोरकार्ड प्राप्त किया।
यह शोध सुझाव देता है कि यदि हम चाहते हैं कि वास्तविक दुनिया में रोबोट सुरक्षित और मानव मूल्यों के अनुरूप हों—जहाँ दुर्लभ दुर्घटनाएं डरावनी होती हैं और लोग स्वाभाविक रूप से अनिश्चितता के प्रति चिंतित होते हैं—तो हम केवल यह मानकर नहीं चल सकते कि इंसान तार्किक गणितीय मशीन हैं। हमें ऐसे रोबोट बनाने की आवश्यकता है जो मानवीय डर और जोखिम संवेदनशीलता को समझ सकें, अन्यथा वे खतरनाक शॉर्टकट लेने के लिए सीख सकते हैं क्योंकि उन्हें लगता है कि हमें जोखिम से कोई फर्क नहीं पड़ता। हालांकि यह परिणाम कंप्यूटर सिमुलेशन से आया है और अभी तक वास्तविक लोगों द्वारा वास्तविक रोबोट का परीक्षण नहीं किया गया है, फिर भी प्रमाण एक स्पष्ट आवश्यकता की ओर संकेत करते हैं: यदि हमें रोबोट को सुरक्षित होना सिखाना है, तो हमें पहले उन्हें यह सिखाना होगा कि इंसान अज्ञात के बारे में वास्तव में कैसा महसूस करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।