← नवीनतम पेपर
💻 computer science

Risk-Aware Preference Learning for Stochastic Outcomes

यह शोध पत्र यह प्रदर्शित करता है कि मानव जोखिम संवेदनशीलता को मॉडल करने के लिए संचयी प्रोस्पेक्ट थ्योरी (Cumulative Prospect Theory) को शामिल करना, पारंपरिक अपेक्षित उपयोगिता धारणाओं की तुलना में स्टोकेस्टिक रोबोट नेविगेशन के लिए प्राथमिकता शिक्षण में रिवॉर्ड फंक्शन रिकवरी में महत्वपूर्ण सुधार करता है और पछतावे (regret) को कम करता है।

मूल लेखक: Yi-Shiuan Tung, Yuni Wu, Wei Jiang, Alessandro Roncone, Bradley Hayes

प्रकाशित 2026-07-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yi-Shiuan Tung, Yuni Wu, Wei Jiang, Alessandro Roncone, Bradley Hayes

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक विनम्र इंसान की तरह व्यवहार करना सिखाने की कोशिश कर रहे हैं। आप केवल नियमों की एक लंबी सूची नहीं लिख सकते जैसे कि "लोगों को मत मारो" या "तेज़ चलो," क्योंकि जीवन अव्यवस्थित है और इसमें कई आश्चर्यजनक स्थितियाँ होती हैं। इसके बजाय, वैज्ञानिकों ने एक चतुर तरीका खोजा है: रोबोट को चलने के दो अलग-अलग तरीके दिखाएं और एक इंसान से पूछें, "इनमें से कौन सा बेहतर दिखता है?" ऐसा हजारों बार करने से, रोबोट वह छिपा हुआ "स्कोरकार्ड" सीख सकता है जिसे इंसान वास्तव में महत्व देते हैं। इसे प्रिफरेंस-बेस्ड रिवॉर्ड लर्निंग (preference-based reward learning) कहा जाता है।

हालाँकि, अधिकांश अध्येशनों के पीछे एक पेचीदा धारणा छिपी हुई है। यह मानती है कि इंसान पूर्ण कैलकुलेटर की तरह हैं जो केवल स्थिति के अच्छे और बुरे हिस्सों को जोड़ते हैं, और उन्हें इस आधार पर तौलते हैं कि उनके होने की कितनी संभावना है। इसे एक्स्पेक्टेड यूटिलिटी (Expected Utility) कहा जाता है। लेकिन वास्तविक इंसान कैलकुलेटर नहीं होते; हम भावुक होते हैं। हम दुर्लभ आपदाओं (जैसे कार दुर्घटना) के बारे में बहुत अधिक चिंता करते हैं और हमें चीजें खोने का दुख, चीजें पाने की खुशी से कहीं अधिक होता है। यह शोध एक सरल प्रश्न पूछता है: क्या होगा यदि हम एक ऐसे मॉडल का उपयोग करके एक रोबोट को सिखाते हैं जो यह मानता है कि इंसान एक पूर्ण कैलकुलेटर है, जबकि इंसान वास्तव में जोखिम के प्रति संवेदनशील और भावुक निर्णय लेने वाले होते हैं?

यूनिवर्सिटी ऑफ कोलोराडो बोल्डर के शोधकर्ताओं ने इस विचार का परीक्षण करने का निर्णय लिया जहाँ एक रोबोट को पैदल यात्रियों की भीड़ के बीच से गुजरना होता है। इस दुनिया में, रोबोट द्वारा उठाया गया हर कदम कोई एकल, गारंटीकृत पथ नहीं है। इसके बजाय, यह पासा फेंकने जैसा है: रोबोट सुचारू रूप से फिसल सकता है, या वह किसी से टकरा सकता है, या वह फंस सकता है। परिणाम संभावनाओं का एक बादल है, न कि एक सीधी रेखा।

टीम ने दो प्रकार के "शिक्षकों" (वे इंसान जिनके विचारों को रोबोट सीखने की कोशिश करता है) के साथ एक डिजिटल प्रयोग तैयार किया। एक शिक्षक एक "पूर्ण कैलकुलेटर" था जो केवल औसत परिणाम की परवाह करता था (Expected Utility)। दूसरा शिक्षक एक "जोखिम-संवेदनशील" इंसान था जो क्युमुलेटिव प्रॉस्पेक्ट थ्योरी (Cumulative Prospect Theory - CPT) नामक एक जटिल मनोवैज्ञानिक मॉडल का उपयोग करता था। यह मॉडल यह स्पष्ट करता है कि कैसे वास्तविक लोग दुर्लभ, डरावनी घटनाओं की संभावना को बढ़ा-चढ़ाकर देखते हैं और टकराव के दर्द को एक सुचारू पथ की खुशी की तुलना में बहुत अधिक तीव्रता से महसूस करते हैं।

शोधकर्ताओं ने दो प्रकार के "छात्रों" (सीखने वाले एल्गोरिदम) को प्रशिक्षित किया। एक छात्र ने माना कि शिक्षक एक पूर्ण कैलकुलेटर है (EU लर्नर), जबकि दूसरे ने माना कि शिक्षक एक जोखिम-संवेदनशील मानव है (CPT लर्नर)। उन्होंने दोनों छात्रों को हजारों "कौन सा रास्ता बेहतर है?" वाले प्रश्न दिए जो शिक्षकों द्वारा उत्पन्न किए गए थे और देखा कि वे वास्तविक स्कोरकार्ड को कितनी अच्छी तरह सीखते हैं।

उन्होंने अपने सिमुलेशन में क्या पाया, यहाँ बताया गया है। जब शिक्षक एक पूर्ण कैलकुलेटर था, तो कैलकुलेटर-छात्र ने पूरी तरह से सीखा, जबकि जोखिम-संवेदनशील छात्र अतिरिक्त जटिलता के कारण थोड़ा भ्रमित हो गया। लेकिन जब शिक्षक एक जोखिम-संवेदनशील मानव था, तो कैलकुलेटर-छात्र का प्रदर्शन काफी खराब रहा। इसने एक दुर्लभ दुर्घटना के डर को समझाने के लिए रिकवर किए गए स्कोरकार्ड को विकृत करने की कोशिश की, जिससे रोबोट को लगा कि टकराव केवल "थोड़ा बुरा" था, न कि "विनाशकारी," जिसके परिणामस्वरूप एक पक्षपाती रिवॉर्ड मिला। रोबोट ने एक कम सटीक सबक सीखा।

इसके विपरीत, जोखिम-संवेदनशील छात्र (CPT लर्नर) का प्रदर्शन बहुत बेहतर रहा। इसने महसूस किया कि मानव केवल परिणाम को अलग तरह से महत्व नहीं दे रहा था; बल्कि वे अनिश्चितता को अलग तरह से तौल रहे थे। परिणाम के "मूल्य" को जोखिम के "डर" से अलग करके, CPT लर्नर ने काफी कम त्रुटि के साथ एक स्कोरकार्ड प्राप्त किया।

यह शोध सुझाव देता है कि यदि हम चाहते हैं कि वास्तविक दुनिया में रोबोट सुरक्षित और मानव मूल्यों के अनुरूप हों—जहाँ दुर्लभ दुर्घटनाएं डरावनी होती हैं और लोग स्वाभाविक रूप से अनिश्चितता के प्रति चिंतित होते हैं—तो हम केवल यह मानकर नहीं चल सकते कि इंसान तार्किक गणितीय मशीन हैं। हमें ऐसे रोबोट बनाने की आवश्यकता है जो मानवीय डर और जोखिम संवेदनशीलता को समझ सकें, अन्यथा वे खतरनाक शॉर्टकट लेने के लिए सीख सकते हैं क्योंकि उन्हें लगता है कि हमें जोखिम से कोई फर्क नहीं पड़ता। हालांकि यह परिणाम कंप्यूटर सिमुलेशन से आया है और अभी तक वास्तविक लोगों द्वारा वास्तविक रोबोट का परीक्षण नहीं किया गया है, फिर भी प्रमाण एक स्पष्ट आवश्यकता की ओर संकेत करते हैं: यदि हमें रोबोट को सुरक्षित होना सिखाना है, तो हमें पहले उन्हें यह सिखाना होगा कि इंसान अज्ञात के बारे में वास्तव में कैसा महसूस करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →