Asymmetric Reinforcement Learning Explains Human Choice Patterns in Decision-making Under Risk
यह अध्ययन प्रदर्शित करता है कि एक असममित जोखिम-संवेदनशील (Risk Sensitive) सुदृढीकरण शिक्षण मॉडल, जो पुरस्कारों और हानियों को विभेदित रूप से भारित करता है, जोखिम के तहत निर्णय लेने में मानव चयन पैटर्न और प्रतिक्रिया समय के लिए सममित शिक्षण दृष्टिकोणों की तुलना में एक बेहतर स्पष्टीकरण प्रदान करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: हम जीत और हार से कैसे सीखते हैं
कल्पना कीजिए कि आप एक खेल खेल रहे हैं जहाँ आपको यह अनुमान लगाना है कि आपके हाथ में मौजूद कार्ड से छिपा हुआ कार्ड ऊँचा है या नीचा। कभी आप एक डॉलर जीतते हैं, और कभी आप एक डॉलर हार जाते हैं।
वैज्ञानिक लंबे समय से एक सरल प्रश्न पर बहस कर रहे हैं: जब हम इन खेलों से सीखते हैं, तो क्या हम जीत और हार के साथ बिल्कुल एक जैसा व्यवहार करते हैं?
- पुरानी थ्योरी (सिमेट्रिक लर्निंग - सममित सीखना): यह थ्योरी कहती है कि हमारा मस्तिष्क एक पूरी तरह से संतुलित तराजू की तरह है। यदि आप 1 हारते हैं, तो आपका मस्तिष्क कहता, "बुरा हुआ, ऐसा दोबारा मत करना!" जीत और हार का वजन बिल्कुल समान होता है।
- नई थ्योरी (एसिमेट्रिक लर्निंग - विषम सीखना): यह पेपर सुझाव देता है कि हमारा मस्तिष्क एक पक्षपाती तराजू की तरह है। हम एक जीत से एक हार की तुलना में कहीं अधिक तेज़ी से सीख सकते हैं, या इसके विपरीत भी हो सकता है। हम छोटी हानियों को नज़रअंदाज़ कर सकते हैं लेकिन बड़ी जीत को लेकर बेहद उत्साहित हो सकते हैं।
इस अध्ययन का उद्देश्य यह पता लगाना था कि वास्तव में कौन सी थ्योरी सच है।
प्रयोग: "स्टारलिंग" कार्ड गेम
शोधकर्ताओं ने स्टारलिंग टास्क (Starling Task) नामक एक नया खेल बनाया। यह इस प्रकार काम करता था:
- सेटअप: आप एक कार्ड देखते हैं (मान लीजिए 4)। आपको अनुमान लगाना है कि छिपे हुए प्रतिद्वंद्वी का कार्ड ऊँचा है या नीचा।
- ट्विस्ट: कार्डों की गड्डी हमेशा निष्पक्ष नहीं होती।
- यूनिफॉर्म डेक (समान गड्डी): सभी नंबर (1-9) समान रूप से संभावित हैं।
- लो डेक (कम नंबर वाली गड्डी): ज्यादातर कम नंबर (1, 2, 3) हैं।
- हाई डेक (उच्च नंबर वाली गड्डी): ज्यादातर ऊँचे नंबर (7, 8, 9) हैं।
- चुनौती: कभी-कभी गड्डी लंबे समय तक एक जैसी रहती है (ताकि आप पैटर्न सीख सकें)। अन्य समय में, गड्डी हर टर्न में बदल जाती है, और आपको यह जानने के लिए एक रंग के संकेत पर ध्यान देना पड़ता है कि आप किस डेक में हैं।
47 लोगों ने यह खेल खेला (कुछ स्वस्थ स्वयंसेवक थे, और कुछ मिर्गी के रोगी थे जो पहले से ही ब्रेन मॉनिटरिंग के लिए अस्पताल में भर्ती थे)। उन्होंने सैकड़ों राउंड खेले, और नकली पैसे जीते या हारे।
जासूसी कार्य: मॉडल्स का परीक्षण
शोधकर्ताओं ने केवल लोगों को देखा ही नहीं; उन्होंने यह देखने के लिए पाँच अलग-अलग कंप्यूटर "मस्तिष्क" (गणितीय मॉडल) बनाए कि कौन सा मॉडल सबसे अच्छी तरह से भविष्यवाणी कर सकता है कि इंसान आगे क्या करेंगे।
- "विन-स्टे, लूज़-शिफ्ट" रोबोट: एक सरल रोबलेट जो बस जीतने पर एक चाल दोहराता है और हारने पर उसे बदल देता है। (जैसे चलना सीखने वाला एक छोटा बच्चा)।
- "ग्रीडी" (लालची) रोबोट: हमेशा वही विकल्प चुनता है जिसे वह सबसे अच्छा समझता है, लेकिन सुरक्षा के लिए कभी-कभी कुछ रैंडम (अनिश्चित) भी आज़माता है।
- "स्मूथ" (सुचारू) रोबोट: सबसे अच्छे विकल्प को चुनता है लेकिन उसमें थोड़ा सा रैंडम तत्व मिला देता है, जैसे एक स्मूथ कर्व।
- "डबल-ट्रैकर" रोबोट: दो अलग-अलग स्कोरकार्ड रखता है: एक "मैंने कितना पैसा कमाया?" और दूसरा "यह कितना जोखिम भरा था?"
- "रिस्क-सेंसिटिव" (RS - जोखिम-संवेदनशील) रोबोट: यह मुख्य आकर्षण है। यह एसिमेट्रिकल (विषम) तरीके से सीखता है। इसके पास दो अलग-अलग "सीखने की गति" होती है: एक गति तब जब यह जीतता है, और एक अलग गति तब जब यह हारता है।
परिणाम: "रिस्क-सेंसिटिव" रोबोट की जीत
संख्याओं का विश्लेषण करने के बाद, रिस्क-सेंसिटिव (RS) रोबोट स्पष्ट विजेता रहा। इसने किसी भी अन्य मॉडल की तुलना में मानव व्यवहार की बेहतर भविष्यवाणी की।
इसका क्या अर्थ है?
इसका अर्थ यह है कि जब मनुष्य जोखिम के तहत निर्णय लेते हैं, तो हम जीत और हार को समान रूप से नहीं देखते हैं। हम परिणामों के आधार पर अपनी अपेक्षाओं को अलग-अलग तरह से अपडेट करते हैं।
- उपमा (Analogy): कल्पना कीजिए कि आप खाना बनाना सीख रहे हैं।
- यदि आप स्टेक जला देते हैं (एक हार), तो आप सोच सकते हैं, "ठीक है, अगली बार मैं आंच थोड़ी कम कर दूँगा," लेकिन शायद आपको सटीक तापमान पूरी तरह से याद न रहे।
- यदि आप एक बेहतरीन स्टेक पकाते हैं (एक जीत), तो आप सोच सकते हैं, "मैं तो जीनियस हूँ! मैं निश्चित रूप से इसे फिर से करूँगा!" और आप सटीक तापमान को बहुत स्पष्ट रूप से याद रखेंगे।
- अध्ययन सुझाव देता है कि हमारा मस्तिष्क इस तरह काम करता है: हम एसिमेट्रिक लर्नर्स (विषम शिक्षार्थी) हैं। हम केवल स्कोरबोर्ड पर अंक जोड़ते या घटाते नहीं हैं; हम जीत के भावनात्मक प्रभाव को हार की तुलना में अलग तरह से तौलते हैं।
यह क्यों महत्वपूर्ण है?
1. यह समझाता है कि हम "अजीब" चुनाव क्यों करते हैं।
कभी-कभी लोग बड़ा जोखिम लेते हैं क्योंकि उन्हें बड़ी जीत बहुत स्पष्ट रूप से याद रहती है लेकिन वे छोटी हानियों को भूल जाते हैं। यह मॉडल इस व्यवहार को पूरी तरह से समझाता है।
2. यह हमें मानसिक स्वास्थ्य को समझने में मदद करता है।
पेपर में उल्लेख किया गया है कि जुए की लत या एडिक्शन वाले लोगों में अक्सर "टूटे हुए" लर्निंग सिस्टम होते हैं। शायद उनकी "लॉस लर्निंग स्पीड" (हार से सीखने की गति) बहुत धीमी है, इसलिए वे पैसे हारने के बाद भी खेलते रहते हैं क्योंकि वे यह समझने के लिए अपने दिमाग को अपडेट करने में बहुत धीमे हैं कि यह एक बुरा विचार है। यह नया मॉडल डॉक्टरों को इन स्थितियों को समझने और इलाज करने के लिए एक बेहतर उपकरण देता है।
3. यह सभी के लिए काम करता है।
दिलचस्प बात यह है कि अध्ययन में पाया गया कि मिर्गी के रोगियों ने स्वस्थ लोगों की तरह ही अच्छा खेला। एकमात्र अंतर यह था कि मिर्गी के रोगी बटन दबाने में थोड़े धीमे थे। यह बताता है कि हम कैसे सीखते हैं (उसका "सॉफ्टवेयर") उसका तर्क सभी के लिए समान है, भले ही हमारी प्रतिक्रिया की गति (उसका "हार्डवेयर") भिन्न हो।
निष्कर्ष (The Takeaway)
मानव निर्णय लेना कोई ठंडा, गणितीय कैलकुलेशन नहीं है जहाँ +1 और -1 एक-दूसरे को काट देते हैं। इसके बजाय, यह एक गतिशील प्रक्रिया है जहाँ जीत और हार हमें अलग-अलग वजन के साथ प्रभावित करती हैं।
हम परफेक्ट कैलकुलेटर नहीं हैं; हम रिस्क-सेंसिटिव लर्नर्स (जोखिम-संवेदनशील शिक्षार्थी) हैं। हम कुछ परिणामों से दूसरों की तुलना में तेज़ी से सीखते हैं, और यही विषमता (asymmetry) वास्तव में वह कुंजी है जो हमें एक जोखिम भरी दुनिया में नेविगेट करने में मदद करती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।