Environmental volatility amplifies Pavlovian control in decision-making
एक संशोधित पावलोवियन-टू-इंस्ट्रुमेंटल ट्रांसफर प्रतिमान का उपयोग करते हुए, यह अध्ययन प्रदर्शित करता है कि पर्यावरणीय अस्थिरता, पावलोवियन तंत्रों को प्रवर्धित करके निर्णय लेने के नियंत्रण को पुरस्कार-अनुमानित संकेतों की ओर स्थानांतरित कर देती है, जो कम्प्यूटेशनल रूप से खर्चीले इंस्ट्रुमेंटल अपडेट के लिए एक स्थिर विकल्प प्रदान करते हैं और परिणाम के आधार पर चयन एंट्रॉपी को बढ़ा या घटा सकते हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
हर दिन, हमारे मस्तिष्क निरंतर कैलकुलेटर की तरह काम करते हैं, जो आगे क्या करना है यह तय करने के लिए हमारे कार्यों के संभावित परिणामों का आकलन करते हैं। यदि आप एक बटन दबाते हैं और आपको कोई इनाम मिलता है, तो आप उसे फिर से दबाना सीखते हैं; यदि आप इसे दबाते हैं और कुछ नहीं मिलता, तो आप रुक जाते हैं। इस प्रकार हम एक ऐसी दुनिया में नेविगेट करते हैं जहाँ कारण और प्रभाव आमतौर पर स्थिर रहते हैं। लेकिन वास्तविक दुनिया शायद ही कभी इतनी स्थिर होती है। कभी-कभी, बिना किसी चेतावनी के नियम बदल जाते हैं। एक रास्ता जो कल सुरक्षा की ओर ले गया था, वह आज खतरे की ओर ले जा सकता है। जब वातावरण अप्रत्याशित हो जाता है, तो मस्तिष्क के सामने एक कठिन समस्या होती है: वह जानकारी जिस पर वह स्मार्ट निर्णय लेने के लिए भरोसा करता है, वह शोर भरी और अविश्वसनीय हो जाती है। इन अनिश्चितता के क्षणों में, हमारे दिमाग को यह तय करना होता है कि क्या वह नए नियमों को समझने की कोशिश जारी रखे या एक सरल, पुराने सिस्टम पर वापस लौट जाए जो पर्यावरण के संकेतों के प्रति स्वचालित रूप से प्रतिक्रिया करता है।
यह प्रश्न कि हम सावधानीपूर्वक गणना और स्वचालित प्रतिक्रिया के बीच कैसे स्विच करते हैं, यूनिवर्सिटी ऑफ बोलोग्ना और नेशनल रिसर्च काउंसिल ऑफ इटली के शोधकर्ताओं द्वारा किए गए एक नए अध्ययन के केंद्र में है। वे समझना चाहते थे कि जब दुनिया अराजक हो जाती है तो क्या होता है। विशेष रूप से, उन्होंने जांच की कि क्या एक अस्थिर, अप्रत्याशित वातावरण हमें अपनी गणनाओं को अनदेखा करने और इसके बजाय परिचित संकेतों के खिंचाव का पालन करने के लिए अधिक प्रेरित करता है। कल्पना कीजिए कि एक व्यक्ति जंगल में चल रहा है जहाँ रास्ते के निशान बार-बार बदलते रहते हैं; अंततः, वह मानचित्र को पढ़ने की कोशिश करना छोड़ सकता है और केवल उस फूल की सुगंध का पीछा कर सकता है जो आमतौर पर पानी की ओर ले जाती है, भले ही मानचित्र कहता हो कि पानी कहीं और है। शोधकर्ताओं ने यह देखने के लिए प्रयोग किया कि क्या इस तरह का बदलाव मानव मस्तिष्क में तब होता है जब वातावरण अस्थिर होता है, और क्या यह बदलाव हमारे निर्णय लेने के मूल स्वरूप को बदल देता है।
उत्तर खोजने के लिए, टीम ने एक कंप्यूटर-आधारित खेल डिजाइन किया जो स्लॉट मशीन की नकल करता था। प्रयोग के पहले भाग में, पचास स्वस्थ स्वयंसेवकों ने दो अलग-अलग स्थितियों के तहत इस खेल को खेलना सीखा। "कम अस्थिरता" (low volatility) वाली स्थिति में, मशीन अनुमानित थी: एक लीवर अधिकांश समय इनाम देता था, और दूसरा de rarely (बहुत कम) इनाम देता था। नियम लंबे समय तक एक जैसे रहे। "उच्च अस्थिरता" (high volatility) वाली स्थिति में, नियम बार-बार और बिना किसी चेतावनी के बदलते थे। वह लीवर जो आमतौर पर अच्छा था अचानक बुरा हो गया, और बुरा वाला अच्छा बन गया, जो एक ही सत्र में कभी-कभी पांच बार हुआ। प्रतिभागियों को अपने विकल्पों के परिणामों को देखकर इन बदलते पैटर्न को सीखना था। जैसा कि अपेक्षित था, लोगों को बदलते नियमों में महारत हासिल करना बहुत कठिन लगा। उनके विकल्प कम सटीक थे, और वे कौन सा लीवर चुनें, इस बारे में वे अधिक अनिश्चित लग रहे थे।
स्लॉट मशीन के नियमों को सीखने के बाद, प्रतिभागी दूसरे चरण में चले गए जहाँ उन्हें भोजन के पुरस्कारों की तस्वीरें दिखाई गईं। उन्होंने सीखा कि कुछ तस्वीरें किस भोजन की भविष्यवाणी करती हैं। यह एक निष्क्रिय शिक्षण चरण था जहाँ उन्होंने केवल तस्वीरों और परिणामों को देखा, बिना किसी लीवर को दबाए। इसने उनके दिमाग में एक विशिष्ट चित्र और एक विशिष्ट भोजन के बीच एक मजबूत संबंध बना दिया। अंत में, शोधकर्ताओं ने दोनों भागों को एक साथ जोड़ा। प्रतिभागी स्लॉट मशीन पर वापस आए, लेकिन इस बार, उन्हें चुनने से पहले एक तस्वीर दिखाई गई। तस्वीर उस लीवर से मेल खा सकती थी जो वर्तमान में सबसे अच्छा विकल्प था, या यह उस लीवर की ओर इशारा कर सकती थी जो वर्तमान में सबसे खराब विकल्प था। शोधकर्ताओं ने फिर यह देखने के लिए निगरानी की कि क्या प्रतिभागी उसी लीवर के साथ टिके रहेंगे जिसने हाल ही में उन्हें पुरस्कृत किया था, या क्या वे उस लीवर की ओर खिंच जाएंगे जिसका सुझाव तस्वीर दे रही थी।
परिणामों ने एक स्पष्ट और आश्चर्यजनक पैटर्न का खुलासा किया। जब प्रतिभागियों ने स्थिर, कम अस्थिरता वाले वातावरण में खेल सीखा था, तो तस्वीरों का बहुत कम प्रभाव पड़ा। उन्होंने ज्यादातर तस्वीरों को अनदेखा किया और उसी लीवर के साथ टिके रहे जो वर्तमान में उन्हें सबसे अच्छे इनाम दे रहा था। हालांकि, जब उन्होंने अराजक, उच्च-अस्थिरता वाले वातावरण में खेल सीखा था, तो तस्वीरों ने नियंत्रण ले लिया। यदि एक तस्वीर उस लीवर की ओर इशारा करती थी जो वर्तमान में सबसे खराब विकल्प था, तो उच्च-अस्थिरता समूह के प्रतिभागियों ने स्थिर समूह की तुलना में बहुत अधिक बार तस्वीर का पालन किया। उन्होंने उस रणनीति को त्याग दिया जो अतीत में उनके लिए कारगर रही थी और संकेत (cue) को अपना निर्णय संचालित करने दिया। यह तब भी हुआ जब तस्वीर मशीन के वर्तमान नियमों के लिए अप्राčेय (irrelevant) थी। मस्तिष्क, निरंतर परिवर्तनों से अभिभूत होकर, अपनी गणना से विश्वास हटाकर सरल संकेत पर स्थानांतरित हो गया था।
शोधकर्ताओं ने यह भी देखा कि प्रतिभागियों के निर्णय कितने सुसंगत थे। उन्होंने निर्णयों के "एन्ट्रॉपी" (entropy) को मापा, जो यह वर्णन करने का एक तरीका है कि एक व्यक्ति का व्यवहार पल-पल में कितना भिन्न होता है। उच्च-अस्थिरता समूह में, जब तस्वीर और सबसे अच्छा विकल्प आपस में असहमत थे, तो प्रतिभागियों के निर्णय बहुत अधिक अनिश्चित हो गए। वे दोनों प्रणालियों के बीच फंसे हुए प्रतीत होते थे, तस्वीर का पालन करने और नियमों का पालन करने के बीच झूल रहे थे। इस आंतरिक संघर्ष ने एक शोर भरा, अप्रत्याशसनीय व्यवहार पैटर्न बनाया। लेकिन कहानी बदल गई जब एक दूसरे प्रयोग में यह परीक्षण किया गया कि फीडबैक (प्रतिक्रिया) रुकने पर क्या होता है। इस संस्करण में, शोधकर्ताओं ने परीक्षण के कुछ हिस्सों के दौरान रिवॉर्ड फीडबैक को हटा दिया। अपनी गणनाओं को अपडेट करने के लिए फीडबैक के बिना, इंस्ट्रुमेंटल सिस्टम के पास काम करने के लिए कुछ भी नहीं बचा था। इस अवस्था में, प्रतिभागी केवल अनिश्चित ही नहीं हुए; वे कठोर रूप से सुसंगत हो गए। उन्होंने हर बार तस्वीर का पालन किया, भले ही वह गलत विकल्प की ओर ले जा रही हो। संघर्ष समाप्त हो गया क्योंकि मस्तिष्क ने गणना करने की कोशिश करना बंद कर दिया था और पूरी तरह से संकेत (cue) के सामने आत्मसमर्पण कर दिया था।
ये निष्कर्ष बताते हैं कि पर्यावरणीय अस्थिरता केवल हमारे व्यवहार में भ्रम या शोर ही नहीं जोड़ती है। इसके बजाय, यह सक्रिय रूप से बदल देती है कि हमारा मस्तिष्क विभिन्न प्रकार की जानकारी को कैसे तौलता है। जब दुनिया स्थिर होती है, तो हम अपने कार्यों से सीखने की अपनी क्षमता पर भरोसा करते हैं। जब दुनिया अप्रत्याशित हो जाती है, तो हमारा मस्तिष्क यह तय करता है कि हर बदलाव को ट्रैक करना बहुत महंगा और जोखिम भरा है। इसके बजाय, यह नियंत्रण को सरल, संकेत-आधारित प्रणाली पर स्थानांतरित कर देता है जो पर्यावरण के संकेतों के प्रति प्रतिक्रिया करती है। यह बदलाव सीखने की विफलता नहीं है, बल्कि एक रणनीतिक अनुकूलन है। मस्तिष्क समझ जाता है कि अराजक दुनिया में, पुराने नियम चले गए हैं, और एकमात्र स्थिर चीज़ बचा हुआ संकेत है। यह तंत्र यह समझाने में मदद करता है कि क्यों अस्थिर या तनावपूर्ण स्थितियों में लोग अधिक आवेगी या तत्काल संकेतों से प्रेरित हो सकते हैं, एक पैटर्न जो लत और जुनूनी विकारों (compulsive disorders) जैसी स्थितियों में देखा जाता है। अध्ययन दिखाता है कि जब मानचित्र बार-बार बदलता है, तो हम उसे पढ़ना छोड़ देते हैं और सुगंध का पीछा करना शुरू कर देते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।