← नवीनतम पेपर
🧬 biology

Trial-by-Trial Behavioral Adaptation in a Restless Bandit Task: A Mixed-Effects Modeling Approach

यह अध्ययन एक चार-आर्म रेस्टलेस बैंडिट टास्क (four-arm restless bandit task) के विशाल डेटासेट पर मिश्रित-प्रभाव मॉडलिंग (mixed-effects modeling) का उपयोग करता है ताकि ट्रायल-दर-ट्रायल अवलोकन योग्य व्यवहारिक अनुकूलन को स्पष्ट किया जा सके, जो अंतर्निहित संज्ञानात्मक तंत्रों का अनुमान लगाए बिना विभिन्न पेऑफ परिवेशों (payoff environments) में निर्णय लेने में विशिष्ट गैर-रैखिक प्रक्षेपवक्रों (nonlinear trajectories) को प्रकट करता है।

मूल लेखक: Erfan Jaripour

प्रकाशित 2026-08-19
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Erfan Jaripour

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

हर दिन, हम एक ऐसी दुनिया में चुनाव करते हैं जो कभी स्थिर नहीं रहती। वह कॉफी शॉप जो आज सुबह सबसे अच्छा विकल्प थी, कल भीड़भाड़ वाली हो सकती है; काम पर जाने का वह रास्ता जो कल तेज़ था, आज बाधित हो सकता है। इस बदलते परिदृश्य में नेविगेट करने के लिए, हमारे मस्तिष्क को जो कुछ भी हम जानते हैं उसे लगातार अपडेट करना चाहिए और अपने व्यवहार को समायोजित करना चाहिए। अनुभव से सीखने की यह प्रक्रिया, जबकि खेल के नियम बदल रहे होते हैं, उन वैज्ञानिकों के लिए एक केंद्रीय पहेली है जो यह अध्ययन करते हैं कि हम कैसे सोचते हैं और निर्णय लेते हैं। शोधकर्ता इस बात की खोज करने के लिए एक शक्तिशाली तरीका है कि लोग इस तरह की गतिशील चुनौती को कैसे संभालते हैं। कल्पना कीजिए कि आप चार स्लॉट मशीनों के सामने बैठे हैं। एक मानक खेल में, आप सीख सकते हैं कि कौन सी मशीन सबसे अधिक भुगतान करती है और उसी पर टिके रह सकते हैं। लेकिन एक 'रेस्टलेस' (बेचैन) संस्करण में, मशीनें आपके खेलने के दौरान ही अपने भुगतान की दर बदल देती हैं। जो मशीन एक क्षण पहले अच्छा भुगतान कर रही थी, वह अचानक रुक सकती है, जबकि दूसरी मशीन जो शांत थी, वह भुगतान करना शुरू कर सकती है। अच्छा करने के लिए, आप केवल एक निश्चित नियम पर भरोसा नहीं कर सकते; आपको वास्तविक समय में देखते रहना, सीखना और अपने विकल्पों को अनुकूलित करना होगा।

शोधकर्ता एर्फ़ान जरीपोर का एक नया अध्ययन इस तरह की गतिशील चुनौती को लोग कैसे संभालते हैं, इस पर एक नया दृष्टिकोण प्रदान करता है। लोगों द्वारा किए जाने वाले इन निर्णयों के पीछे छिपे मानसिक गणित का अनुमान लगाने के बजाय, यह अध्ययन पूरी तरह से उस चीज़ पर केंद्रित है जिसे देखा और मापा जा सकता है: वास्तविक विकल्प जो लोग चुनते हैं, उन्हें मिलने वाले पुरस्कार, उनकी प्रतिक्रिया की गति, और कब वे अपना ध्यान किसी दूसरे विकल्प पर स्थानांतरित करने का निर्णय लेते हैं। लगभग एक हजार लोगों द्वारा इस खेल के चार-विकल्प वाले संस्करण को खेलने के डेटा के एक विशाल संग्रह का विश्लेषण करके, शोधकर्ता ने यह मानचित्रित किया कि व्यवहार एक क्षण से दूसरे क्षण में कैसे बदलता है। लक्ष्य मस्तिष्क का एक जटिल कंप्यूटर मॉडल बनाना नहीं था, बल्कि एक सटीक, सांख्यिकीय चित्र बनाना था कि जब वातावरण स्थिर रहने से इनकार कर देता है, तो मानव निर्णय लेना कैसे विकसित होता है।

शोधकर्ता ने 965 प्रतिभागियों के डेटा का परीक्षण किया जिन्होंने कुल मिलाकर 1,39,000 से अधिक व्यक्तिगत विकल्प बनाए। प्रत्येक व्यक्ति ने एक खेल खेला जहाँ उन्हें बार-बार चार विकल्पों में से एक चुनना था। इन विकल्पों का मूल्य समय के साथ बदलता रहा, जिससे बदलाव के थोड़े अलग पैटर्न वाले तीन अलग-अलग संस्करण बने। शोधकर्ता ने चार विशिष्ट चीजों को ट्रैक किया: क्या व्यक्ति ने उस विकल्प को चुना जो वर्तमान में सबसे अधिक भुगतान कर रहा था, उन्होंने वास्तव में कितनी धनराशि जीती, उन्होंने अपना चुनाव कितनी तेज़ी से किया, और क्या उन्होंने उस विकल्प को बदल दिया जिसे उन्होंने पिछले चुनाव के रूप में चुना था। इस भारी मात्रा में डेटा को समझने के लिए, उन्होंने एक परिष्कृत सांख्यिकीय पद्धति का उपयोग किया जो इस तथ्य को ध्यान में रख सकती थी कि प्रत्येक व्यक्ति अलग है। इस दृष्टिकोण ने उन्हें पूरे समूह में सामान्य रुझानों को देखने की अनुमति दी और साथ ही प्रत्येक व्यक्ति के अनूठे तरीके का सम्मान भी किया कि वे बदलते नियमों के प्रति कैसे अनुकूलित होते हैं।

सबसे उल्लेखनीय खोज यह थी कि लोग केवल एक सीधी, स्थिर रेखा में खेल में बेहतर नहीं होते हैं। यदि आप समय के साथ किसी के सबसे अच्छे विकल्प को चुनने की संभावना को दर्शाते हैं, तो रेखा सीधी नहीं जाएगी। इसके बजाय, यह मुड़ जाएगी (curved)। अध्ययन में पाया गया कि इस वक्र (curve) का आकार इस बात पर बहुत अधिक निर्भर करता था कि कौन सा विशिष्ट संस्करण खेला जा रहा है। खेल के एक संस्करण में, सबसे अच्छे विकल्प को चुनने की संभावना एक ऊपर की ओर मुड़ने वाले पथ का अनुसरण करती थी, जो एक निरंतर सुधार का सुझाव देती है जो त्वरित होता जाता है। दूसरे संस्करण में, पथ नीचे की ओर मुड़ गया, जो यह दर्शाता है कि हालांकि लोग शुरुआत में सुधार करते हैं, उनकी सबसे अच्छे विकल्प के साथ टिके रहने की क्षमता अंततः स्थिर हो जाती है या एक अलग तरीके से बदल जाती है। इसका अर्थ यह है कि लोग कैसे अनुकूलित होते हैं, यह एक एकल, सार्वभौमिक प्रक्रिया नहीं है; यह उस विशिष्ट संरचना द्वारा गहराई से आकार लेती है जिसमें वे परिवर्तनशील वातावरण में होते हैं।

अध्ययन ने यह भी खुलासा किया कि लोग कैसे शुरुआत करते हैं और कैसे बदलते हैं, इसमें काफी भिन्नता होती है। कुछ प्रतिभागियों ने खेल की शुरुआत उच्च प्रवृत्ति के साथ की कि वे सबसे अच्छा विकल्प चुनें, जबकि अन्य नीचे से शुरू हुए। अधिक महत्वपूर्ण बात यह है कि समय के साथ उनके बदलने का तरीका भी अनूठा था। कुछ लोगों ने तीव्र प्रारंभिक सुधार दिखाया जो धीमा हो गया, जबकि अन्य लोगों ने सीखने का एक अलग पैटर्न दिखाया। सांख्यिकीय मॉडलों ने पुष्टि की कि आधारभूत प्रदर्शन और सीखने की गति तथा आकार में ये अंतर वास्तविक और सुसंगत थे, न कि केवल यादृच्छिक शोर (random noise)। यह इस बात पर प्रकाश डालता है कि हालांकि मनुष्यों के अनुकूल होने के सामान्य पैटर्न होते हैं, अनुकूलन का विशिष्ट प्रक्षेपवक्र (trajectory) एक अत्यधिक व्यक्तिगत अनुभव है।

अन्य प्रदान किए गए मापों को देखने से चित्र में और अधिक सूक्ष्मता आती है। लोग वास्तव में कितना पैसा जीतते थे, वह हमेशा उनके विकल्पों के पैटर्न से मेल नहीं खाता था। भले ही लोग अक्सर सबसे अच्छा विकल्प चुन रहे थे, लेकिन उन्हें प्राप्त कुल पुरस्कार खेल के संस्करण के आधार पर अलग तरह से बदल सकता था। यह दर्शाता है कि एक बदलते वातावरण में सही चुनाव करना और उच्च पुरस्कार प्राप्त करना संबंधित तो हैं, लेकिन अलग-अलग परिणाम हैं। इसी तरह, निर्णय लेने की गति समय के साथ बदल गई। जैसे-जैसे खेल आगे बढ़ा, लोग आम तौर पर तेज़ हो गए, जिससे उन्हें अपने चुनाव करने में कम समय लगा। हालाँकि, यह तेज़ होना समय के साथ एक समान दर से हुआ, चाहे वे किसी भी संस्करण का खेल खेल रहे हों, जो यह सुझाव देता है कि निर्णय लेने का सामान्य अभ्यास सभी के लिए कुशल हो गया, भले ही सबसे अच्छे विकल्प चुनने की विशिष्ट रणनीति अलग रही हो।

शोधकर्ता ने यह भी देखा कि लोग अपने विकल्पों को कितनी बार बदलते हैं। सामान्य तौर पर, लोग खेल के आगे बढ़ने के साथ कम बार स्विच करते हैं, जो यह दर्शाता है कि वे एक लय में ढल रहे हैं। हालाँकि, उनके स्विच करने की दर खेल के संस्करण पर निर्भर थी। एक संस्करण में, लोगों ने दूसरे की तुलना में बहुत अधिक तीव्रता से स्विच करना कम कर दिया। यह इंगित करता है कि वातावरण स्वयं खिलाड़ी को संकेत देता है कि किसी विकल्प के साथ बने रहना या नए विकल्पों को तलाशना कितना सार्थक है। अध्ययन ने सावधानीपूर्वक नोट किया कि जबकि ये पैटर्न ठीक से बताते हैं कि लोगों ने क्या किया, वे इसके पीछे की छिपी मानसिक मशीनरी की व्याख्या नहीं करते हैं। शोधकर्ता ने यह नहीं मापा कि लोग अपने दिमाग में क्या सोच रहे थे, विश्वास कर रहे थे, या गणना कर रहे थे। उन्होंने केवल आउटपुट को मापा: विकल्प, गति और पुरस्कार।

यह अंतर अत्यंत महत्वपूर्ण है। अध्ययन यह सिद्ध करता है कि एक गतिशील दुनिया में दृश्य व्यवहार जटिल, गैर-रैखिक (non-linear) पैटर्न का पालन करता है जो व्यक्ति और वातावरण के अनुसार भिन्न होता है। यह दिखाता है कि अनुकूलन एक सरल, सीधी रेखा वाला सुधार नहीं है, बल्कि एक वक्रीय, परिवर्तनशील प्रक्रिया है। इन पैटर्न को इतनी सटीकता के साथ मानचित्रित करके, अध्ययन भविष्य के अनुसंधान के लिए एक ठोस आधार प्रदान करता है। वैज्ञानिक अब वास्तविक दुनिया के व्यवहार के इन विस्तृत विवरणों का उपयोग यह परीक्षण करने के लिए कर सकते हैं कि मस्तिष्क कैसे सीखता है। वे यह पूछ सकते हैं कि क्या सीखने के विशिष्ट कंप्यूटर मॉडल इस डेटा में देखे गए सटीक वक्रों और विविधताओं को पुनरुत्पादित कर सकते हैं। तब तक, यह अध्ययन इस बात का स्पष्ट, मात्रात्मक विवरण है कि मानव व्यवहार कैसे झुकता और बदलता है जब उसके आसपास की दुनिया स्थिर रहने से इनकार कर देती है। यह पुष्टि करता है कि एक बेचैन दुनिया में, हमारे चुनाव स्थिर नहीं हैं; वे अनुकूलन का एक निरंतर, विकसित होता नृत्य है, जो खेल के नियमों और खिलाड़ी के अनूठे मन, दोनों द्वारा आकार लिया जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →