Trial-by-Trial Behavioral Adaptation in a Restless Bandit Task: A Mixed-Effects Modeling Approach
本研究利用来自四臂歇息强盗任务(four-arm restless bandit task)的大型数据集进行混合效应建模,以表征试次层级的可观测行为适应,揭示了不同收益环境下决策过程中截然不同的非线性轨迹,而未对潜在的认知机制进行推断。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明
每一天,我们都在一个永不停歇的世界中做出选择。今天早上表现最好的咖啡馆,到了明天可能就会人满为患;昨天通畅的上班路线,今天可能就会发生拥堵。为了应对这种不断变化的情景,我们的大脑必须不断更新已知信息并调整行为。这种在规则不断变化的条件下通过经验进行学习的过程,是研究人类思维与决策的科学家们关注的核心谜题之一。研究人员探索这一问题的一种强有力的方法是通过一种被称为“躁动老虎机”(restless bandit)的任务设置。想象你正坐在四台老虎机前。在标准的博弈中,你可能会发现哪一台赔率最高并一直坚持使用它。但在“躁动版”中,机器会在你玩的过程中改变其赔付率。刚才还在高额赔付的机器可能突然停止,而另一台原本沉寂的机器可能开始派发奖金。为了做得好,你不能仅仅依赖于一条固定的规则;你必须保持观察、学习,并实时调整你的选择。
研究员 Erfan Jaripour 的一项新研究对人们如何应对这类动态挑战进行了全新的审视。该研究并没有试图去猜测人们在做这些决策时所使用的隐藏心理算法,而是完全聚焦于那些可以被观察和衡量的指标:人们实际做出的选择、他们获得的奖励、他们的反应速度,以及他们何时决定将注意力转向另一个选项。通过分析来自近千名参与四选一版本游戏的玩家的大规模数据集,研究人员绘制出了行为随时间变化的精确图谱。其目标并非构建一个复杂的脑部计算机模型,而是创建一个精确的统计画像,用以描述当环境拒绝保持不变时,人类决策是如何演变的。
研究人员检查了 965 名参与者的数据,他们总共做出了超过 139,000 次个体选择。每位参与者都在玩一个需要重复选择四个选项之一的游戏。这些选项的价值会随时间变化,从而创造了三种具有略微不同变化模式的游戏版本。研究人员追踪了四个特定指标:参与者是否选择了当前赔付最高的选项、他们实际赢得了多少钱、他们做出选择的速度快慢,以及他们是否切换到了与前一次选择不同的选项。为了理清这庞大的数据量,他们使用了一种精密的统计方法,该方法能够考虑到每个人的差异性。这种方法使他们既能观察到整个群体的普遍趋势,又能尊重每个人适应变化规则时的独特方式。
最令人瞩目的发现是,人们的表现并不是以一种直线、稳定的方式变好的。如果你绘制一个人随着时间推移选择最佳选项的概率,这条线不会呈恒定的角度上升。相反,它是弯曲的。研究发现,这条曲线的形状在很大程度上取决于正在进行的具体游戏版本。在其中一个游戏版本中,选择最佳选项的可能性遵循一条向上弯曲的路径,这表明了一种加速的稳步提升。而在另一个版本中,路径则是向下弯曲的,这表明虽然人们最初有所进步,但随后在坚持最佳选择的能力上出现了平台期或发生了另一种转变。这意味着,人们的适应方式并非单一、普适的过程;它深受其所处变化的特定环境结构的影响。
研究还显示,人们在起始状态和变化方式上存在显著差异。一些参与者在游戏开始时倾向于选择最佳选项,而另一些则较低。更重要的是,他们随时间变化的方式是各具特色的。有些人表现出快速的初始提升后逐渐放缓,而另一些人则表现出不同的学习模式。统计模型证实,这些在基准表现以及学习速度和形态上的差异是真实且一致的,而非随机噪声。这凸显了尽管人类适应的过程中存在普遍规律,但适应的具体轨迹却是一种高度个性化的体验。
观察其他衡量指标进一步丰富了这一图景。人们实际赢得的金额并不总是与他们的选择模式相匹配。即使人们选择最佳选项的频率更高,根据游戏版本的不同,他们获得的总回报也可能呈现出不同的变化方式。这表明,在多变的环境中,做出“正确”的选择与获得高额回报虽然相关,但是两个截然不同的结果。同样,决策速度也随时间发生了变化。随着游戏的进行,人们普遍变得更快,做出选择所需的时间更短。然而,这种提速在不同版本的游戏中表现出相似的速率,这表明决策过程的整体效率提升是普遍现象,即便选择最佳策略的具体方式各异。
研究人员还观察了人们切换选择的频率。总的来说,随着游戏的进行,人们切换选择的次数减少了,这表明他们正在进入一种节奏。然而,停止切换的速率取决于游戏版本。在其中一个版本中,人们减少切换的速度比在另一个版本中要剧烈得多。这说明环境本身会向玩家发出信号,告知其坚持现状还是探索新选择是否值得。研究人员仔细指出,虽然这些模式描述了人们具体做了什么,但它们并未解释背后的隐藏心理机制。研究人员并未测量人们在脑海中的思考、信念或计算过程。他们仅仅测量了输出结果:选择、速度和奖励。
这种区分至关重要。该研究证明,在动态世界中,可观察的行为遵循着复杂的、非线性的模式,并且因人和环境而异。它表明,适应不是一个简单的、直线式的进步过程,而是一个弯曲的、移动的过程。通过如此精确地绘制这些模式,该研究为未来的研究奠定了坚实的基础。科学家现在可以利用这些对现实世界行为的详细描述来测试关于大脑如何学习的理论。他们可以询问特定的学习计算机模型是否能够重现数据中所见的精确曲线和变化。在此之前,这项研究作为一个清晰的定量描述,展示了当周围世界拒绝静止不动时,人类行为是如何弯曲与偏移的。它证实了在一个躁动的世界里,我们的选择并非静态的,而是一种持续演进的适应之舞,由游戏规则和玩家独特的思想共同塑造。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。