← 最新论文
📄 animal behavior and cognition

Environmental volatility amplifies Pavlovian control in decision-making

通过使用一种改进的巴甫洛夫向工具性转移范式,本研究表明,环境波动通过放大巴甫洛夫机制,将决策控制权转向奖励预测性线索,而这些机制提供了一种相对于计算成本高昂的工具性更新而言更为稳定的替代方案,并且可以根据结果增加或减少选择熵。

原作者: Danti, C., Degni, L. A. E., Mattioni, L., Badioli, M., Starita, F., Cartoni, E., Garofalo, S., Di Pellegrino, G.

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Danti, C., Degni, L. A. E., Mattioni, L., Badioli, M., Starita, F., Cartoni, E., Garofalo, S., Di Pellegrino, G.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

每天,我们的大脑都像是一个不停运转的计算器,权衡行动可能产生的结果,以决定下一步该做什么。如果你按下按钮并得到了奖励,你就会学会再次按下;如果你按下后什么也没得到,你就会停止。这就是我们在一个因果关系通常保持稳定的世界中导航的方式。但现实世界很少如此稳定。有时,规则会在毫无预警的情况下发生改变。昨天通往安全的路径今天可能通向危险。当环境变得不可预测时,大脑面临着一个难题:它所依赖的信息变得嘈回且不可靠。在这些高不确定性的时刻,我们的思维必须决定是继续尝试弄清新规则,还是退回到一种更简单、更古老的系统——即对环境中的信号做出自动反应。

这种关于我们如何在仔细计算与自动反应之间进行切换的问题,正是博洛尼亚大学和意大利国家研究委员会研究人员开展的一项新研究的核心。他们想要了解当世界变得混乱时会发生什么。具体来说,他们调查了动荡且不可预测的环境是否会让我们更容易忽略自身的计算,转而追随熟悉的线索。想象一个人走在森林里,路径标记不断移动;最终,他们可能会停止尝试阅读地图,而仅仅是跟随一种通常导向水源的花朵的气味,即使地图显示水源在别处。研究人员试图观察,当环境具有波动性时,人类大脑是否会出现这种转变,以及这种转变是否改变了我们做决策的本质。

为了找到答案,研究团队设计了一个模仿老虎机的电脑游戏。在实验的第一部分,五十名健康的志愿者学习在两种不同条件下玩这个游戏。在“低波动性”条件下,机器是可预测的:一个拉杆大部分时间都会给出奖励,而另一个则很少给出奖励。规则在很长一段时间内保持不变。在“高波动性”条件下,规则频繁且毫无预警地改变:原本通常表现良好的拉杆突然变得很差,而原本较差的变得很好,有时在一个环节内会发生五次变化。参与者必须通过观察自己选择的结果来学习这些变化的模式。正如预期的那样,人们发现掌握这些变化的规则要困难得多。他们的选择准确性较低,并且在选择哪个拉杆时显得更加犹豫不决。

在学习了老虎机的规则之后,参与者进入了第二个阶段,其中他们看到了食物奖励的图片。他们了解到某些图片预示了哪种食物会出现。这是一个被动学习阶段,他们只是观看图片和结果,而不按下任何拉杆。这在他们的脑海中建立了特定图片与特定食物之间的强有力联系。最后,研究人员将这两个部分结合在一起。参与者回到老虎机前,但这一次,在他们做出选择之前,拉杆上方会出现一张图片。这张图片可能指向当前最佳选择的拉杆,也可能指向当前最差选择的拉杆。研究人员随后观察,参与者是会坚持使用最近回报率高的拉杆,还是会被图片所引导。

结果揭示了一个清晰且令人惊讶的模式。当参与者在稳定、低波动的环境中学习时,图片几乎没有产生影响。他们大多忽略图片,坚持使用目前能给他们带来最好回报的拉杆。然而,当他们在混乱、高波动的环境中学习时,图片接管了控制权。如果图片指向的是当前最差选择的拉杆,高波动组的参与者比稳定组更频繁地跟随图片。他们放弃了过去行之有效的策略,转而让线索驱动决策。尽管这张图片与机器当前的规则无关,但他们依然如此。由于大脑被不断的改变所压倒,它将信任从自身的计算转向了更简单的信号。

研究人员还观察了参与者选择的一致性。他们测量了决策的“熵”,这是一种描述一个人的行为在瞬间变化程度的方法。在高波动组中,当图片与最佳选择发生冲突时,参与者的选择变得非常反复无常。他们似乎在两个系统之间挣扎,在跟随图片和跟随规则之间来回摇摆。这种内在冲突创造了一种嘈杂且不可预测的行为模式。但故事在第二个实验中发生了变化,该实验旨在测试反馈停止时会发生什么。在这个版本中,研究人员在测试的某些部分移除了奖励反馈。由于失去了通过反馈来更新计算的机制,工具性系统失去了运作的基础。在这种状态下,参与者不仅变得反复无常,反而变得极其机械地一致。他们每一次都完全跟随图片,即使图片导向了错误的选择。冲突消失了,因为大脑已经停止了计算,并完全向线索投降。

这些发现表明,环境的波动性不仅仅是增加了行为中的混乱或噪声。相反,它主动改变了我们大脑权衡不同类型信息的方式。当世界稳定时,我们依赖于通过行动进行学习的能力。当世界变得不可预测时,我们的大脑似乎认为追踪每一次变化成本太高且风险太大。相反,它将控制权转移到了更简单的、基于线索的系统,即对环境中的信号做出反应。这种转变并非学习能力的失败,而是一种战略性的适应。大脑意识到,在一个混乱的世界里,旧规则已经不存在了,剩下的唯一稳定的东西就是信号。这种机制有助于解释为什么处于不稳定或压力环境中的人可能会变得更加冲动或受即时线索驱动,这种模式在成瘾和强迫性障碍等疾病中十分常见。这项研究表明,当地图不断变化时,我们会停止阅读地图,转而开始跟随气味。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →