← 最新论文
📄 animal behavior and cognition

Transition from model-free to structure-informed decision making in dynamic environments

这项研究表明,在动态环境训练的早期阶段,小鼠就会从反应式的无模型决策策略转向审慎的结构启发式决策策略,从而挑战了认为此类转变仅在大量练习后才会发生的传统观点。

原作者: Yasueda, M., Taira, M., Akam, T., Walton, M. E., Doya, K.

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Yasueda, M., Taira, M., Akam, T., Walton, M. E., Doya, K.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

在生物如何做出选择的广阔图景中,科学家长期以来一直将两种基本的应对世界的方式区分开来。一种方式是即时的、反应性的:动物学习到某个特定动作会导致奖励,并在不一定理解其运作原理的情况下重复该动作。这是一种习惯策略,建立在“做某事”与“得到好结果”之间的简单关联之上。另一种方式则是更具思考性和深思熟虑性的:动物构建了一幅关于世界结构的内部地图,理解一个事件如何导致另一个事件,以及不同的选择如何改变获得奖励的概率。这是一种规划策略,决策者利用对规则的理解来指导行为。多年来,研究人员一直认为,随着动物长期练习一项任务,它们会逐渐从这种深思熟虑的规划转向更简单的自动习惯。这种观点表明,随着足够的重复,大脑会停止计算,转而依赖肌肉记忆。

一个研究小组决定通过观察小鼠学习一项复杂的决策任务来测试这一假设,但其中有一个关键的转折点:他们观察的是学习过程的最开始阶段,而不是等待动物成为专家。小鼠被置于一种必须做出系列选择以寻找奖励的情境中。环境非常复杂;通往奖励的路径并不总是直截了当。有时,一个选择会如预期般直接导向下一步,但有时,路径会发生意想不到的转向。此外,路径尽头发现奖励的可能性并非固定不变,而是随时间变化,这迫使小鼠不断更新其预期。研究人员在小鼠进行训练的过程中密切观察它们的行为,追踪它们是在仅仅对过去的奖励做出反应,还是已经开始理解任务的隐藏结构。

结果揭示了一个挑战旧有观点的惊人模式。随着小鼠的练习,它们的行为发生了特定的变化,表明它们不仅仅是在形成习惯。当小鼠遇到路径发生意外转向的情况时,它们调整未来选择的方式,与路径符合预期时不同。这种行为的分歧是一个明确的信号,表明动物已经开始利用它们对任务结构的知识来指导决策。通过将不同学习风格的数学模型拟合到小鼠的行为中,研究人员发现,小鼠越来越多地依赖于一种利用这种结构性知识的策略。这种转变发生在训练过程的早期,远在小鼠进行大量任务练习之前。

这一发现表明,从简单的反应式学习到复杂的、基于结构的决策过程的转变,发生的时间比此前认为的要早得多。虽然早期的研究侧重于动物练习很长时间后发生了什么,通常得出结论认为大脑最终会停止思考并开始依靠自动驾驶,但这项新工作表明,大脑几乎在立即就开始构建关于规则的心理模型。小鼠并没有等到形成习惯才开始理解游戏;相反,它们迅速从仅仅依赖过去的奖励转向,开始利用它们对任务构成方式的理解来做出更好的选择。这证明了在规则和奖励不断变化的动态环境中,理解底层结构的能力是一种主要的生存工具,而大脑会很早就开始并频繁地运用这一工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →