← 最新论文
📄 animal behavior and cognition

Reward predictability shapes decision making states and exploitative control in marmosets

本研究建立了一个用于狨猴的自动化、非侵入式居家笼平台,并利用强化学习建模来证明,奖励的可预测性能够重构行为状态,从而在决策过程中强化误差修正并提升开发性控制。

原作者: Mastro, K. J., Stanwicks, L., Schoenbeck, E., Melain, A., Johnson, M., Sabatini, B. L., Stevens, B.

发布于 2026-07-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Mastro, K. J., Stanwicks, L., Schoenbeck, E., Melain, A., Johnson, M., Sabatini, B. L., Stevens, B.

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正在森林中漫步,寻找最美味的浆果。有时,你非常清楚最好的果丛在哪里,所以你会坚持走那条路并不断采摘(这就是利用/Exploitation)。其他时候,你可能会走到别处去看看,以防那里藏着一个甚至更好的果丛(这就是探索/Exploration)。

这篇论文是关于狨猴(一种聪明且在某些方面与人类基因相似的小型社交类猴子)如何弄清楚何时该坚持已知,以及何时该尝试新事物。

以下是研究人员所做的工作及发现的简单化叙述:

1. 猴子的新“健身房”
以前,研究这些猴子如何做决策是很困难的。这通常需要将它们带离家园,限制饮水以使其渴望奖励,并在短时间、高压力的状态下进行测试。
研究人员在猴子自己的生活笼舍内建造了一个全新的、自动化的“健身房”。它就像一个高科技触摸屏游戏机,猴子可以随时随地、根据自己的意愿进行游戏,而不会感到压力或受到饮水限制。这让研究人员能够长期观察猴子自然的决策习惯。

2. 训练游戏
猴子在屏幕上玩了一系列游戏:

  • 反转学习(Reversal Learning): 想象一个游戏,起初红色按钮总是会给出奖励,但突然间规则改变了,变成了蓝色按钮提供奖励。猴子必须学会切换它们的策略。
  • “双臂强盗”游戏(The "Two-Armed Bandit"): 这是最后一个也是最难的测试。它就像一台带有两个拉杆的老虎机。有时其中一个拉杆给奖的频率更高,但规则很复杂且会随机变化。没有任何提示或线索告诉它们哪个拉杆更好;它们必须通过尝试来自己摸索。

3. 猴子的思维方式(“心理模式”)
研究人员使用计算机模型来理解猴子的脑部运作。他们发现,猴子并不只是进行随机选择;它们会在两种截然不同的“心理模式”之间切换:

  • “坚持到底”模式(利用/Exploitation): 当猴子充满信心时,它会坚持选择那个通常奏效的选项。
  • “尝试一切”模式(探索/Exploration): 当猴子感到不确定时,它会开始测试不同的选项,以收集新的信息。

4. 重大发现:可预测性改变了游戏规则
最有趣的发现是关于奖励的可预测性

  • 当世界是可预测的(确定性/Deterministic): 如果选错总是意味着没有奖励,猴子会立即意识到自己的错误。这就像灵光一现,它们纠正路径的速度非常快。
  • 当世界是不可预测的(概率性/Probabilistic): 如果选错有时仍能靠运气获得奖励,猴子意识到自己犯错的速度就会变慢。

研究表明,当环境是可预测的时,猴子会花更多时间处于“坚持到底”模式,并且纠正错误的效率更高。当环境混乱且不可预测时,它们会花更多时间在“尝试一切”模式中徘徊。

总结
这篇论文为我们提供了一种观察猴子如何学习和决策的新方法。它表明,它们的脑中拥有用于探索和利用的特定“开关”,而环境规则的清晰程度(可预测 vs 随机)完全改变了它们如何拨动这些开关。这是理解一个与我们非常接近的物种之智能决策机制的一份蓝图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →