← 最新论文
🧬 biology

Reason to Play: Behavioral and Brain Alignment Between Frontier LRMs and Human Game Learners

本文表明,前沿大型推理模型(LRMs)在匹配人类游戏行为以及预测新游戏学习过程中的大脑活动方面,均显著优于传统强化学习智能体,从而确立了它们作为复杂环境中人类学习与决策的更优计算模型的地位。

原作者: Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Botos Csaba, Sreejan Kumar, Austin Tudor David Andrews, Laurence Hunt, Chris Summerfield, Joshua B. Tenenbaum, Rui Ponte Costa, Marcelo G. Mattar, Momchil Tomov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正在教一群截然不同的学生如何玩一款全新且复杂的棋盘游戏。你有三类学生:

  1. “蛮力”学习者(深度强化学习): 这些学生尝试每一种可能的走法,失败数千次,并通过纯粹的重复慢慢记住规则。他们就像一只狗,每次正确坐下就能得到奖励,从而学会一个技巧。
  2. “逻辑谜题”解决者(贝叶斯智能体): 这位学生是一位类人的逻辑学家,他会写下所有可能的规则,像科学家一样测试它们,并在移动之前构建出关于游戏如何运作的完美理论。
  3. “超级阅读者”(大型推理模型或 LRMs): 这些是高级人工智能系统,它们几乎阅读了人类写下的所有内容。它们之前从未玩过这款特定的游戏,但它们可以观察棋盘,大声思考,并像人类一样几乎瞬间找出规则。

实验
研究人员想知道:这三类学生中,哪一类的思考和最像真实人类?

为了找出答案,他们不仅观察谁赢了游戏,还将真实人类放入核磁共振成像(MRI)机器(一种能拍摄大脑图像的巨大相机)中,让他们玩这些电子游戏。目标是看哪位 AI 学生的“思维过程”与人类大脑内部的实际电活动相匹配。

游戏:一个神秘盒子
所使用的游戏就像数字神秘盒子。玩家不知道规则。他们必须发现“如果我触摸红色方块,我就会死”,或者“如果我推动棕色盒子,它会打开一扇门”。这些游戏需要找出模式、做出猜测,并在猜测错误时改变这些猜测。

结果:“超级阅读者”获胜

  1. 行为(他们如何玩):

    • “蛮力”学习者表现糟糕。 他们需要玩数百万次游戏才能变得熟练。他们既缓慢又笨拙。
    • “逻辑谜题”解决者尚可,但有些僵化。
    • “超级阅读者”(LRMs)是明星。 它们像人类一样,只需几次尝试就学会了规则。它们解开游戏“谜题”的速度和效率,与核磁共振机器中的人类完全相同。
  2. 大脑扫描(思维的"X 光”):

    • 这是最令人惊讶的部分。当研究人员将 AI 内部的“思想”(其数字大脑活动)与人类大脑扫描结果进行比较时,“超级阅读者”实现了完美匹配
    • AI 的“思考”在视觉皮层(我们看东西的地方)和额叶皮层(我们规划事情的地方)的活动看起来几乎与人类大脑的活动完全一致。
    • “蛮力”学习者呢?它们的“思考”看起来与人类大脑毫无相似之处。这就像将计算器与人类思维进行比较。
    • “超级阅读者”预测人类大脑活动的准确度比其他 AI 模型高出 10 倍

“思考”与“行动”的意外发现
研究人员发现“超级阅读者”有一些奇怪之处。

  • 发现: 当它们正在找出规则时,它们非常像人类。
  • 执行: 一旦它们弄清楚了,有时就会陷入循环。如果它们找到了一条获胜路径,它们就会一遍又一遍地重演那条完全相同的路径,即使存在更短的路径。然而,人类一旦知道规则,会立即切换到更短、更高效的路径。
  • 启示: AI 的“大脑”(它如何表征游戏状态)非常像人类,但其“肌肉记忆”(它如何执行计划)却有点机械。

这为什么重要?
这篇论文表明,这些“超级阅读者”(大型推理模型)是第一批不仅人类那样行动,而且实际上人类那样思考的 AI 系统。

通常,AI 模型是专门为单一任务(如下棋)训练的。然而,这些模型仅通过阅读规则和观察屏幕,利用其训练中获得的知识就学会了游戏。这正是人类学习新事物的方式:我们利用自己的通用知识瞬间理解新情况,而不是从零开始。

总而言之
如果你想构建一个像我们一样理解世界的 AI,不要只教它记忆模式(像“蛮力”学习者那样)。相反,给它一个庞大的知识库,让它“大声思考”来解决问题。这篇论文表明,这种方法创造出的 AI 不仅像我们一样玩游戏,而且 literally 在我们大脑相同的部位点亮它的“大脑”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →