← 最新论文
🧬 biology

Brain alignment of reasoning and action representations from vision-language and action models during naturalistic gameplay

本研究证明,在自然主义游戏过程中,针对动作(LAMs)与推理(VLMs)对基础模型进行微调会导致截然不同的脑对齐模式,其中 LAMs 在前额叶 - 运动区域表现出不对称的、动作特异性的表征,而两种模型均优于强化学习基线,且其增益随皮层处理层级呈比例增长。

原作者: Subba Reddy Oota, Anant Khandelwal, Khushbu Pahwa, Satya Sai Srinath Namburi, Tanmoy Chakraborty, Bapi S. Raju, Manish Gupta

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Subba Reddy Oota, Anant Khandelwal, Khushbu Pahwa, Satya Sai Srinath Namburi, Tanmoy Chakraborty, Bapi S. Raju, Manish Gupta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ⚕️ 这是一篇未经同行评审的预印本的AI生成解释。这不是医疗建议。请勿根据此内容做出健康决定。 阅读完整免责声明

想象一下,你正看着一群人玩一款经典的街机电子游戏(比如《吃豆人》或《太空侵略者》),而他们身处一台巨大的核磁共振(MRI)机器内部。这台机器就像一台超灵敏的相机,每隔几秒钟就为他们的大脑拍一张照片,显示出当他们看到屏幕、思考下一步行动并按下按钮时,大脑的哪些部位被点亮。

本文的目标是探究现代人工智能计算机在“思考”这款游戏时,其方式是否与人类大脑的运作方式相似。

以下是这项研究的分解,使用了简单的类比:

1. 参与者:三种类型的“心智”

研究人员比较了三种不同类型的“心智”在理解这款游戏时的表现:

  • 老式机器人(RL 基线): 这些是传统的智能体,仅通过试错训练以获胜为目标。它们就像为了得到奖励而学习按压杠杆的狗;它们知道做什么,但并不真正“理解”游戏世界或规则。
  • 通用观察者(VLMs): 这些是现代人工智能模型(视觉 - 语言模型),它们阅读过互联网并观看过数百万个视频。它们就像非常聪明的游客,能够描述游戏、解释规则并谈论图形,但它们未必经过专门训练以完美地玩这款游戏。
  • 行动专家(LAMs): 这些与通用观察者类似,但它们经过专门“微调”或训练,掌握了海量关于如何控制计算机和玩游戏的數據。它们就像职业玩家,将操作练习到了肌肉记忆的程度。

2. 实验:“提示”技巧

研究人员并没有仅仅让 AI 观看屏幕。他们给出了具体的指令,或称“提示”,以观察这如何改变它们的思考:

  • “行动”提示: “你下一步要做什么,为什么?”(侧重于行动)。
  • “推理”提示: “游戏中正在发生什么,目标是什么,威胁是什么?”(侧重于理解)。

随后,他们将 AI 内部的“思维”(数字表征)与人类大脑扫描结果进行对比,以查看哪种 AI 与人类大脑更匹配。

3. 重大发现

发现 A:新 AI 与人类更接近
“老式机器人”表现尚可,但现代 AI 模型(包括通用观察者和行动专家)在匹配人类大脑活动方面要好得多

  • 类比: 想象一下试图猜测人类在想什么。老式机器人基于简单模式进行猜测。新 AI 则基于对故事、物体和目标的丰富理解进行猜测。新 AI 的“猜测”与人类大脑的实际活动匹配度要高得多。

发现 B:“思考”的增强发生在“规划”脑区
当研究人员使用“行动”或“推理”提示时,AI 与人类大脑的匹配度变得更高。但这种提升并非处处均等。

  • 类比: 将大脑想象成一座城市。“早期视觉皮层”是前门,人们首先在这里看到游戏。“额顶叶”区域则是市政厅,负责规划和决策。
  • 提示帮助 AI 在“市政厅”(规划/决策区域)与人类大脑的匹配度提高了两倍,而在“前门”(视觉区域)的提升则较小。这表明,当人类玩游戏时,他们不仅仅是在看像素;他们深度参与了规划和推理,而 AI 模型在被要求对此进行思考时,最能捕捉到这一点。

发现 C:“对称”与“不对称”的惊喜
这是最有趣的发现。尽管通用观察者(VLM)和行动专家(LAM)在整体预测大脑活动方面同样出色,但它们实现这一点的途径却截然不同。

  • 通用观察者(VLM)是平衡的: 当你要求它进行“推理”或“行动”时,它在两者上投入的“脑力”大致相等。它就像一把瑞士军刀,无论是开瓶还是割绳,表现同样出色。
  • 行动专家(LAM)是有偏见的: 当你要求行动专家进行“推理”时,它实际上很难提供新的价值。似乎其“行动”训练已经吸收了如此多的信息,以至于单独要求它进行“推理”变得多余。
  • 类比: 想象行动专家是一位背熟了整本食谱的厨师。如果你问他们:“你需要什么食材?”(推理),他们只是重复他们已知的烹饪知识(行动)。他们大脑中的“推理”部分变得多余,因为他们的“行动”训练已经涵盖了这些内容。在人类大脑中,这表现为行动专家的“推理”信号实际上干扰了大脑规划区域的预测。

发现 D:“思考”的痕迹较弱
研究人员还观察了一种新型 AI,它会“大声思考”(在回答前生成思维链)。令人惊讶的是,生成“思考”文本的 AI 部分,与人类大脑的相似度低于仅给出最终答案的部分。

  • 类比: 这就像看着某人解拼图。他们做出的最终动作与人类移动手部的方式相匹配。但在解题过程中他们内心的独白(“嗯,也许我应该试试这个……")与人类大脑活动的匹配度,不如最终决策那么高。

总结

该论文表明,现代 AI 模型在模拟人类在游戏中思考和规划的方式方面正变得更为出色。然而,仅仅让 AI 更擅长事情(行动)会以一种特定的方式改变其内部结构:它使“推理”和“行动”重叠如此之多,以至于在大脑的规划中心变得无法区分。这有助于科学家理解,虽然 AI 和人类可能达到相同的“分数”(预测准确率),但它们内部“大脑”的组织方式可能存在根本性的差异。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →