← 最新论文
🤖 AI

Small Foundation Models of Human Cognition and Behaviour

本文表明,虽然在人类行为数据上进行微调的小型基础模型可以有效地在分布内心理任务上达到与大规模基准模型相当的水平,但只有较大的模型才能显著提高对新颖任务结构的泛化能力,且其性能高度依赖于对特定刺激和反馈内容的处理,而非仅仅依赖于选择历史。

原作者: Nick Oh, Fernand Gobet

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Nick Oh, Fernand Gobet

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人如何像人类一样思考。几十年来,科学家们一直在构建微小的、手工打造的“精神机器”(如 ACT-R 或 Soar),试图一步步解释我们的大脑是如何做出决策的。但这些机器非常脆弱;如果稍微改变一下游戏规则,机器人就会崩溃。最近,一个新的想法占据了主导地位:与其从头开始构建一台精神机器,为什么不直接向一个巨大的、超级聪明的计算机大脑(大语言模型)喂入数百万个真实人类进行选择的案例呢?如果计算机能够预测人类下一步会做什么,也许它已经学会了人类思维的“规则”。这就是“认知代理”(cognitive proxies)的世界——即充当人类心灵替身的 AI 模型。但一个大问题仍然存在:这个巨大的大脑究竟是真的理解了游戏的“逻辑”,还是仅仅是一个模式匹配的高手,像一个只背下了答案解析而没读过教科书的学生那样,只会死记硬背捷径?

这篇题为《人类认知与行为的小型基础模型》的论文深入探讨了这个谜团。作者 Nick Oh 和 Fernand Gobet 决定测试一下,你是否真的需要一个拥有 700 亿参数的巨大“大脑”来模拟人类行为,或者一个更小的、“口袋大小”的模型是否也能做到这一点。他们训练了 14 个不同的 AI 模型,规模从极小的(1.35 亿参数)到庞大的(140 亿参数),使用的是一个名为 Psych-101 的海量数据集,其中包含了来自 160 个不同心理学实验的 1000 多万次人类选择。

以下是他们的发现,而且这有点像剧情反转。首先,他们发现,如果你只是观察 AI 已经见过的同类游戏,那么规模并没有你想象中那么重要。一个仅有 6 亿参数的微型模型,在预测熟悉的实验中的选择时,表现得几乎与 700 亿参数的巨型模型一样出色。这就像一只灵巧的小狗学习特定技巧的速度,与一只巨大的大丹犬一样快。然而,一旦他们给它们投喂一种“新类型”的游戏(分布外数据),规模的重要性就再次显现了出来。较大的模型在理解从未见过的游戏规则方面表现得更好,而较小的模型则会感到困惑。

但最令人兴奋的部分是这些模型是如何学习的。一些批评者担心,这些 AI 只是在依赖伪相关,即忽略了实际的游戏规则,而仅仅关注过去选择的历史(比如通过计算已经出现的牌数来猜测下一张牌)。为了测试这一点,作者玩了一场关于信息量的“捉迷藏”。他们系统性地移除了提示词的组成部分:他们隐藏了指令,模糊了游戏刺激物(图片或数字),抹去了反馈,甚至打乱了试验的顺序。

结果是戏剧性的。当他们模糊了游戏的实际内容(刺激物和反馈)时,模型的表现大幅下降,跌破了随机猜测的水平。这证明了模型不仅仅是在记忆序列化的答案;它们实际上是在关注游戏的“内容”。此外,在那些顺序并不重要的游戏中,当他们打乱试验顺序时,模型并不在意;但在那些顺序至关重要的游戏中,一旦打乱顺序,模型就会陷入混乱。这表明 AI 足以聪明到知道什么时候序列是有意义的,什么时候是没有意义的。

简而言之,这些经过微调的小型模型是优秀的“噪声天花板”(noise ceiling)估计器。把噪声天花板想象成一个玻璃天花板,限制了人类行为可预测性的上限。如果一个模型触及了这个天花板,意味着我们已经找到了数据中所有可预测的模式,剩下的误差仅仅是随机的人类“噪声”。这些小型模型表明,我们无需超级计算机也能触及这个天花板,但也提醒我们,这些模型在多大程度上有效,取决于它们所接受训练的游戏。它们是实验室里模仿人类行为的专家,但它们还不是关于人类思维运作的完整理论——它们是一面非常准确的镜子,但还不是照镜子的人本身。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →