Developmental Trajectories of Situation Modeling and Mentalizing in Transformer Language Models
本文采用发展视角来证明,尽管大语言模型最终通过规模扩展和后训练获得了错误信念任务表现和情境建模能力,但这些心理化能力仍然是脆弱的,且易受非事实谓词等语言线索的影响,从而凸显了进行压力测试和发展性分析以实现稳健评估的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在看一个魔术表演:魔术师把一个球从盒子里移到了帽子里。看着表演的孩子知道球在帽子里。但如果问另一个没看到移动过程的人球在哪里,他们仍然会认为球在盒子里。
这就是心理学家所说的“心理理论”(mentalizing)的核心概念:理解他人拥有自己的想法和信念,而这些想法和信念可能与现实不同,也可能与你自己的想法不同。
这篇论文提出了一个简单的问题:人工智能语言模型(比如你正在聊天的这类模型)是真的理解了这个魔术,还是仅仅在瞎猜?
为了找出答案,研究人员并没有只看 AI 的最终回答。相反,他们观察了 AI 是如何像孩子一样“成长”的——从训练的最初阶段到它最终成熟的版本。他们采用了一种发展性的方法,追踪 AI 的技能是如何随时间变化的。
以下是他们的发现,通过日常类比进行了解释:
1. 成功的“两味配方”
研究人员测试了两个不同的 AI 模型家族:Olmo2(它阅读了海量的书籍)和 Pythia(它阅读的图书馆规模要小得多)。
他们发现,要让 AI 精通这个“魔术”(错误信念任务),AI 需要同时具备两样东西:
- 大容量大脑: 它需要一个规模较大的模型。
- 大量的阅读量: 它需要阅读大量的文本。
类比: 这就像烤蛋糕。如果你有一个巨大的烤箱(大模型)但没有面粉(训练数据不足),你就烤不出蛋糕。如果你有很多面粉但只有一个微型小烤箱(小模型),你也烤不出蛋糕。你需要既有大烤箱,又有充足的面粉,才能做出看起来像是真正理解了的结果。
2. “大器晚成者”
AI 并没有很早就学会这项技能。即使在阅读了数百万页内容之后,AI 仍然是在随机猜测。直到训练的最后阶段——即在它已经掌握了语法和事实之后——它才开始正确应对这个“魔术”。
类比: 想象一名学生花费多年时间背诵字典并学习如何写出完美的句子。只有在掌握了所有这些之后,他们才终于开始理解为什么故事中的角色在撒谎。这种“理解思想”的能力在 AI 的教育过程中出现得非常晚。
3. “脆弱”的理解
这里情况变得复杂了。AI 理解信念的能力非常脆弱。它就像一座纸牌屋,稍微吹口气就会倒塌。
研究人员发现,如果他们改变问题中的仅仅一个词——使用像 “认为”(thinks)这样的词(例如:“戴夫认为球在盒子里”)——AI 就会感到困惑,即使故事本身很简单。
类比: 想象一名学生可以完美地解决一道数学题。但是,如果把题目写在某种特定字体的纸上,他就能做对。如果把字体换成稍微不同的样式,他突然就忘了怎么做数学。AI 并不是在真正地“思考”角色的思想,它是在对像“认为”这样的特定词汇做出反应,仿佛这些词是某种神奇的触发器。
4. “场景构建者” vs. “读心者”
研究人员还测试了 AI 是否能构建一个“情境模型”(Situation Model)。这是一种高级的说法,其实是在问:AI 能记住故事的基本事实吗?(例如:“谁移动了球?”或“球最后停留在哪里了?”)
发现:
- 在学会理解思想(信念)之前,AI 先学会了记住事实(场景)。
- 然而,AI 对事实的记忆也是混乱的。当被问及那个实际移动了球的人(“反派/行为者”)时,AI 经常会感到困惑。它会搞混谁做了什么,尽管它刚刚在“读心”测试中成功猜中了位置。
类比: 想象一名侦探,他可以准确告诉你失窃车辆停在哪里(事实),也能猜出小偷对那辆车的想法(思想)。但如果问这名侦探:“是谁偷了车?”他就会感到困惑并指向错误的人。AI 的内部故事地图是不完整的;它能看到碎片,但并不总能将它们拼凑成一个连贯的整体。
核心结论
论文得出结论:虽然大型、经过充分训练的 AI 模型最终可以通过看似理解人类信念的测试,但这种能力是:
- 到来的较晚: 需要大量的训练才能发展出来。
- 脆弱的: 容易因细微的措辞变化而崩溃。
- 不连贯的: AI 对故事事实的理解与对角色思想的理解并不总是完美匹配。
总结: AI 并不一定像人类那样在“思考”他人的思想。相反,它似乎是在利用一系列习得的模式和捷径。这就像一只学会了在正确的时间说出正确话语的鹦鹉,但可能并未完全领悟其背后的深层含义。研究人员建议,要真正了解 AI 是否“聪明”,我们需要观察它是如何随时间学习的,并对其进行压力测试,而不仅仅是看它的最终得分。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。