← 最新论文
🤖 AI

Do Language Models Track Entities Across State Changes?

本文揭示,大型语言模型无法在连续操作中增量追踪实体状态,而是依赖一种非序列策略,该策略在查询令牌处聚合信息并利用脆弱的全球抑制机制进行移除,从而导致可预测的失效模式,这些模式可通过机制干预得到部分缓解。

原作者: Zilu Tang, Qiao Zhao, Gabriel Franco, Derry Wijaya, Aaron Mueller, Sebastian Schuster, Najoung Kim

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Zilu Tang, Qiao Zhao, Gabriel Franco, Derry Wijaya, Aaron Mueller, Sebastian Schuster, Najoung Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在和一个非常聪明但有点健忘的机器人玩“西蒙说”游戏。你告诉机器人各种物品藏在七个不同盒子里的位置。然后,你开始发出指令:“把表放进 1 号盒”、“从 2 号盒取出罐子”、“把苹果从 0 号盒移到 1 号盒”。最后,你问:"1 号盒里有什么?”

本文研究了现代人工智能语言模型(即“机器人”)如何应对这个游戏。具体而言,它提出了一个问题:机器人是随着指令的发出而持续维护一份关于所有物品位置的“实时清单”,还是等到最后才去推断结果?

以下是研究人员发现的成果,通过简单的类比进行解释:

1. 机器人并不维护“实时直播”

你可能会认为,随着机器人听到每一条指令,它会像 GPS 逐步更新你的位置一样,更新一份关于世界的心理地图。

  • 现实情况是:机器人更像是一个直到最后一分钟才开始复习的学生。它并没有随着故事的展开而构建一个完整的世界图景。相反,它会一直等到你提出最终问题("1 号盒里有什么?”)。只有在那一刻,它才会疯狂地扫描刚刚听到的整个故事,挑出与 1 号盒相关的具体句子,并当场计算出答案。它并不是逐步追踪世界的“状态”;它只是在最后时刻并行地检索必要的信息。

2. “添加”与“删除”的问题

研究人员观察了机器人如何处理两种特定类型的指令:PUT(添加物品)和REMOVE(移除物品)。

  • “PUT"操作(添加):这运作得相当好。当机器人听到“把表放进 1 号盒”时,它会使用标准的“回看”机制。它会找到"1 号盒”和“表”的提及,并将它们联系起来,就像人类将名字与面孔联系起来一样。这部分是可靠的。

  • “REMOVE"操作(删除):这是机器人变得怪异并犯错的地方。

    • 类比:想象你有一份派对宾客名单。如果你说“把约翰从名单中移除”,一个智能系统只会在那份特定名单上划掉约翰的名字。
    • 机器人的缺陷:这个机器人使用“全局橡皮擦”。当它听到“移除”这个词时,它不仅仅是在提到的那个特定盒子里划掉该物品。它会在该物品上贴上一个巨大的、看不见的“禁止预测”标签,无论该物品在哪里。它实际上是在告诉自己:“无论罐子在哪个盒子里,都不要再说出‘罐子’这个词。”

3. “白熊”效应

研究人员将这种“全局橡皮擦”与一个著名的心理技巧——“白熊问题”进行了比较。如果你告诉某人“不要想白熊”,他们反而会立刻开始想它。

  • 在机器人的案例中,“移除罐子”的指令产生了一个“抑制罐子”的信号。由于这个信号是全局的(应用于整个世界,而不仅仅是一个盒子),机器人有时会感到困惑。如果罐子在 2 号盒,而你问的是 1 号盒,机器人甚至可能会抑制“罐子”,尽管它一开始就不在 1 号盒里。

4. 预测并修复故障

由于研究人员理解了机器人思考的方式(即“机制”),他们甚至能在看到失败发生之前,就准确预测出它何时会失败。

  • 测试:他们创建了机器人未曾见过的棘手场景,例如:“罐子在 1 号盒。从 1 号盒移除罐子。现在,把罐子重新放回 1 号盒。”
  • 结果:由于机器人使用“全局橡皮擦”,它经常忘记把罐子放回去,因为“移除”标签仍在纠缠着“罐子”这个词。
  • 修复:研究人员尝试了一种“手术式”干预。他们在机器人做出猜测之前,手动擦除了其大脑内部的那个“全局橡皮擦”标签。这在许多情况下成功修复了错误,证明了“全局橡皮擦”确实是问题的根源。

核心结论

该论文得出结论:虽然这些人工智能模型在解决复杂谜题方面表现出色,但它们并非以人类的方式做到这一点。人类会在脑海中构建一个连续的故事。然而,这些模型将故事视为一个静态的事实库,只有在绝对必要时才会查阅。

此外,它们“删除”信息的方法是脆弱的。与其仔细编辑特定文件,它们倾向于给整个概念贴上“禁止使用”的标签,这导致在上下文变得复杂时出现错误。这项研究表明,通过理解这些内部的“机制”,我们可以预测机器人会在哪里跌倒,甚至可以在不重新训练整个系统的情况下修复其错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →