← 最新论文
💻 computer science

What Must Generalist Agents Remember?

本文阐明了通用智能体必须将领域相关信息存储在记忆中,以消除观测歧义并重构转移动力学,从而证明了仅依靠当前状态观测无法在多种多样环境中实现近乎最优的性能。

原作者: Khurram Yamin, Namrata Deka, Maitreyi Swaroop, Albert Ting, Jeff Schneider, Bryan Wilder

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Khurram Yamin, Namrata Deka, Maitreyi Swaroop, Albert Ting, Jeff Schneider, Bryan Wilder

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名为一家在两个不同城市——城市 A城市 B 运营的公司工作的快递员。你在开始轮班时并不知道自己身处哪个城市,你只能看到眼前的路牌和交通灯。

这里有一个转折:在两个城市中,你都会到达同一个著名的路口(我们称之为**“分叉口”**),那里有一个指向“向上”和“向下”的标志。

  • 城市 A,如果你想去“向上”的目的地,你必须在分叉口向转。
  • 城市 B,如果你想去“向上”的目的地,你必须在分叉口向转。

街道标志看起来完全一样。唯一的区别在于你当前所处城市的隐藏规则。

问题:“失忆症”司机

如果你是一名没有记忆(只看眼前路况)的司机,你就陷入了困境。当你看到“分叉口”标志时,你根本不知道自己是在城市 A 还是城市 B。

  • 如果你猜“向上”,你在城市 A 会成功,但在城市 B 会失败。
  • 如果你猜“向下”,你在城市 B 会成功,但在城市 A 会失败。
  • 如果你试图两者兼顾或者抛硬币决定,你会在两个城市都失败。

论文指出,要成为一个通用智能体(即能够在不知道自己处于哪个城市的情况下,在两个城市中都能成功的司机),你必须拥有记忆。你不能仅仅对眼前看到的景象做出反应;你必须记住在到达分叉口之前发生了什么。

两大发现

该论文通过数学证明了关于这种记忆必须具备什么的两个具体特性:

1. “身份证”规则(分离性)

主张: 如果两个不同的世界(城市)要求你在完全相同的地点做出相反的选择,那么你的内部记忆对于这两个世界来说必须是不同的。
类比: 想象你的记忆是一个背包。

  • 当你在城市 A 并到达分叉口时,你的背包里必须装有一张特定的“城市 A 身份证”。
  • 当你在城市 B 并到达分叉口时,你的背包里必须装有一张“城市 B 身份证”。
  • 如果你的背包在两个城市里看起来都一样,你就无法区分它们,并且会转错方向。
    论文的证明: 作者证明,如果一个智能体足够聪明,能够近乎完美地完成工作,那么它的记忆会自动分离这两种场景。这不是一种选择,而是一种数学上的必然。如果记忆不能实现分离,智能体就无法取得成功。

2. “地图重建器”规则(解码性)

主张: 如果你的记忆足够好,能够帮助你预测许多不同目标下的最佳下一步行动,那么该记忆本身就包含了足以重建世界运作方式的信息。
类比: 想象你正在试图弄清楚一款电子游戏的规则。

  • 你不知道规则,但你有一个“目标列表”(例如:“到达城堡”、“到达巨龙”、“到达宝藏”)。
  • 论文表明,如果你的记忆能帮助你搞清楚所有这些不同目标的最佳行动,那么你的大脑就已经隐式地学习了世界的“物理规律”。
  • 你可以利用这段记忆来绘制一张地图:“如果我在这里向上走,我会到达那里。”
    论文的证明: 他们展示了,如果你的记忆可以预测“探测”目标(简单的测试)的价值,那么你就可以在数学上逆向工程出环境的转换规则(地图)。你的记忆不仅仅是过去事件的列表;它是一个关于世界如何变化的压缩模型。

实验:“分叉世界”(ForkWorld)

为了测试这一点,研究人员构建了一个简单的电子游戏,名为“ForkWorld”。

  • 设置: 一个机器人沿着走廊行走直到一个 T 形路口。
  • 陷阱: 有时“向上”按钮会让机器人向上移动,有时会让机器人向下移动。机器人并不知道自己处于哪种版本。
  • 测试: 他们训练了不同的机器人:
    • 失忆机器人: 只能看到当前位置。它们表现得很糟糕(成功率约为 20%),因为它们无法区分不同的城市。
    • 记忆机器人: 可以记得最后几步。它们学会了观察自己的历史记录,意识到“啊,我在被反转过的城市里”,然后向正确的方向转弯。它们的成功率达到了约 88%。
  • 验证: 研究人员窥视了“记忆机器人”的大脑。他们发现,当机器人到达 T 形路口时,其内部状态取决于它处于哪个城市,两者完全不同。此外,他们可以使用这种内部状态来准确预测如果机器人采取特定行动会发生什么,从而有效地“解码”了地图。

底线结论

这篇论文回答了一个基本问题:一个聪明、通用的 AI 需要记住什么?

它得出结论:记忆不仅仅是一个用来记住过去的“加分项”。它是让智能体实现以下目标的核心纽带

  1. 在表面看起来完全相同的情况下,分辨出不同的世界
  2. 重建这些世界的规则,以便进行提前规划。

如果没有这种特定类型的记忆,智能体就无法成为真正的通用智能体;它将陷入猜测与失败的循环,每当世界的隐藏规则发生变化时,它都会束手无策。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →