← 最新论文
💻 computer science

PM-Bench: Evaluating Prospective Memory in LLM Agents

本文介绍了 PM-Bench,这是一个受 Virtual Week 范式启发、用于评估大语言模型智能体前瞻性记忆的文本基准测试,研究表明,即使是目前最先进的模型,在进行持续活动时也难以可靠地执行延迟意图,其最高 F1 分数仅为 65.1%。

原作者: Genglin Liu, Saadia Gabriel

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Genglin Liu, Saadia Gabriel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的数字助手,一个能浏览网页、编写代码并规划你一天的机器人管家。你会觉得它很完美,对吧?然而,有一个特定的故障会让即使是最聪明的助手也会栽跟头:前瞻性记忆(Prospective Memory)

用人类的话来说,前瞻性记忆是指在特定情况发生时,记住稍后要做某事的能力。这不仅仅是记住你要做什么,而是要记住在你在忙于其他事情的同时,在确切的时刻去做这件事。可以这样想:你告诉你的大脑,“当烤箱计时器响起时,把饼干拿出来。”但在等待的过程中,你被一段有趣的猫咪视频、一个电话以及突然想整理袜子冲动分散了注意力。一个好的大脑会记得鸣叫声并取出饼干。一个坏的大脑则会完全忘记鸣叫声,或者把饼干拿晚了五分钟,结果把它们烤焦了。

这正是 PM-Bench 论文所测试的内容。研究人员构建了一个名为“虚拟周”(Virtual Week)的游戏化世界,旨在观察 AI 智能体是否能够处理这种多任务处理记忆。

游戏:AI 的忙碌一周

研究人员创建了一个模拟的七天周,AI 智能体必须在其中生活。在每一步中,智能体都在做一些琐碎的事情,比如做早餐或检查邮件。但在背景中隐藏着“延迟意图”——即那些被告知稍后要执行的任务。

有些任务很简单:“当你看到邻居挥手时,吃药。”(这是一个基于事件的任务)。
有些任务很棘手:“晚上 9:00 吃药。”(这是一个基于时间的任务)。
还有一些任务很隐蔽:“在预订预约之前,先检查邮件门户是否有新消息。”智能体必须知道去检查邮件,即使没有人提醒它。这被称为主动监测(proactive monitoring)

关键在于,智能体不能只是坐在那里等待。它必须在一天中不断移动,做出诸如“倒咖啡”或“烤面包”之类的选择,同时还要留意那些隐藏的线索。如果它错过了线索,它就失败了。如果它记住了线索但在错误的时间执行了任务,它也失败了。如果它变得过于疑神疑鬼,在任务还没到时间就开始执行,它同样会失败。

结果:即使是最好的 AI 也会烤焦饼干

研究人员在游戏中测试了八种不同的超高级 AI 模型(包括像 GPT-5.4 和 Llama 3.3 这样的巨头)。他们尝试了各种技巧来帮助 AI 记忆:

  • “待办事项清单”技巧: 给 AI 一个数字笔记本,让它记录下任务。
  • “心跳”技巧: 强制 AI 每隔 30 或 60 分钟暂停一次,询问:“嘿,现在该做什么了吗?”
  • “团队协作”技巧: 将 AI 分解为一个“老板”和三个“工人蜂”,每个角色负责观察不同的线索。

这里有一个巨大的惊喜:没有任何一种技巧对所有人有效。

表现最好的设置是带有可选“心跳”(自我检查提醒)的单智能体。即便有了这种帮助,顶尖模型 GPT-5.4 也仅达到了 65.1% 的得分(通过名为 Set-F1 的指标衡量)。这意味着它仍然漏掉或搞砸了大约 35% 的任务。

论文明确排除了“更多记忆”或“更大的大脑”会自动解决问题的观点。仅仅因为一个 AI 能读完一整个图书馆,并不意味着它能记得在垃圾桶满了的时候把垃圾拿出去。研究人员发现:

  • 过多的提醒往往会适得其反: 当他们强制 AI 每 30 分钟进行一次“心跳”检查时,AI 开始过早或过于频繁地执行任务。它变得“刷屏”了,在任务还没到时间时就急于抓取任务。这降低了它的得分,因为它变得过于激进。
  • 团队协作没能救场: 多智能体团队(老板和工人)请求信息的需求量远高于单智能体(超过 1,600 倍!),但它们的整体得分却更低。它们擅长寻找线索,但在决定何时采取行动方面表现糟糕。
  • “隐藏频道”问题: 最难的任务是那些 AI 必须在没有被告知的情况下,检查某个隐藏频道(如特定的电子邮件或物流追踪器)的任务。表现最好的模型也只能完成大约 10% 的此类任务。如果线索不在 AI 阅读的故事内容中,AI 通常不知道要去寻找它。

这意味着什么(以及不意味着什么)

论文指出,前瞻性记忆是一项独特的技能,目前的 AI 并不擅长此道。这不仅仅是关于“忘记”过去,而是关于无法在正确的时刻对未来采取行动。

作者谨慎地表示,这是基于模拟的。他们构建了一个受控的测试平台来诊断这些失败,而不是说 AI 已经准备好独立运行医院或驾驶飞机。事实上,他们警告说,如果一个 AI 在没有完美控制的情况下变得过于擅长“主动”提醒,它可能会开始唠叨你,或者做一些你并不想让它做的事情。

因此,虽然我们的数字助手在规划和编程方面变得越来越聪明,但它们在“记住去记住”这一人类艺术方面仍然感到吃力。它们可能知道要做什么,但往往忽略了何时去做。在我们弄清楚如何解决这个问题之前,即使是最先进的 AI,也可能在你观看猫咪视频时把饼干烤焦。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →