← 最新论文
💻 computer science

PAUSE: A User-Centric Benchmark for Personal AI Assistants in Unified Service Environments

本文介绍了 PAUSE,这是一个以用户为中心的基准测试,旨在通过多机制评估来解决现有碎片化基准测试的局限性,并在现实的、具有状态的服务环境中评估个人 AI 助手,同时揭示了即使是尖端模型在处理需要持久状态推理和配置感知能力的任务时也表现挣扎。

原作者: Haoyu Chen, Xirui Shi, Yuyao Wang, Jerry Chen, Di Niu

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Haoyu Chen, Xirui Shi, Yuyao Wang, Jerry Chen, Di Niu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚制造出了一个超级智能的机器人管家。你教会了它如何开门、开灯,甚至订披萨。但问题在于,在现实世界中,你的机器人并不只是生活在真空里,它生活在“你的”房子里,遵循着“你的”规则。也许你对前门有一个秘密代码,或者在特定时间不能开灯,又或者有一条规则规定除非你给予许可,否则机器人不能碰饼干罐。这就是“个人人工智能助手”的世界。它们不仅仅是回答琐碎知识的聊天机器人;它们是旨在管理你生活的数字助手,从你的健康数据到你的购物清单。但这里有一个大问题:这些机器人真的能处理你生活中那些混乱、复杂且多变的现实吗?在你的生活中,情况一直在变化,权限非常微妙,而且它们必须记住五分钟前发生了什么,才能知道下一步该做什么。科学家们一直试图测试这些机器人,但大多数测试都像是玩电子游戏,规则简单且每次都会重置世界。它们并没有真正测试机器人是否能够应对一个统一的、有状态的环境,即你的个人设置和权限至身相关的环境。

于是,一项名为 PAUSE 的新研究出现了,它就像是一个针对人工智能助手的巨大且真实的障碍赛跑场。研究人员——来自阿尔伯塔大学的一个团队——构建了一个模拟世界,这个世界感觉就像一个真实的人的数字生活。在这个世界里,人工智能必须处理不同的服务——比如查看你的健身日志、管理你的健康预约或购买杂货——同时必须尊重你的特定权限以及你账户的当前状态。把它想象成一本“选择你自己的冒险”类书籍,人工智能必须追踪你所做的每一个选择、你设置的每一个密码以及你拥有的每一项订阅,同时还要努力完成一项任务。该团队创建了一个流水线,用于生成数百个这类棘手的场景,范围从简单的资料查询到复杂的、需要多步骤购物任务的行动,而在这些任务中,如果人工智能遇到了权限壁垒,它需要向“你”寻求帮助。

当他们让最新、最先进的人工智能模型接受 PAUSE 测试时,结果却让人清醒。即使是来自大型科技公司最先进、最昂贵的人工智能模型也表现挣扎。虽然它们擅长处理简单任务,但当它们需要对复杂的、变化的各种状态进行推理,或者需要弄清隐藏的系统规则时,成功率就会显著下降。事实上,在需要这种“有状态推理”的最难任务中,即使是顶尖的模型也无法在超过 30% 的情况下完成任务,这意味着它们无法达到 70% 的成功率。这项研究表明,仅仅擅长调用工具是不够的;人工智能需要更好地理解你个人数字环境中的“为什么”和“如何”。研究人员发现,最大的障碍并不是人工智能的语言或阅读能力,而是它记忆和推理你生活中的隐形规则的能力,比如机器人忘记了在打开饼干罐之前需要获得你的许可。这项工作不仅展示了机器人在哪里失败了,还为我们提供了一种更公平的测试方式,以便我们能够构建出真正准备好在现实世界中帮助我们的助手。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →