← 最新论文
💬 NLP

AppWorld-UL: Benchmarking Diverse Agent-User Interactions for Tool-Use

本文介绍了 AppWorld-UL,这是一个包含九个模拟应用程序中 516 个任务的具有挑战性的基准测试,旨在评估工具使用型智能体处理与用户进行多样化且必要交互的能力,并揭示了即使是目前最先进的模型在这些用户在环(user-in-the-loop)场景中也面临着显著的困难。

原作者: Junzhi Chen, Harsh Trivedi, Jane Pan, Michael JQ Zhang, Tejas Srinivasan, Niranjan Balasubramanian, Ashish Sabharwal

发布于 2026-07-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Junzhi Chen, Harsh Trivedi, Jane Pan, Michael JQ Zhang, Tejas Srinivasan, Niranjan Balasubramanian, Ashish Sabharwal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个超级聪明的机器人管家如何帮你跑腿。你对它说:“去给我买件衬衫。”在计算机科学的世界里,这被称为“工具使用”(tool use)——机器人知道如何打开应用、点击按钮并完成购买。但问题在于:现实生活是混乱的。如果你的购物车里有五件衬衫,而机器人不知道你指的是哪一件怎么办?如果机器人想要的衬衫卖完了怎么办?如果价格突然翻倍,而只有在你明确表示“可以接受”这种特定变化的情况下你才会购买,那又该怎么办?

大多数针对这些机器人的测试只检查它们是否能遵循一个完美的、步步为营的食谱,且过程中不出任何差错。但现实中的人类是不可预测的。我们会表达得含糊其辞,我们会改变主意,而且在机器人花我们的钱之前,我们需要被征求许可。这篇论文进入了人工智能研究中这个混乱的现实世界角落,提出了一个简单但棘手的问题:当情况变得复杂时,我们最优秀的 AI 智能体(agents)真的能与我们交谈吗?还是说,一旦指令不够完美,它们就会直接崩溃?

由 Junzhi Chen 和 Harsh Trivedi 领导的研究团队决定不再在完美的、虚构的一天里测试机器人,而是开始在感觉像真实生活的一天里测试它们。他们构建了一个新的游乐场,名为 AppWorld-UL(用户在环/User-in-the-Loop)。把它想象成一个巨大的、模拟的数字城市,拥有像 Amazon 和 Spotify 这样九个热门应用,但有一个转折:其中的“用户”(一个模拟的人)是游戏的一部分,而机器人必须学会如何向他们寻求帮助。

团队并不仅仅是编造随机的问题;他们使用了一种巧妙的“扰动”(perturbation)方法。想象一下,他们拿了一个正常的任务,比如“退掉我上周买的那件 Nike 衬衫”,然后秘密地微调了这个世界,使其变得棘手。

  1. “哪一件?”陷阱(信息不足): 他们确保机器人发现了两件来自上周的 Nike 衬衫。现在机器人不能直接猜测了;它必须停下来并询问:“您想退掉哪一件?”
  2. “没了!”陷阱(不可行性): 他们让衬衫的“大码(Large)”尺寸从商店中消失了。机器人不能仅仅是失败;它必须告诉用户:“大码已经没了。您想要其他尺码还是退款?”
  3. “等等,太贵了!”陷阱(确认): 他们让衬衫的价格翻了一倍。机器人必须停下来并说:“嘿,价格跳涨了!您还要买吗?”

为了确保测试公平,他们创建了一个“模拟用户”,这个用户表现得像真实的人一样,但遵循严格的规则。这个用户知道这些棘手问题的答案,但除非机器人问出“正确的问题”,否则不会轻易透露。这就像是一场“二十个问题”的游戏,只有当你问出正是他们所想的内容时,用户才会回答。

当他们把世界上最聪明的 AI 机器人(如 Claude Opus 4.7 和 GPT-5.5)放入这个混乱的数字城市时,结果有点像是一个警钟。即使是最优秀的机器人,在整个任务集上的成功率也仅为 48.6%。当任务变得更加困难,即同时结合两个或三个这类棘手情况时,成功率下降到了仅有的 35.7%

这项研究表明,问题不在于机器人是否会使用应用;它们其实非常擅长点击按钮。真正的挣扎在于对话。当研究人员预先给机器人一份包含所有缺失信息的“小抄”(这样它们就不必询问用户)时,成功率跃升至 78.1%。这证明了难度来自于需要进行交互,而不是应用本身的复杂性。

论文还发现,当机器人失败时,通常是因为它们没有问出正确的问题。它们要么是在猜测答案(产生幻觉),要么是提出了模糊的问题导致用户困惑,要么是忘记了用户刚刚告诉它们的内容。这就像一个机器人听到了“我要红色的衬衫”,但随后却买了一件蓝色的,因为它忘了去核实。

简而言之,这篇论文表明,虽然我们的 AI 智能体在执行任务方面正变得越来越出色,但它们仍在学习如何成为优秀的对话伙伴。它们需要明白,有时候解决问题的最佳方式不是冲上前去,而是停下来,看着人类,并问道:“等等,您指的是哪一个?”在它们掌握这种来回互动的舞步之前,它们可能已经准备好去进行简单的买菜任务,但还没准备好应对真实人类日常生活的混乱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →