← 最新论文
💬 NLP

One Success Isn't Reliability: Thinkingbox, a Sandbox and Benchmark for Agents in Stateful Business Workflows

本文介绍了 Thinkingbox,这是一个旨在通过衡量 AI 智能体在执行具有正确持久状态转换的复杂多轮任务时的可靠能力,来评估其在有状态业务工作流中表现的沙盒与基准测试,并揭示了在 507 个基于策略条件的场景中,偶尔的成功与持续的可靠性之间存在显著差距。

原作者: Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuochun Li, Youngmin Ko, Ali Keramati, Nicola Ferri, Susana Palmaz Lopez Pelaez, Liang-Chun Tsai, Calvin Wang, Mirco Milletari, Tuhin Kundu, Vadim Smolyakov, Kjartan Olafsson, Tommy Guy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,新一代被称为“智能体”(agents)的计算机程序已经涌现。与仅仅是回答问题或编写文本的早期聊天机器人不同,这些智能体旨在采取行动。它们可以浏览网页、运行软件代码或调用数字工具来执行任务,就像人类员工一样。多年来,研究人员通过要求这些智能体解决具有明确且易于检查答案的问题来测试它们,例如修复一行损坏的代码或在网站上寻找特定的事实。在这些领域,成功的衡量标准是智能体是否产生了正确的最终输出或有效的指令。然而,现实世界的商业环境很少如此简单。在企业办公室中,工作通常涉及一系列长链条事件,其中计算机系统必须被正确更新,政策必须得到遵守,且数据库的状态必须以特定方式发生变化。如果智能体在过程的中途犯错,或者更改了错误的记录,其后果可能是真实且代价高昂的。这项技术的未来,关键问题不仅在于智能体能否找到一次成功的路径,而在于它能否可靠地、每一次都做到这一点,而不造成意外的损害。

来自匹兹堡大学、西北大学、加州大学欧文分校和微软的研究小组构建了一个新的测试场来回答这个问题。他们创建了一个名为 ThinkingBox 的数字环境,作为一个安全的、隔离的沙盒,让这些 AI 智能体能够与模拟用户和复杂的业务工具进行交互。在这个沙盒中,智能体被赋予了现实的任务,例如处理在线订单的退款、更改酒店预订、更新保险理赔或处理员工的 IT 支持请求。该环境旨在模拟办公室工作的混乱现实,即信息往往是不完整的,规则是严格的,且每一次行动都会在数字记录上留下永久的痕迹。研究人员不仅要求智能体进行对话,还要求它们实际改变系统的状态。为了确保测试公平且可重复,沙盒在每次尝试后都会完全重置,确保两次试验之间不会共享相同的数据或隐藏的历史记录。

随后,研究人员在这个环境中填充了分布在五个不同行业的 507 个独特任务:零售、旅游与酒店、汽车保险、银行业和咨询业。他们邀请了包括来自主要科技公司的专有系统和开源模型在内的各种最先进的人工智能模型来尝试完成这些任务。每个模型都有二十次机会来解决每个问题。评估过程非常严格。一个智能体并不仅仅因为给出了礼貌的回答或执行了一个看起来正确的工具调用就判定为通过。相反,系统会将最终结果与要求的预期结果进行对比。退款是否真的出现在了数据库中?酒店房间是否被正确标记为已更改?保险理赔是否在没有误改其他客户保单的情况下得到了更新?系统还会检查“附带影响”,这意味着它会查看智能体是否意外更改了它不应该触碰的内容,这是现实世界软件中常见且危险的错误。

结果显示,智能体偶尔能做到的事情与它们能够可靠完成的事情之间存在显著差距。表现最好的模型在第一次尝试时能正确解决任务的比例约为 65%。虽然这听起来令人印象深刻,但当研究人员观察可靠性时,情况发生了变化。当他们检查一个模型在所有二十次尝试中都能成功解决任务的频率时,这一数字大幅下降至仅为 25%。这意味着,虽然一个聪明的智能体如果给予足够多次尝试,往往能偶然找到成功的路径,但它无法在不犯错的情况下持续重复这种成功。研究人员发现,许多失败并非由于智能体无法理解请求或无法与用户交流。相反,最常见的问题是智能体在工具返回错误消息时无法恢复,或者它们在错误的数据上执行了正确的动作。例如,一个智能体可能会成功调用工具来更新记录,但将更改应用到了错误的客户身上,或者它可能在完成必要步骤之前停止了进程,导致系统处于损坏状态。

研究还强调了不同的模型在处理不同类型的任务时表现各异。有些模型在处理零售订单方面表现出色,但在处理复杂的保险政策或银行法规时表现较差。这表明,某一领域的卓越表现并不保证智能体在另一领域也是可靠的。研究人员观察到,即使智能体向用户发送了一条听起来完美的最终消息,底层的数据库往往仍未改变或已被损坏。这一发现挑战了目前许多系统的评估方式,这些系统往往关注对话质量或工具调用的有效性,而非实际的结果。论文得出结论,要让人工智能在具有重要意义的商业工作中获得信任,它必须超越仅仅找到一次成功的路径,并学会以一致且可重复的精准度来执行该路径。ThinkingBox 沙盒及其基准测试现已向公众开放,为衡量这些数字员工是否真正准备好进入现实世界提供了一个新标准。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →