← 最新论文
💬 NLP

Agent-Diff: Benchmarking LLM Agents on Enterprise API Tasks via Code Execution with State-Diff-Based Evaluation

本文提出了 Agent-Diff 框架,通过结合企业级 API 的真实接口与容器化沙箱环境,并采用基于状态差异(State-Diff)的评估契约,实现了对大语言模型代理在代码执行任务中表现的可控且生态有效的基准测试。

原作者: Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson

发布于 2026-03-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Hubert M. Pysklo, Artem Zhuravel, Patrick D. Watson

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Agent-Diff 的新工具,用来测试人工智能(AI)助手在处理真实世界办公任务时的能力。

想象一下,你正在招聘一位超级智能的“数字秘书”。你想知道他/她是否真的能帮你搞定工作,比如整理文件、安排会议或管理项目,而不仅仅是嘴上说说。这篇论文就是为了解决“如何公平、准确地测试这位秘书”的问题而诞生的。

以下是用通俗易懂的语言和生动的比喻对这篇论文的解释:

1. 核心难题:怎么测试 AI 秘书?

以前测试 AI 就像是在模拟驾驶

  • 旧方法 A(纯模拟): 给 AI 一个假的、完全受控的虚拟环境。这很安全,但就像在模拟器里开车,AI 可能表现很好,但一上真路(真实软件)就晕头转向。
  • 旧方法 B(真车测试): 让 AI 直接操作真实的软件(如 Slack、Google 日历)。这很真实,但风险很大。如果 AI 乱删文件,或者因为时间不同导致测试结果不一样(比如昨天有会议,今天没有),你就没法公平地比较不同 AI 的能力。

Agent-Diff 的解决方案:
它创造了一个**“平行宇宙”的办公室**。
在这个宇宙里,所有的软件(Slack、Box 等)都是真实的,界面和反应跟真的一模一样。但是,每个 AI 测试者都被关在一个**独立的、完全相同的“时间胶囊”(沙盒)**里。

  • 比喻: 就像给每个 AI 发了一套完全一样的乐高积木和说明书,让他们在各自的房间里搭建。无论谁先谁后,房间里的积木初始状态都是一样的,互不干扰。

2. 核心创新:不看过程,只看“结果差异”

以前的测试方法像是在看监控录像

  • 考官会盯着 AI 每一步做了什么(“它点击了这个按钮,然后输入了那个词”)。如果 AI 用了一种聪明的新方法完成了任务,但步骤和标准答案不一样,考官可能会误判它错了。这就像学生用了一种巧妙的解题思路,但因为步骤跟老师教的不一样,被扣了分。

Agent-Diff 的新方法:看“状态差异”(State-Diff)

  • 比喻: 想象你在玩一个“找不同”的游戏。
    • 开始前: 拍一张办公室的照片(初始状态)。
    • 结束后: 再拍一张照片(最终状态)。
    • 评判标准: 我们不看 AI 是怎么把照片拍出来的,也不看它按了哪些按钮。我们只把两张照片叠在一起,看哪里变了
    • 如果任务要求“把文件 A 移到文件夹 B",我们就检查照片里文件 A 是不是真的在文件夹 B 里了。如果文件 A 还在原地,或者文件 C 被误删了,那就是没通过。

这种方法非常聪明,因为它只关心结果(任务是否完成),不关心过程(AI 用了什么花哨的方法),而且能自动发现 AI 有没有“手滑”删错了东西。

3. 测试了什么?(224 个真实任务)

研究人员让 9 种不同的 AI 模型(包括 DeepSeek, Claude, Gemini 等)在 4 个真实的企业软件(Box 文件管理、Slack 聊天、Linear 项目管理、Google 日历)上完成了 224 个任务

这些任务就像真实的办公场景:

  • 简单任务: “创建一个新日历。”
  • 复杂任务: “找出所有关于‘阿根廷经济危机’的文本文件,把错放的那个删掉,给对的那个打上‘拉丁美洲’的标签,然后创建一个新文件夹把它们整理好。”

4. 主要发现:谁最厉害?文档有用吗?

谁赢了?

  • DeepSeek-v3.2Devstral-2512 表现最好,它们就像最聪明的实习生,不仅能完成任务,还能处理复杂的逻辑。
  • 有些模型(如 Llama-4-Scout)表现较差,经常犯低级错误,比如“幻觉”(瞎编不存在的功能)。

文档(说明书)有用吗?
这是一个有趣的发现:

  • 给文档 vs 不给文档: 如果给 AI 看 API 说明书(就像给员工发操作手册),它们完成任务的成功率确实提高了。
  • 但是: 对于特别复杂的任务,仅仅看说明书并不能让 AI 的综合得分大幅提升。
  • 关键点: 文档对新出现的、AI 以前没见过的功能(比如 Box 最近刚推出的"Hub"功能)特别有用。这就像给 AI 一本新出的操作手册,它能立刻学会新技能;但对于老功能,AI 靠自己的“记忆”也能做得不错。

AI 是怎么犯错的?

  • 低分 AI: 喜欢“死磕”。遇到错误就重复做同样的动作(比如反复点击同一个按钮),或者干脆放弃。
  • 高分 AI: 懂得“变通”。遇到错误会停下来思考,去查资料(搜索正确的 ID),或者把大任务拆成小步骤一步步解决。

5. 总结:这篇论文意味着什么?

Agent-Diff 就像是一个**“公平竞技场”
它不再让 AI 在模拟的假环境里表演,也不让它们在混乱的真实世界里冒险。它通过“平行宇宙”和“找不同”的方法,真正测出了 AI 能不能在复杂的办公环境中
靠谱地干活**。

一句话总结:
这篇论文告诉我们,未来的 AI 助手不仅要“聪明”,还要能像真人一样,在真实的办公软件里,通过灵活变通仔细检查,把任务实实在在地做完,而不仅仅是看起来在做。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →