← 最新论文
🤖 machine learning

Benchmarking Web API Integration Code Generation

本文介绍了 WAPIIBench,这是一个数据集和评估流水线,揭示了当前的开源大语言模型在生成正确的 Web API 集成代码方面存在显著困难,由于端点幻觉和参数使用错误等问题,其成功率不足 40%。

原作者: Daniel Maninger, Leon Chemnitz, Amir Molzam Sharifloo, Jannis Brugger, Mira Mezini

发布于 2026-07-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniel Maninger, Leon Chemnitz, Amir Molzam Sharifloo, Jannis Brugger, Mira Mezini

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个非常聪明、博学多才的机器人如何从一份极其庞大且复杂的餐厅菜单中点一份特定的餐点。这份菜单不仅仅是一份菜品清单;它还包含了一套严格的规则,关于你应该如何写下你的订单、按下哪些按钮,以及必须列出哪些精确的配料。如果你哪怕错了一个细节,厨房都会退回你的订单。

这篇论文探讨的是如何测试这些“机器人”(实际上是大型语言模型,即 LLM——也就是 AI 聊天机器人背后的技术)在编写代码以向真实的 Web 服务(如 Google 日历、Slack 或 Asana)发送这些“订单”时的表现。

以下是研究人员的工作内容及其发现,我使用了简单的类比来进行说明:

问题所在:“魔法”尚未真正实现

开发者使用“Web API”来让不同的软件进行通信。这就像是将乐高积木连接在一起。通常情况下,人类必须编写指令来将这些积木拼装起来。人们曾希望 AI 可以自动完成这项工作。

研究人员提出了这样一个问题:AI 能否在看到一个简单的请求(例如“在我的日历中添加一个新事件”)后,编写出完美且无误的代码来实现这一目标?

实验过程:为 AI 打造一场“驾驶考试”

为了测试这一点,团队构建了一个名为 WAPIIBench 的特殊测试。你可以把它看作是针对 AI 的一场“驾驶考试”。

  1. 赛道: 他们利用四个流行的真实世界服务(Asana、Google 日历、Google 表格和 Slack)创建了 395 个特定的“驾驶场景”。
  2. 规则: 他们使用了这些服务的官方“驾驶手册”(OpenAPI 规范),以确保准确掌握一个正确的订单应该是怎样的。
  3. 测试: 他们给 AI 一个提示词(例如“创建一个新日历”),并要求它编写代码。
  4. 检查: 研究人员并没有仅仅通过阅读代码来查看其“看起来”是否正确,而是实际在安全受控的沙盒环境中运行了这些代码。如果代码尝试向不存在的地址发送订单,或者使用了错误的配料,则测试失败。

结果:AI 经常迷失方向

对于那些期待实现即时自动化的人来说,结果有些令人失望。

  • 得分: 即便是表现最好的开源 AI 模型,也只能完全正确地完成约 30% 到 40% 的任务。表现最好的商业模型(GPT-4o)稍好一些,达到了 60-77%,但这仍然意味着它在近三分之一的情况下失败了。
  • “幻觉”问题: 这是最大的问题。AI 经常会凭空捏造信息。
    • 虚假地址: AI 会发明不存在的 URL 地址(比如在餐厅实际位于“主街 456 号”时,却告诉出租车司机去“虚构街 123 号”)。这种情况在高达 39% 的案例中发生了。
    • 错误的配料: AI 会包含该服务并不接受的参数(配料),或者遗漏了必须具备的参数。
  • 部分成功: AI 擅长记住代码的“大致轮廓”(例如知道它需要使用 POST 方法,这就像是知道你需要“下单”而不是“取消订单”)。但当涉及到具体的细节——即要把东西发往“哪里”以及“具体要说什么”时,它在整合这些碎片信息方面表现挣扎。

一些令人意外的转折

  • 并非越大越好: 有时,一个中等规模的 AI 模型表现得比一个极小的模型和一个极大的模型都要差。这就像是一个学生为了考错的试而学习过度,结果反而搞混了。
  • 记忆 vs. 理解: AI 似乎“背诵”了其训练数据中的部分手册内容。它知道一些 URL 和参数名称,但无法可靠地将它们组合起来以解决一个新的、特定的问题。这就像一个学生背下了去年的数学考试答案,却无法解决今年的题目。
  • “填空”技巧: 当研究人员给出正确的地址(URL)并仅要求 AI 填充剩余部分时,AI 的表现要好得多。这表明,如果不需要先去猜测目的地,AI 是懂得如何遵循指令的。

核心结论

论文得出结论:虽然 AI 在编写代码方面正在进步,但它尚未可靠到可以在没有人类监督的情况下自动连接软件系统。如果你现在让 AI 编写代码来连接你的业务应用与互联网,它大约有 60% 到 70% 的概率会将你的数据发送到错误的地方,或者导致连接中断。

研究人员表示,在我们能够信任 AI 自主构建这些连接之前,我们需要更好的安全检查机制,以及新的方法来帮助 AI 在实时“查阅”规则(而不是仅仅依赖记忆)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →