← 最新论文
🤖 AI

PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling

本文介绍了 PluginEval,这是一个诊断基准,它采用了一个结合了 LLM 生成与确定性 API 执行的两阶段框架,旨在系统地解决数据分布差异和缺乏对抗性测试的问题,从而实现针对大语言模型工具路由评估的细粒度错误归因。

原作者: Dongjie Xu, Julius, Hanchi Dong, Minghua Tang, Yuxuan Sun, Ziwei Nie, Zicheng Liu, Dujun Qing, Jiajie Xu

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Dongjie Xu, Julius, Hanchi Dong, Minghua Tang, Yuxuan Sun, Ziwei Nie, Zicheng Liu, Dujun Qing, Jiajie Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明、非常热心的机器人管家如何使用一个装满了数千种不同小工具的巨大工具箱。你告诉机器人:“我饿了”,它必须决定三件事:首先,它是否真的需要使用工具,还是可以直接想到一种零食?第二,如果它需要工具,哪一个特定的工具才是正确的(是一个搅拌机,而不是一把锤子)?第三,它能否实际抓取那个工具并正确使用它而不将其损坏?这就是人工智能中的“函数调用”(function calling)领域。这项技能让 AI 模型不再仅仅是聊天,而是开始真正地“做事”,比如预订机票或查询天气。但问题的关键在于:仅仅因为机器人说了正确的词,并不意味着它选对了工具或使用正确的方式。我们需要一种方法来测试它是真的聪明,还是仅仅运气好。

这正是开发 PluginEval 的研究人员试图解决的问题。他们注意到,目前大多数针对这些 AI 机器人的测试就像是一个驾驶考试,而每个人拿到的都是一个简单、空旷的停车场。这些测试缺乏棘手的场景,无法捕捉到机器人失败的具体方式,并且通常依赖于其他机器人来给答案评分,这可能会产生偏差。因此,团队构建了一个全新的、难度更高的“驾驶考试”,专门针对中文查询。他们创建了一个系统,不仅看最终得分,还像侦探一样,找出机器人失败的究竟原因:是它忘了带工具,是它抓错了工具,还是它尝试使用正确的工具却把食材弄洒了?

侦探的工具箱:他们是如何构建测试的

为了构建这个新的基准测试,作者们并没有只是写下一堆问题然后听天由命。他们发明了一个“闭环构建框架”(PCCF),这是一种高级说法,意指他们构建了一个用于制作测试的自我修正机器。

把它想象成一个游戏关卡设计师,不断地重玩一个关卡直到它变得完美。

  1. 第一阶段(现实检查): 首先,他们拿出一个问题(例如“帮我找一张去东京的便宜机票”),并要求几个 AI 模型尝试解决它。但这里的转折在于:他们并不只是相信 AI 的话。他们实际上会运行代码。如果 AI 说“我要调用航班 API”,系统就会尝试进行该调用。如果 API 返回“错误:缺少日期”,系统就知道 AI 失败了。这区分了“想法”与“现实”。
  2. 第二阶段(缺口填充): 系统随后查看结果,并询问:“我们在哪里缺少棘手的问题?”也许测试中关于天气的简单问题太多,而关于预订复杂行程的难题太少。系统随后会生成新的、更难的问题,专门用来填补这些空白。它会创造“对抗性”问题——即旨在诱导 AI 犯错的陷阱。
  3. 循环: 这些新的、棘手的问题会回到第一阶段再次接受测试。如果它们太容易,系统就会让它们变得更难。如果它们太令人困惑,系统会利用识别证据在重新验证之前强化负面示例。这个循环会不断旋转,直到测试涵盖了 AI 可能感到困惑的所有可能方式,从简单的错误到复杂的逻辑陷阱。

判决:测试揭示了什么

一旦他们拥有了完美的测试(其中包括 3,000 个经过人工验证的问题,涵盖 54 种不同的工具),他们将世界上最聪明的五个 AI 模型投入了测试。其中包括 GPT-5.4、Claude 4.6 和 Gemini 3.1 Pro 等知名模型。

结果令人警醒。作者发现,综合得分(最终成绩)具有误导性

  • 难度陷阱: 当测试主要是简单问题时,所有的 AI 看起来都像天才,得分超过 80%。但一旦遇到“困难”问题,得分就会骤降。对于最难的问题,即使是最优秀的 AI 也只有大约 10% 的正确率。这表明目前的模型非常脆弱;它们在处理简单任务时表现出色,但在事情变得复杂时就会崩溃。
  • 不同模型的不同缺陷: 论文并没有仅仅说“模型 A 更好”。它像机械师检查汽车引擎一样拆解了错误。
    • GPT-5.4 在识别所需工具和避免不必要调用方面表现最差,同时表现出最高的“漏召回”(忘记使用需要的工具)和“过召回”(在不该使用工具时使用了工具)率。
    • Claude Opus 4.6 在记住使用工具方面表现最好(漏召回率最低),但有时会在不该使用时使用工具(过召回率高)。
    • Gemini 3.1 Pro 拥有最平衡的错误分布,实现了最低的“过召回”率,这有助于它在召回率低于 Claude 的情况下仍保持具有竞争力的准确性。
  • “时间”问题: 每种模型都出现了一种特定的错误类型:时间错误(Temporal Errors)。无论是询问“下周二”还是“上个月”,AI 在处理日期和时间方面始终难以准确。这是所有模型中最主要的失败来源。

为什么这很重要

论文认为,我们不能仅仅通过一个百分比来判断一个 AI 使用工具的能力。一个模型得分高,可能是因为它擅长简单问题,也可能是因为它运气好。通过使用他们新的“金标锚定”(Gold-Anchored)评判系统——即将 AI 的答案与经过人工验证的“金标准”进行对比,而不是与另一个 AI 的猜测进行对比——他们能够精准定位机器人到底在哪里失败。

作者们建议,要制造真正可靠的 AI 智能体,我们不能再把它们当作一个要么成功、要么失败的“黑盒”。相反,我们需要像医生诊断一样去诊断它们:检查它们是漏掉了一个步骤,还是抓错了工具,或者仅仅是时间搞错了。他们的工作表明,虽然今天的 AI 功能强大,但仍存在显著的盲点,尤其是在任务变得困难或时间要求变得复杂时。这篇论文并不声称已经“解决了”AI 工具使用问题,但它提供了第一张关于机器人哪里会绊倒的真实地图,以便我们可以帮助它们走得更稳。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →