← 最新论文
💻 computer science

Benchmarking LLM Tool-Use in the Wild

该论文指出当前大模型工具使用基准测试忽视了真实用户交互的复杂性,为此提出了基于真实行为模式的 WildToolBench 基准,评估发现现有模型在应对真实场景下的多步工具调用时表现极差(准确率低于 15%),揭示了大模型智能体能力在“野生”环境下的巨大差距。

原作者: Peijie Yu, Wei Liu, Yifan Yang, Jinjian Li, Zelong Zhang, Xiao Feng, Feng Zhang

发布于 2026-04-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Peijie Yu, Wei Liu, Yifan Yang, Jinjian Li, Zelong Zhang, Xiao Feng, Feng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的 AI 助手(大语言模型)做了一次"野外生存大考",而不是在实验室里做“模拟考”。

为了让你更容易理解,我们可以把现在的 AI 助手想象成一个刚入职的超级实习生

1. 以前的考试:温室里的花朵

以前的评测(Benchmark)就像是在温室里考这个实习生。

  • 题目很完美:老板(用户)会非常清晰地写下:“请帮我查一下北京明天的天气,然后查一下上海明天的天气,最后把结果发给我。”
  • 环境很干净:没有干扰,没有废话,指令一步接一步,非常有条理。
  • 结果:在这种环境下,很多 AI 表现得像个学霸,准确率很高,大家觉得它们已经无所不能了。

2. 新的考试:WildToolBench(野外生存挑战)

但这篇论文的作者(来自腾讯和伦敦国王学院)发现,真实世界不是温室。在真实的办公室里,老板(用户)说话是** messy**( messy 的)、灵活的,甚至有点混乱的。

于是,他们搞了一个叫 WildToolBench 的新考试,专门模拟这种“野外”环境。这个考试主要考了实习生三个“野外生存技能”:

技能一:拼乐高(组合任务)

  • 真实场景:老板不会说“先查 A 再查 B"。老板会说:“我想规划个周末旅行,看看芝加哥和洛杉矶这周末天气咋样,顺便查查这两个地方有没有老鹰乐队(The Eagles)的演出,如果天气不好就换个地方,最后帮我做个 PPT 大纲。”
  • 挑战:这需要实习生自己拆解任务,像拼乐高一样,知道哪些工具可以同时用(比如同时查两个城市的天气),哪些必须按顺序用(比如先查天气,如果天气不好再查演出,最后做 PPT)。
  • 比喻:以前的考试是让你按说明书搭积木;现在的考试是给你一堆积木和一句“搭个能住人的房子”,你得自己设计结构。

技能二:读心术(隐含意图)

  • 真实场景:老板说:“这天气太糟了,换个地儿。”
  • 挑战:实习生得知道“这天气”指的是刚才查的芝加哥,“换个地儿”指的是刚才提到的洛杉矶或拉斯维加斯。如果老板说“我要那个作者的下一篇文章”,实习生得记住“那个作者”是谁,“下一篇”是相对于哪一篇。
  • 比喻:以前的考试是老板把字都写全了;现在的考试是老板只说了一半,剩下的得靠实习生(而且猜对才行)。

技能三:见风使舵(指令切换)

  • 真实场景:老板刚让查天气,突然说:“对了,你吃饭了吗?”(闲聊),然后又说:“哦对了,刚才那个天气,帮我查查洛杉矶的,还有,顺便帮我订个票。”
  • 挑战:实习生得瞬间切换模式:从“查天气模式”切换到“闲聊模式”,再切回“订票模式”。如果它还在死板地查天气,或者把闲聊当成任务去执行,就挂了。
  • 比喻:就像你在开车,前面是红灯,突然有人喊你,你后面又有人按喇叭。你得眼观六路,耳听八方,随时准备变道、刹车或加速,而不是只会直行。

3. 考试结果:惨不忍睹

作者找了 57 个 目前最厉害的 AI 模型(包括 GPT-4o, Claude, Gemini, 通义千问等)来考这个“野外生存”。

  • 成绩:简直惨不忍睹!
    • 在以前的“温室考试”里,这些模型可能能拿 80-90 分。
    • 在 WildToolBench 的“野外考试”里,没有任何一个模型能超过 15 分(准确率)。
    • 大多数模型甚至不到 60% 的任务能做完。

这意味着什么
这说明现在的 AI 虽然很聪明,能写诗、能写代码,但一旦让它像真人一样去处理复杂的、多变的、充满潜台词的真实任务,它就晕头转向了。它像个只会做数学题的学霸,但不会处理人际关系和突发状况。

4. 论文的核心结论

这篇论文告诉我们:

  1. 别被假象骗了:以前那些高分评测,可能只是 AI 在做“假题”。
  2. 真正的难点不是“难”,而是“野”:任务本身不一定很难,难的是真实人类那种随意、模糊、多变的说话方式
  3. 未来的方向:AI 不能只做一个“工具执行器”(你让我查我就查),它必须进化成一个“懂人”的助手,能听懂弦外之音,能灵活切换角色,能处理混乱的现场。

一句话总结
现在的 AI 就像是一个只会按剧本演戏的演员,在排练室(旧评测)里表现完美;但一旦上了没有剧本的即兴舞台(WildToolBench),面对真实观众(用户)的突发状况,它就忘词、乱套、甚至下不来台了。这篇论文就是给 AI 行业敲响了警钟:要想真正落地,得先学会“接地气”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →