← 最新论文
💬 NLP

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

本文提出了名为 Toolathlon 的基准测试,旨在通过涵盖 32 款软件、604 种工具及 108 个基于真实环境状态构建的长周期多步骤任务,评估语言智能体在多样化现实场景中的执行能力,并揭示了当前顶尖模型在此类复杂任务中仍存在显著不足。

原作者: Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xin
发布于 2026-02-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xingyao Wang, Xiang Yue, Shuyan Zhou, Graham Neubig, Junxian He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Tool Decathlon(工具十项全能,简称 TOOLATHLON) 的新项目。为了让你轻松理解,我们可以把它想象成一场**“超级特工的实战演习”**。

1. 以前的考试 vs. 现在的“十项全能”

以前的考试(旧基准):
想象一下,以前的 AI 助手考试就像是在模拟驾驶舱里练车。

  • 考官(出题人)会给你一张完美的地图,告诉你:“前面 50 米左转,然后右转,到达终点。”
  • 路况是假的,没有真正的行人,也没有突发的暴雨。
  • 只要 AI 能按指令把车开过去,就算满分。
  • 问题: 这种考试太简单了。AI 在模拟舱里是“车神”,但一上真正的马路(现实世界),面对复杂的交通、修路、甚至没有路标的情况,它就懵了。

现在的“十项全能”(TOOLATHLON):
这篇论文说:“不行,我们要把 AI 扔进真实的城市里!”

  • 真实环境: 不再是模拟数据,而是真实的软件。比如真实的 Gmail 邮箱(里面可能有几百封邮件)、真实的学校管理系统(里面有几十个学生的作业)、真实的数据库(像 BigQuery 或 Snowflake)。
  • 模糊指令: 考官不再给详细的步骤。考官只会说:“帮我看看谁没交作业,把没交的人打个零分,交了的给满分,顺便把文件下载下来检查一下有没有错。”
    • AI 必须自己猜:“哦,文件在哪?作业标准在哪?怎么下载?怎么打分?”
  • 多任务串联: 就像特工一样,AI 需要同时操作多个工具:先查邮件 -> 下载文件 -> 用终端运行代码检查 -> 去学校系统打分 -> 如果错了还要写报告。这一套流程下来,平均要操作20 多次工具。

2. 这场“演习”有多难?

为了测试 AI 的极限,作者们搭建了32 种不同的真实软件环境(从日常用的日历、笔记,到专业的数据库、电商系统),提供了604 个工具供 AI 使用。

他们设计了108 个任务,每个任务都像是一个复杂的现实场景:

  • 场景 A: 你是学校助教,要处理几十份学生的 Python 作业。你需要从邮箱里把附件下载下来,在电脑上运行代码看有没有报错,然后去学校的 Canvas 系统里给分。
  • 场景 B: 你是公司管理员,要监控数据库里的客户工单。如果工单超时了,你要查手册,给经理发提醒邮件,给顾客发道歉信。

关键点: 这些任务没有“标准答案”的步骤,AI 必须自己推理规划,甚至要处理错误(比如工具报错、文件找不到)。

3. 考试结果:AI 们“翻车”了

作者让目前世界上最聪明的 AI 模型(包括 Claude 4.5, GPT-5, DeepSeek 等)参加了这场考试。结果让人大跌眼镜:

  • 最强选手(Claude-4.5-Sonnet): 满分 100 分,它只拿了 38.6 分
  • 开源模型冠军(DeepSeek-V3.2-Exp): 只拿了 20.1 分

为什么考得这么差?
论文分析了原因,就像发现了特工的弱点:

  1. 记性不好(长上下文问题): 任务太长了,AI 做着做着就忘了前面的步骤,或者被长长的代码/数据搞晕了。
  2. 手滑(工具调用错误): 有时候 AI 会叫错工具的名字,或者参数填错,导致任务失败。
  3. 半途而废: 遇到稍微复杂点的长任务,AI 容易偷懒,还没做完就说“我搞定了”,然后直接交卷。

4. 这个“十项全能”有什么用?

这就好比给 AI 界发了一张**“体检报告”**。

  • 它告诉开发者:别光在模拟环境里吹牛了,AI 在真实世界里还很不成熟。
  • 它提供了一个真实的训练场:所有工具、环境、评分脚本都是开源的。未来的 AI 可以来这里“练级”,看看能不能从 38 分提升到 80 分。

总结

TOOLATHLON 就是告诉世界:

“现在的 AI 就像是一个只会做数学题的学霸,但还没学会在真实生活中当个管家。”

这篇论文通过搭建一个极其真实、复杂、充满干扰的“工具十项全能”赛场,揭开了当前 AI 在应对现实世界长链条任务时的短板。它的目标是推动 AI 从“做题家”进化为真正的“实干家”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →