← 最新论文
🤖 AI

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

本文介绍了 AsyncTool,这是一个新颖的基准测试,旨在评估基于大语言模型的智能体在模拟延迟的多任务场景中的异步工具调用能力,结果表明,当前模型在处理延迟的工具响应时,在时间协调和效率方面存在困难。

原作者: Kou Shi (University of Science and Technology of China), Ziao Zhang (University of Science and Technology of China), Shiting Huang (University of Science and Technology of China), Avery Nie (Universit
发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Kou Shi (University of Science and Technology of China), Ziao Zhang (University of Science and Technology of China), Shiting Huang (University of Science and Technology of China), Avery Nie (University of Toronto), Zhen Fang (University of Science and Technology of China), Qiuchen Wang (University of Science and Technology of China), Lin Chen (University of Science and Technology of China), Huaian Chen (University of Science and Technology of China), Zehui Chen (University of Science and Technology of China), Feng Zhao (University of Science and Technology of China)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于论文 AsyncTool 的通俗解释,辅以生动的类比。

核心理念:“忙碌的咖啡师”难题

想象你是一位在繁忙咖啡店工作的王牌咖啡师(即 AI 智能体)。你手头有一张订单列表:

  1. 订单 A: 制作一杯复杂的浓缩咖啡(耗时 30 秒)。
  2. 订单 B: 为拿铁咖啡研磨咖啡豆(耗时 5 秒)。
  3. 订单 C: 擦拭柜台(耗时 2 秒)。

旧模式(同步):
过去,大多数针对 AI 咖啡师的测试仅检查它们能否完美制作一杯饮料。如果它们开始处理订单 A,就会站在意式咖啡机前发呆,除了等待那 30 秒结束外,什么都不做。只有等到时间到了,才会转向订单 B。这种做法效率极低。

新现实(异步):
在现实世界中,你不会静止不动。当浓缩咖啡正在萃取时,一位聪明的咖啡师会顺手抓取订单 B 所需的咖啡豆,并擦拭订单 C 的柜台。一旦咖啡萃取完毕,它们会立刻切换回订单 A。这被称为异步工具调用

什么是 AsyncTool?

这篇论文的作者意识到,当前的 AI 测试就像上述的“旧模式”。它们检查 AI 是否能使用工具(如搜索网络或运行代码),却假装这些工具能瞬间给出答案。而在现实中,工具响应是需要时间的。

AsyncTool 是一项全新的“考试”,旨在测试 AI 能否应对忙碌咖啡师的场景。它测试三项具体技能:

  1. 等待: AI 能否意识到工具正在“思考”,而不是盲目猜测答案?
  2. 切换: AI 能否暂停任务 A,跳转到任务 B,并在答案返回时记得回到任务 A?
  3. 追踪: AI 能否在不混淆的情况下,追踪哪个工具对应哪个任务?

他们如何构建测试(食谱)

为了创建这项考试,研究人员并非随意编造问题,而是遵循了一套严谨的“食谱”:

  1. 收集原料: 他们从其他基准测试中选取了现有的高质量单任务数据(例如“搜索航班”)。
  2. 重构路径: 他们利用强大的 AI(Gemini 2.5 Pro)重写这些任务,确保指令清晰且步骤分明。
  3. 人工校对: 人类检查了这些工作,确保步骤逻辑通顺且没有错误。
  4. “混合”: 他们将这些单任务组合成组。有时给 AI 两个相似的任务(如两次航班搜索),有时给两个截然不同的任务(如一次航班搜索和一次文件管理)。
  5. 模拟延迟: 他们对测试进行了编程,使得当 AI 提出问题后,“工具”会先回复“我正在处理,请稍等”,然后再给出答案。

他们如何给 AI 评分

他们不仅仅看最终结果,而是像老师批改学生作业一样,从三个层级对 AI 进行评分:

  • 步骤层级: AI 是否用正确的措辞提出了正确的问题?(例如:它是否拼写了正确的工具名称?)
  • 子任务层级: 它是否正确完成了工作的一个小部分?(例如:它是否成功找到了航班?)
  • 任务层级: 它是否完成了整个作业,包括它同时处理的所有不同订单?

此外,他们还增加了一个特殊的“效率得分”。这衡量了 AI 在不同任务间切换的频率。高分意味着 AI 切换得足够频繁以保持高效,但又不会频繁到导致混乱。

他们的发现(结果)

研究人员测试了 19 种不同的 AI 模型(包括 GPT-4.1 等大型商业模型和开源模型)。以下是发生的情况:

  • “时间”冲击: 当工具出现延迟时,几乎所有 AI 的表现都显著下降。这就像在考试时不断有人拍你的肩膀。
  • “幻觉”陷阱: 许多较弱的 AI 无法等待。当它们向工具请求数据时,并没有等待答案,而是直接猜测答案并继续前进。这导致了错误。
  • “健忘”问题: 一些 AI 开始处理任务 A,切换到任务 B,然后完全忘记了任务 A 的存在。它们完成任务 B 后就说“全部完成”,即使任务 A 还在等待。
  • 获胜者: 表现最好的模型(如 GPT-4.1)是那些能够同时兼顾多项任务的模型。它们确切地知道何时切换任务、何时等待。它们不是随机切换,而是策略性地切换。

主要结论

该论文得出结论:擅长使用工具不仅仅在于知道使用哪个工具,更在于时机

要在现实世界中成为真正高效的 AI 智能体,它必须成为一个优秀的项目经理。它需要懂得:

  • “我正在等待这个结果,所以在等待期间我会做另一件事。”
  • “哦,结果回来了!我需要停下手头的工作,先完成那个任务。”

该论文认为,未来的 AI 系统需要在“时间协调”(管理时间和等待)方面做得更好,以便在复杂的多任务环境中真正发挥作用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →