← 最新论文
🤖 machine learning

Building Interactive Real-Time Agents with Asynchronous I/O and Speculative Tool Calling

本文提出了一种结合异步 I/O 与推测性工具调用的框架,以实现支持复杂多轮工具调用的实时、低延迟智能体交互,在保持可接受准确性的同时,显著加速了云侧和边缘侧模型的运行。

原作者: Coleman Hooper, Minwoo Kang, Suhong Moon, Nicholas Lee, Eric Wen, John Wawrzynek, Michael W. Mahoney, Yakun Sophia Shao, Amir Gholami, Kurt Keutzer

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Coleman Hooper, Minwoo Kang, Suhong Moon, Nicholas Lee, Eric Wen, John Wawrzynek, Michael W. Mahoney, Yakun Sophia Shao, Amir Gholami, Kurt Keutzer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试向一位非常聪明但反应稍慢的助手传达一套复杂的指令。在旧有的做法(即“标准”方法)中,你必须等到说完整句话后,助手才能开始思考该做什么。接着,如果助手需要查询电话号码或发送短信,他们会停止说话,去执行该任务,等待结果,然后回来告诉你发生了什么。这种来回往复造成了大量的沉默和等待,使得对话显得笨拙且不自然。

本文介绍了一种让 AI 智能体工作的新方法,其体验更接近真实的人类实时对话。他们将这种方法称为异步 I/O推测性工具调用。以下是通过简单类比对其工作原理的说明:

1. “多任务厨师”(异步 I/O)

将标准的 AI 智能体想象成一位一次只能做一件事的厨师:他们等你点完菜,然后切菜,接着等炉灶加热,最后才开始烹饪。

新方法将 AI 变成了一位多任务厨师

  • 在你仍在说话时:厨师会根据你所说的前几个字开始切菜。他们不会等你说完整句话。
  • 等待炉灶加热时:如果厨师需要等待某个工具(例如数据库查询)完成,他们不会只是呆呆地盯着墙壁。他们会利用这段等待时间开始规划下一步,甚至开始准备下一个食材。

用技术术语来说,这意味着 AI 将其“思考”与你的“说话”解耦。它会在等待来自你或外部世界的信息时继续工作,而不是原地冻结。

2. “带有安全网的赌徒”(推测性工具调用)

有时,AI 必须做出猜测。想象你说:“给乔打电话……"AI 知道需要给某人打电话,但它还不知道具体是哪个乔。

  • 旧方法:AI 会说:“等等,是哪个乔?”然后停止一切,直到你澄清。
  • 新方法:AI 会进行推测性操作。它说:“好的,我先查找‘乔·史密斯’以防万一。”它立即开始该过程。

安全网
本文对“安全”和“不安全”的猜测做出了关键区分:

  • 安全工具(只读):如果 AI 仅仅是在查询电话号码,它可以立即执行。如果你稍后说:“其实我指的是乔·琼斯”,AI 只需更换号码即可。不会发生任何坏事。
  • 不安全工具(只写):如果 AI 准备发送短信删除文件,它不能随意猜测。它会将该动作放入一个“待定”框中。它会准备好消息,但直到获得最终的“绿灯”(即确认你已说完)之前,不会真正点击“发送”。

如果 AI 猜错了,而你改变了主意,它可以在该动作发生之前简单地取消待定操作。这就像一位厨师开始切洋葱,但如果你在他动刀之前说:“其实我今天吃素”,他就会立即停止。

3. “基于时钟的训练”

为了教会 AI 做到这一点,研究人员并没有只是告诉它“要更快”。他们建立了一个带有时钟的特殊训练健身房。

  • 在这个健身房里,AI 被训练为预期信息(如你的声音或工具的回答)会在特定的延迟时刻到达。
  • AI 学会了在这些延迟期间继续工作。
  • 他们还创建了包含虚假“错误”的训练数据,其中 AI 过早地做出了错误猜测,迫使它学习如何在之后修复这些错误而不至于惊慌失措。

结果

本文在两类 AI 上测试了该方法:

  1. 大型云模型:当使用现有的强大 AI API(如 OpenAI 的)时,该方法使其速度提升了1.3 到 1.7 倍,而准确率仅略有下降。
  2. 小型边缘模型:当他们使用特殊的“时钟”方法训练较小的 AI 模型(例如可在笔记本电脑上运行的模型)时,这些模型的速度提升了1.6 到 2.2 倍,同时保持了高准确率。

总结:本文展示了如何阻止 AI 智能体在思考或等待时“暂停”。通过让它们边等待边工作,并允许它们做出可后续修正的安全猜测,它们能够与人类进行实时互动,使语音助手感觉更加自然和响应迅速。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →