← 最新论文
🤖 AI

Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL

本文介绍了一种自我推测智能体框架,该框架通过利用联合强化学习方法,将任务求解与下一工具调用预测统一在单个模型中,从而在不损害任务性能的情况下,显著提高了推测准确度并降低了延迟。

原作者: Jiabao Ji, Yujian Liu, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiabao Ji, Yujian Liu, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位正在试图破解谜题的超级聪明侦探。你拥有一个能够通过线索进行思考的卓越大脑,但为了得到最终答案,你需要向外界提出几个问题——比如打电话给图书管理员查阅一本书,或者询问气象预报员天气预报。问题在于,每次打电话时,你都必须挂断电话,等待对方接听,听取他们的回答,然后再次挂断,然后才能思考下一个线索。而在你等待的过程中,你那卓越的大脑只是在那儿无所事事。这种“等待时间”是 AI 智能体(本质上是利用工具解决复杂问题的计算机程序)的一个巨大瓶颈。

为了解决这个问题,科学家们尝试了一个被称为“投机预测”(speculation)的小技巧。这就像是有一个侧写师,在你还没说完句子之前,就猜到了你接下来要问图书管理员什么。如果侧写师猜对了,那么在你还在思考的时候,图书管理员就已经开始翻书了,这样当你开口询问时,答案已经准备就绪。但问题在于,通常这个侧写师是另一个人(一个较小的、独立的 AI 模型),他们并不像你一样了解你的思考风格。他们经常猜错,或者需要自己专门的笔记本和电话,这会占用额外的空间和能量。大问题是:侦探能否学会完美地预判自己的下一步行动,而不需要一个笨拙的侧写师?

这篇论文介绍了一种巧妙的新方法,旨在教 AI 智能体实现这一点。研究人员发现,预测智能体下一步行动的最佳人选就是智能体本身。他们训练了一个单一的 AI 在两种模式之间切换:“思考模式”(解决实际任务)和“猜测模式”(预测其下一次的工具调用)。他们使用了一种特殊的训练方法,称为“联合智能体-投机者强化学习”(Joint Agent–Speculator RL)。你可以把它想象成一款电子游戏,角色在练习通关关卡的同时,也在预测下一个敌人的动作。AI 从自己最近的游戏中学习,以提高猜测水平,同时确保它不会忘记如何真正赢得游戏。

结果非常令人振奋。当他们在处理诸如搜索难题答案或管理航空公司预订等任务时,测试了这个“自我猜测型”智能体,发现该 AI 预测其下一步行动的能力有了显著提升。对于一个名为 Qwen3-4B 的特定 40 亿参数模型,猜测正确下一次工具调用的准确率从 44.1% 跳升至 61.2%。对于一个稍新版本的 Qwen3.5-4B,准确率从 48.9% 提升到了 66.3%。至关重要的是,虽然智能体的猜测能力变强了,但它解决实际任务的能力并没有下降;其成功率保持稳定甚至略有提高。

论文还排除了“较小的独立 AI 模型是最佳猜测者”这一观点。他们测试了将较小的模型作为“侧写师”的情况,并发现这些模型经常出错,因为它们与主智能体的风格不匹配。他们还表明,使用独立的猜测者需要更多的计算内存,并且在不同模型之间切换需要更长的时间,这违背了节省时间的初衷。通过让“思考者”和“猜测者”成为同一个大脑,该系统节省了内存,并避免了在不同计算机之间切换产生的延迟。

然而,作者也谨慎地指出,这种方法最适用于“只读型”工具,例如搜索信息或查找数据。如果工具涉及改变现实世界中的某些事物——比如下单购买或删除文件——猜错可能会带来危险。在这些情况下,系统需要额外的安全检查。但在绝大多数 AI 只需要收集信息的任务中,这种“自我猜测”的小技巧暗示了一种更快、更高效的 AI 工作方式,将等待时间隐藏在了思考时间之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →