← 最新论文
💻 computer science

Towards Robust Tool Use in Agents via Experience-Driven Adaptive Guidance

本文介绍了 ExpG,一种经验驱动的自适应引导机制,它通过获取、蒸馏并重用来自历史执行过程的结构化经验,增强了智能体在工具使用中的鲁棒性,使较小的模型能够在多种任务中超越较大的模型。

原作者: Can Wang, Haoran Chen, Li Yu, Ding Hao, Bohai Zhao, Zhaoyang Liu, Zhiying Tu

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Can Wang, Haoran Chen, Li Yu, Ding Hao, Bohai Zhao, Zhaoyang Liu, Zhiying Tu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你刚刚制造出了一个超级聪明的机器人助手,它不仅能聊天、写故事,甚至还能解决数学问题。你赋予了它一个由大规模语言模型构成的“大脑”,它在交谈方面表现得非常出色。但问题在于:为了在现实世界中真正地“做事”——比如查询天气、预订机票或修复代码中的漏洞——它需要使用“工具”。你可以把这些工具想象成瑞士军刀或数字工具箱。机器人必须知道该抓取哪件工具、如何握住它,以及何时使用它。

问题在于,现实世界是混乱的。有时工具运行得非常完美,但有时它会出故障、给出奇怪的错误,或者只是在不解释原因的情况下说“我无法做到”。如果机器人错误地使用了工具,它可能会陷入困惑的死循环,一遍又一遍地尝试同样错误的操作。长期以来,科学家们一直认为主要问题在于让机器人的大脑变得更聪明。但这篇文章指出,真正的瓶颈不在于大脑,而在于机器人处理使用工具时那种混乱且不可预测的特性的能力。

这就是这篇论文发挥作用的地方。由 Can Wang 及其同事领导的研究人员注意到,机器人经常失败并不是因为它们“笨”,而是因为它们缺乏经验。它们对待每一次拿起工具的过程,都仿佛是第一次接触一样,完全忽略了上次发生了什么。为了解决这个问题,他们创建了一个名为 ExpG(经验驱动的自适应引导)的系统。

你可以把 ExpG 想象成机器人的私人教练。它不仅仅是让机器人去瞎猜,而是通过观察机器人使用工具的过程,从每一次成功和失败中学习,然后为机器人编写一份下次可以使用的“参考手册”。

这个教练的工作分为简单的三个步骤:

  1. 观察之眼(经验获取): 教练观察机器人如何使用工具。它是选对了工具吗?它输入的指令正确吗?工具确实起作用了吗,还是崩溃了?教练会将这些过程拆解成一份清单。例如,如果机器人用“扳手”去拧螺栓,但螺栓尺寸不对,教练会记录下:“嘿,扳手没问题,问题出在螺栓上。”它将这些混乱的时刻转化为清晰、结构化的教训。

  2. 过滤与总结(经验提炼): 教练并不会记录每一条笔记;否则那会太杂乱了。它会过滤掉坏的笔记(比如机器人尝试了一些显然是馊主意的操作),并将好的笔记进行归类。它会寻找模式。例如,它可能会注意到,如果你尝试用“锤子”去处理软面团,锤子总是会“罢工”。于是,教练会写下一份简单的指南:“锤子:适用于钉子。不适用于面团。使用前务必检查手柄。”这把数百次混乱的尝试转化成了一本干净、易读的规则手册。

  3. 参考手册(经验复用): 下次机器人需要用到锤子时,教练会将这份指南递给它。机器人不必再靠猜或者尝试 10 次才能搞清楚。它只需阅读指南:“啊,对了,检查手柄!”然后就能第一次就正确地使用工具。

研究人员在不同的机器人大脑(从小型到大型)上测试了这个想法,并发现加入这个教练带来了巨大的差异。即使是一个带有教练的小型、功能较弱的机器人,也能击败一个没有教练的大型、更聪明的机器人。事实上,在一些工具损坏或令人困惑的棘手情况下,受过教练指导的机器人表现得要好得多。

研究人员发现,这个系统在六个特定方面对机器人有所帮助:

  • 它们变得更清楚何时该使用某种工具。
  • 它们可以分辨出两个看起来相似的工具。
  • 它们学会了输入工具指令的精确方式。
  • 如果尝试了错误的操作,它们可以自我修正。
  • 它们理解是否需要先使用另一种工具才能使当前工具生效。
  • 如果已知某个工具不可靠,它们会学会信任(或不信任)该工具。

这篇论文表明,通过赋予机器人一种从自身历史中学习的方式——就像学生通过复习旧试卷来为下次考试做准备一样——我们可以让它们变得更加可靠。重点不在于把机器人的大脑做得更大,而在于给它一个更好的方式去记住哪些行得通,哪些行不通。结果显示,这种方法是构建能够应对混乱、不可预测的现实世界的智能体的极具前景的路径。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →