想象一下,你刚刚制造出了一个超级聪明的机器人助手,它不仅能聊天、写故事,甚至还能解决数学问题。你赋予了它一个由大规模语言模型构成的“大脑”,它在交谈方面表现得非常出色。但问题在于:为了在现实世界中真正地“做事”——比如查询天气、预订机票或修复代码中的漏洞——它需要使用“工具”。你可以把这些工具想象成瑞士军刀或数字工具箱。机器人必须知道该抓取哪件工具、如何握住它,以及何时使用它。
问题在于,现实世界是混乱的。有时工具运行得非常完美,但有时它会出故障、给出奇怪的错误,或者只是在不解释原因的情况下说“我无法做到”。如果机器人错误地使用了工具,它可能会陷入困惑的死循环,一遍又一遍地尝试同样错误的操作。长期以来,科学家们一直认为主要问题在于让机器人的大脑变得更聪明。但这篇文章指出,真正的瓶颈不在于大脑,而在于机器人处理使用工具时那种混乱且不可预测的特性的能力。
这就是这篇论文发挥作用的地方。由 Can Wang 及其同事领导的研究人员注意到,机器人经常失败并不是因为它们“笨”,而是因为它们缺乏经验。它们对待每一次拿起工具的过程,都仿佛是第一次接触一样,完全忽略了上次发生了什么。为了解决这个问题,他们创建了一个名为 ExpG(经验驱动的自适应引导)的系统。
你可以把 ExpG 想象成机器人的私人教练。它不仅仅是让机器人去瞎猜,而是通过观察机器人使用工具的过程,从每一次成功和失败中学习,然后为机器人编写一份下次可以使用的“参考手册”。
这个教练的工作分为简单的三个步骤:
观察之眼(经验获取): 教练观察机器人如何使用工具。它是选对了工具吗?它输入的指令正确吗?工具确实起作用了吗,还是崩溃了?教练会将这些过程拆解成一份清单。例如,如果机器人用“扳手”去拧螺栓,但螺栓尺寸不对,教练会记录下:“嘿,扳手没问题,问题出在螺栓上。”它将这些混乱的时刻转化为清晰、结构化的教训。
过滤与总结(经验提炼): 教练并不会记录每一条笔记;否则那会太杂乱了。它会过滤掉坏的笔记(比如机器人尝试了一些显然是馊主意的操作),并将好的笔记进行归类。它会寻找模式。例如,它可能会注意到,如果你尝试用“锤子”去处理软面团,锤子总是会“罢工”。于是,教练会写下一份简单的指南:“锤子:适用于钉子。不适用于面团。使用前务必检查手柄。”这把数百次混乱的尝试转化成了一本干净、易读的规则手册。
参考手册(经验复用): 下次机器人需要用到锤子时,教练会将这份指南递给它。机器人不必再靠猜或者尝试 10 次才能搞清楚。它只需阅读指南:“啊,对了,检查手柄!”然后就能第一次就正确地使用工具。
研究人员在不同的机器人大脑(从小型到大型)上测试了这个想法,并发现加入这个教练带来了巨大的差异。即使是一个带有教练的小型、功能较弱的机器人,也能击败一个没有教练的大型、更聪明的机器人。事实上,在一些工具损坏或令人困惑的棘手情况下,受过教练指导的机器人表现得要好得多。
研究人员发现,这个系统在六个特定方面对机器人有所帮助:
- 它们变得更清楚何时该使用某种工具。
- 它们可以分辨出两个看起来相似的工具。
- 它们学会了输入工具指令的精确方式。
- 如果尝试了错误的操作,它们可以自我修正。
- 它们理解是否需要先使用另一种工具才能使当前工具生效。
- 如果已知某个工具不可靠,它们会学会信任(或不信任)该工具。
这篇论文表明,通过赋予机器人一种从自身历史中学习的方式——就像学生通过复习旧试卷来为下次考试做准备一样——我们可以让它们变得更加可靠。重点不在于把机器人的大脑做得更大,而在于给它一个更好的方式去记住哪些行得通,哪些行不通。结果显示,这种方法是构建能够应对混乱、不可预测的现实世界的智能体的极具前景的路径。
技术摘要:通过经验驱动的自适应引导(ExpG)实现鲁棒的智能体工具使用
1. 问题陈述
AI 智能体的性能瓶颈正在从大语言模型(LLM)固有的能力转向其执行过程的鲁棒性,特别是工具使用方面。虽然工具是智能体与外部环境交互的主要接口,但现有方法往往无法确保在多样化的运行时条件下实现鲁棒的工具使用。
目前的方法通常依赖于静态假设,即:
- 工具总是被正确调用并返回预期响应。
- 工具失败能提供具有信息量的信号,从而允许持续的自我反思。
然而,现实世界的条件违反了这些假设。环境动态变化可能导致同一个工具根据上下文产生不同的结果,且工具响应往往是嘈杂或粗粒度的(例如,一个有 Bug 的计算器在返回错误结果的同时仍报告“成功”)。由于缺乏对工具能力边界和鲁棒使用模式的清晰理解,智能体在面对模糊信号时难以泛化,往往会陷入试错或遵循错误的推理路径。
2. 方法论:ExpG
作者提出了 ExpG(经验驱动的自适应引导),这是一种通过将工具调用视为可分析、相互依赖且可学习的经验,来构建并优化工具自适应引导的机制。与静态的黑盒方法不同,ExpG 受智能体记忆启发,维护着一个不断演进的经验池,通过三个连续阶段运行:
第一阶段:经验获取 (Experience Acquisition)
ExpG 分析历史执行轨迹,以归因每次工具调用的成功或失败。
- 形式化: 一个经验 E 被定义为 ⟨h,m,c⟩,其中 h 是唯一哈希,m 是元数据(工具信息、上下文、输入、响应、成本),c 是评估内容。
- 评估: 一个
LLM_evaluator(充当评判者)从 d 个维度(例如涵盖环境、智能体行为和工具可靠性的 10 个方面)评估每次调用。它生成一个二进制评分向量和一个自然语言解释。
- 划分: 同一工具的经验根据其评分向量被划分为等价类。这通过不同的模式对调用进行分组(例如,“完美调用”对比“输入正确但工具失效”)。
第二阶段:经验蒸馏 (Experience Distillation)
此阶段将原始经验转化为可操作的引导。
- 过滤: 剔除无用的经验。这包括基于哈希的过滤(去除冗余)、时间维度的过滤(丢弃过时数据)以及有效性维度的过滤(去除那些持续导致后续评分降低的经验)。
- 选择: 根据有效经验的数量,对工具进行分类:
- One-shot(单次): 跳过(数据不足)。
- Few-shot(少次): 保留所有经验。
- Many-shot(多次): 应用基于等价类选择的算法。它选择一个配额 Q 的代表性经验,在确保多样性(覆盖不同的调用模式)的同时保持原始分布(强调频繁出现的模式)。
- 总结:
LLM_summarizer 分析过滤后的集合,为每个工具生成引导(Guidance)。该引导包括:
- 定性方面: 核心功能、成功模式、常见问题及最佳实践。
- 定量方面: 平均成功率、评分、时间成本和 Token 成本。
第三阶段:经验复用 (Experience Reuse)
蒸馏后的引导被应用于未来的任务,使智能体从盲目的试错转向有信息的执行。
- 动态 vs 稳定: 引导根据一致性分为两类。
- 动态引导 (Dynamic Guidance): 用于具有多变调用模式的工具,作为轻量级的上下文提示。
- 稳定引导 (Stable Guidance): 用于具有一致失败/成功模式的工具(例如,由于内部可靠性问题,尽管输入正确但始终失败的工具),作为严格的 Schema 约束。
- 应用: 引导被注入到提示词中,或者作为工具 Schema 中的约束,以适应智能体的当前状态和工具的可靠性。
3. 核心贡献
- 工具调用的结构化表征: 本文通过引入一种封装了环境、智能体和工具因素的结构化表征,打破了工具调用的静态视图。这使得通过等价类划分获取可学习经验成为可能。
- ExpG 机制: 一个用于维护演进式工具级经验池的新颖框架。通过获取、蒸馏和复用经验,ExpG 构建了能力边界和最佳实践,并能不断进行优化。
- 实证验证: 大量实验证明,ExpG 在工具选择、工具调用和响应生成任务中持续提升了性能。值得注意的是,它使较小的模型(如 Qwen3-8B)能够超越不使用 ExpG 的更大模型。
4. 实验结果
实验针对工具使用的不同阶段在三个基准测试上进行:MetaTool(工具选择)、API-Bank(工具调用)和 BFCL-V3(响应生成)。
- 性能提升: ExpG 在所有数据集和模型(GPT-5 nano, DeepSeek-V3, Qwen3 系列)中均取得了最佳的 Avg@3 和 Pass@3 分数。例如,在 Qwen3-8B 上,相比于“无方法(No Method)”基线,ExpG 在 Avg@3 上提升了 7.41%,在 Pass@3 上提升了 6.92%。
- 挑战环境下的鲁棒性: ExpG 在嘈杂环境下(如缺失参数、未定义工具、干扰工具)表现出特别强劲的增益。在 BFCL-V3 中,它在问题设置下的单轮任务性能提升了 13.09%,多轮任务提升了 10.33%。
- 效率: 该方法减少了正常多轮任务中的平均推理步骤(从 10.14 降至 9.02),同时在挑战性场景中鼓励更审慎的行为,从而以更少的交互次数实现了更高的成功率。
- 消融研究: 移除任何一个阶段(获取、蒸馏或复用)都会导致性能下降,证实了完整流水线的必要性。研究表明,与均匀选择或类别平衡选择相比,基于等价类的选择方法能更有效地平衡分布对齐与多样性。
5. 意义与主张
本文声称 ExpG 代表了**迈向可训练工具(trainable tools)**的早期步骤,超越了静态的工具文档,转向动态的、由经验驱动的自适应。
- 范式转变: 它解决了从以模型为中心向以执行过程鲁棒性转变的问题,为解决“开发与生产之间的差距”(即工具在现实语境中表现各异)提供了方案。
- 自我进化: 该系统允许智能体通过对工具经验的结构化蒸馏和复用来实现自我进化,降低了对高阶模型掌握工具能力的依赖。
- 实用性: 该方法旨在与现有的智能体框架兼容,在工具的细粒度层级上运行,以补充更高层级的记忆或技能类方法。
作者总结道,通过捕捉能力边界和最佳实践,ExpG 为构建能够处理不可预测环境和嘈杂反馈的、更具鲁棒性和适应性的智能体系统铺平了道路。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。