← 最新论文
🤖 AI

Learning to Rewrite Tool Descriptions for Reliable LLM-Agent Tool Use

本文介绍了 Trace-Free+,这是一个课程学习框架及相关的高质量数据集,它通过重写工具描述以消除歧义来提升大语言模型智能体的可靠性,从而在无需针对每个工具进行重新训练的情况下,显著增强了在大型工具目录中的可扩展性与泛化能力。

原作者: Ruocheng Guo, Kaiwen Dong, Xiang Gao, Kamalika Das

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruocheng Guo, Kaiwen Dong, Xiang Gao, Kamalika Das

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《学习重写工具描述以实现可靠的 LLM 智能体工具使用》的通俗解释,辅以生动的类比。

核心难题:“糟糕说明书”困境

想象你雇佣了一位才华横溢、超级聪明的机器人助手(即LLM 智能体)来帮你处理杂务。你给了它一个巨大的工具箱,里面装有 150 种不同的工具(如电钻、锤子、锯子和搅拌机)。

机器人很聪明,但它无法读心。它必须完全依赖每个工具侧面附带的操作说明书来知道该做什么。

问题出在哪里?原始的说明书是写给人类工程师看的,而不是给机器人看的。

  • 人类版说明书:它们含糊不清。它们会说“用这个来钻孔”,但不会具体说明要用哪种钻头、多用力推,或者如果试图钻玻璃会发生什么。它们假设人类已经掌握了基础知识。
  • 机器人的挣扎:当机器人试图使用这些含糊的说明书时,它会感到困惑。如果你让它“在墙上钻个洞”,它可能会选错工具、用错设置,甚至弄坏墙壁,因为说明书里没写“请勿用于玻璃”。

随着工具箱变大(从 10 个工具增加到 150 多个),困惑也随之加剧。机器人开始靠猜测行事,由于指令过于嘈杂和模糊,其成功率随之下降。

旧方法:“逐个工具”修复法

以往试图解决这个问题的方法,就像雇佣一个编辑团队,为每个工具单独重写说明书。

  1. 他们尝试使用该工具。
  2. 如果机器人失败了,他们会记录下失败的原因
  3. 然后,他们会针对那个特定工具重写说明书,以防止出现同样的错误。

为什么这行不通:

  • 太慢:如果你有 1000 个工具,你就必须把整个过程运行 1000 次。
  • 无法扩展:如果来了一个编辑从未见过的全新工具,在他们尝试并失败之前,他们无法修复它。
  • 重复劳动:编辑们反复学习同样的教训(例如“始终指定日期的确切格式”),却没有教会机器人如何自己识别这些模式。

新方案:"Trace-Free+"(模式学习者)

作者提出了一种名为Trace-Free+的新系统。与其逐个修复工具,他们训练一位“超级编辑”(一种专用 AI 模型)来学习优秀操作说明书的通用规则

这就像教一位厨师如何编写食谱书。

  • 旧方法:你品尝每一道菜,找出错误,然后重写那道菜的食谱。
  • 新方法(Trace-Free+):你让厨师品尝数百道菜,注意到每次食谱对“盐”的描述含糊时,菜肴就会失败。厨师学会了模式:“好的食谱必须始终指定精确的用量。”

一旦厨师学会了这个模式,他们就能仅通过查看工具的基本规格(即“模式”或"schema"),为从未见过的全新工具编写完美的说明书。他们不需要先尝试使用该工具。

工作原理:“学校课程”类比

论文采用了一种巧妙的训练方法,称为课程学习(Curriculum Learning)。想象这位“超级编辑”是一名正在上学的学生:

  1. 低年级(Trace-Rich,含轨迹丰富):学生拿到一个工具、一份含糊的说明书,以及一段视频录像(即“轨迹”),记录机器人尝试使用该工具并失败的过程。学生学到:“哦,机器人失败了,因为说明书没说明该工具仅支持 IPv4 地址,不支持 IPv6。”学生学会了错误与缺失指令之间的关联。
  2. 毕业(Trace-Free,无轨迹):随着学生变得更聪明,老师停止提供视频录像。现在,学生只拿到工具的基本规格,必须在没有先看到失败情况的前提下,写出完美的说明书。
  3. 结果:因为学生在低年级学会了模式,现在他们能够立即为任何新工具编写完美的说明书,而无需先看到它失败。

研究发现(结果)

作者在现实世界的工具(如电影数据库和音乐流媒体 API)上测试了这种方法,发现:

  • 更好地处理大型工具箱:当机器人需要从 150 多个工具中进行选择时,旧方法会感到困惑并失败。新方法则让机器人保持正轨,将错误减少了近30%,并使机器人的成功率提高了60%
  • 适用于新工具:该系统无需针对新型工具(例如从电影 API 切换到音乐 API)重新训练。它只需应用已学到的模式即可。
  • 帮助机器人变得更聪明:即使你训练机器人本身变得更强,给它提供这些“重写后的说明书”也会让它表现更好。这就像给聪明的学生提供更好的教科书,他们学得更快。

总结

这篇论文认为,我们一直过于专注于让“机器人”变得更聪明,而忽略了它阅读的“说明书”。通过训练 AI 识别优秀操作说明书的模式,我们可以使使用工具的机器人更加可靠,尤其是在它们必须从海量选项中进行选择时。

简而言之:不要只让机器人变得更聪明;要教会它如何阅读更好的地图。而做到这一点的最佳方式,是教会地图绘制者如何识别人类在绘制地图时常见的错误。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →