← 最新论文
🤖 machine learning

DOCSCHISEL: Adaptive Tool Documentation Optimization Framework for LLM Agents

该论文介绍了 DocsChisel,这是一个通过分析智能体失败轨迹来动态优化信息字段的自适应框架,通过迭代优化工具文档,使其与现有基准相比,显著提升了大语言模型(LLM)智能体的任务成功率。

原作者: You Lu, Kun Zhang, Bihuan Chen, Xin Peng

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: You Lu, Kun Zhang, Bihuan Chen, Xin Peng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象这样一个世界:你最喜欢的超级智能机器人助手正试图盖房子、烹饪美食或破解谜题。为了完成这些任务,机器人不能仅仅靠思考,它需要拿起工具。它可能需要一把数字锤子、一个虚拟扳手或一个高科技烤箱。但问题在于,除非有人给它一份手册,否则机器人并不知道如何使用这些工具。在人工智能的世界里,这些“机器人”被称为大语言模型(LLM)智能体,而这些“手册”就是工具文档。长期以来,科学家们认为让这些智能体变得更聪明的最佳方法是给它们更好的大脑,或者教它们如何更快地找到工具。他们将手册视为固定不变的规则书。但如果问题不在于机器人的大脑,而在于手册是用一种机器人并不完全理解的语言编写的,或者缺少了它成功所需的那个关键步骤呢?

这是一个复旦大学研究团队决定攻克的难题。他们提出了一个简单而深刻的问题:我们编写这些工具手册的方式真的重要吗?“一刀切”式的手册能适用于所有的机器人吗?为了找出答案,他们不仅靠直觉,还进行了一场大规模实验。他们观察了数千种工具,并在不同类型的 AI 智能体上尝试了不同版本的说明书。他们的发现令人惊讶:并不存在单一的完美手册。一份能帮助某个机器人成功的手册可能会让另一个机器人感到困惑。在“烹饪”任务中非常有用的细节,在“编程”任务中可能反而会成为干扰。因此,他们构建了一个名为 DOCSCHISEL 的新系统。你可以把它想象成一个超级智能的编辑,它会观察机器人的尝试与失败,然后剔除手册中令人困惑的部分,并添加缺失的部分,从而为那个特定的机器人和特定的工作量身定制指令。他们的结果表明,通过这样做,机器人的任务完成率有了极大的提升。

问题所在:“一刀切”的手册并不适用

想象一下,你正在教一位新朋友如何使用复杂的视频游戏控制器。你可能会写一份指南说:“按下 A 键跳跃。”但如果你的朋友正在玩赛车游戏,他们可能需要知道“按下 A 键加速”。如果你给他们同一份通用的指南来应对两种游戏,他们要么会撞车,要么会掉下悬崖。

长期以来,构建 AI 智能体的研究人员一直假设工具文档就像一本静态的字典。他们认为:“如果我们把字典缩减得更短或更整洁,AI 就会理解得更好。”之前的一些尝试试图将这些手册压缩成精简、整齐的摘要,而另一些则试图将其改写为更标准化的格式。但本文的研究人员意识到,他们忽略了一些东西:他们把手册当作是完美的,只需要稍微润色一下。他们怀疑手册的内容——即诸如“如何使用”、“如果出错该怎么办”或“输出结果是什么”等特定的信息字段——才是真正的关键,而且不同的 AI 智能体需要不同的“钥匙”。

侦探工作:手册里究竟有什么?

为了验证这一理论,团队化身为数字侦探。他们收集了来自 14 个不同数据集的 24,955 个工具的大规模集合。这些工具涵盖了从管理电子邮件、日历到分析数据甚至修复软件漏洞的所有领域。他们想看看这些手册中实际包含了哪些信息。

他们发现了一片混乱且不一致的局面。有些手册有一个名为“使用指南”的部分,而有些则没有。有些列出了“输入参数名称”(你输入的内容),而有些则完全跳过了它。他们识别出了手册中可能存在的 17 种不同类型的信息字段。在所有数据集中,唯一出现在每一个数据集中的两个字段是“工具名称”和“功能描述”(工具的作用)。其他一切都是随机且不确定的。

但真正的惊喜出现在他们测试这些不同字段如何影响 AI 性能的时候。他们选取了一组标准的工具,开始对信息字段进行“增减”实验。他们会拿出一份手册,移除“使用指南”,观察 AI 是否会失败;然后他们会把指南加回来,看 AI 是否会成功。

结果非常惊人。同样的一条信息,在一种情况下可能是英雄,在另一种情况下则可能是反派。

  • 对于某一个 AI 模型,移除特定的字段可能会导致其失败率增加 10%。
  • 对于另一个 AI 模型,移除完全相同的字段反而可能帮助它成功,因为多余的文本让它产生了困惑。
  • 在“数据分析”任务中,某个特定字段可能是至关重要的。
  • 在“电子邮件管理”任务中,同一个字段可能只是无用的噪音。

研究人员发现,平均而言,仅仅增加或删除一条信息,就会使 AI 的成功率改变 6.34 个百分点。这证明了固定不变的手册是一个糟糕的主意。适用于“ReAct”智能体(一种循序渐进思考的机器人)的方法,可能并不适用于“多智能体”系统(一组协同工作的机器人团队)。

解决方案:DOCSCHISEL,自适应编辑器

既然固定的手册行不通,团队便构建了 DOCSCHISEL(自适应工具文档优化框架)。你可以把 DOCSCHISEL 想象成一个不知疲倦、观察入微的编辑,它坐在 AI 智能体工作时的一旁。

以下是它的工作步骤:

  1. 观察之眼: 首先,DOCSCHISEL 让 AI 智能体使用原始的、未经编辑的手册来尝试完成任务。它会仔细观察并记录智能体每一次失败的过程。
  2. 诊断: 当智能体失败时,DOCSCHISEL 会查看“失败轨迹”——即出错过程的数字足迹。它会让一个 AI(“诊断”模型)来分析为什么会失败。是因为手册没说工具需要特定的输入?还是因为示例让人困惑?
  3. 记忆: 这是核心秘诀。DOCSCHISEL 会保留关于过去错误的“记忆”。如果它看到“缺失使用指南”导致了“电子邮件”领域的失败,它会在处理该领域下一个工具时记住这一点。它能从错误中学习。
  4. 雕琢(Chisel): 根据诊断结果和记忆,DOCSCHISEL 会决定对手册的具体部分进行增加(Add)删除(Remove)精炼(Refine)
    • 增加: “机器人不知道需要密码,所以让我们添加一个‘必需输入’字段。”
    • 删除: “机器人被一段冗长的代码片段搞糊涂了,所以让我们删掉它。”
    • 精炼: “指令太模糊了,所以让我们把它写得更清晰。”
  5. 测试: 然后,它会测试编辑后的新手册。如果智能体成功率提高了,那就太棒了!如果新手册导致智能体在原本能做的任务上失败了,DOCSCHASEL 就知道该适可而止。它会保留手册的最佳版本,然后进入下一个工具。

结果:巨大的飞跃

团队将 DOCSCHISEL 与另外两种顶尖方法(EASYTOOL 和 DRAFT)以及原始的、未经编辑的手册进行了对比测试。结果令人震惊。

  • 与原始手册相比: DOCSCHISEL 将 AI 的任务成功率提高了 95.89%。这意味着机器人的任务完成能力几乎翻了一番。
  • 与其他智能方法相比: 平均而言,DOCSCHISEL 比排名第二的方法还要好 75.15%
  • 一致性: 它不仅仅适用于一种类型的机器人或一种类型的任务。它在不同的 AI 模型(如 GPT-4o, GLM-5, Claude Haiku 4.5)和不同的智能体风格(单机器人 vs. 机器人团队)下都表现出色。

研究人员还考察了成本。优化手册需要时间——每个工具大约 12.65 分钟。然而,他们认为对于如此巨大的提升来说,这是一个微小的代价。新的手册并没有比旧的明显长多少,因此不会让 AI 被过多的文本淹没。

这为什么重要

这篇论文改变了我们看待“教导 AI”的方式。它表明,我们不能仅仅把一份通用的说明书丢给机器人,然后祈祷它能成功。这个“手册”需要是一个能够根据机器人的大脑和具体工作内容进行自我调整的、鲜活的实体。

研究人员不仅提出了这个观点,还用数据证明了这一点。他们展示了通过仔细剔除手册中的坏部分并添加正确的部分,我们可以让 AI 智能体变得显著更加可靠。这就像是意识到,要教学生弹钢琴,你不能只给他们一本乐谱;你必须根据他们特定的手指力量、音乐品味以及他们试图学习的具体曲目来量身定制课程。DOCSCHISEL 正是为 AI 智能体提供这种定制化服务的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →