← 最新论文
💻 computer science

Fantastic Adaptive Taxonomies and How to Use Them

本文介绍了 AdaMAST,这是一个能够从智能体执行轨迹中自动归纳出紧凑且基于证据的失败分类法,从而作为一种可复用的反馈接口,与传统的自由形式反思方法相比,该系统显著提升了智能体在搜索、运行时及轨迹选择任务中的性能。

原作者: Mert Cemri, Andrei Cojocaru, Melissa Pan, Shu Liu, Shubham Agarwal, Alexander Krentsel, Jay Tang, Kannan Ramchandran, Joseph E. Gonzalez, Matei Zaharia, Alex Dimakis, Ion Stoica

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Mert Cemri, Andrei Cojocaru, Melissa Pan, Shu Liu, Shubham Agarwal, Alexander Krentsel, Jay Tang, Kannan Ramchandran, Joseph E. Gonzalez, Matei Zaharia, Alex Dimakis, Ion Stoica

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但有点笨手笨脚的机器人如何解谜。每当机器人尝试解决谜题时,它都会留下长长的、混乱的思绪、行动和错误的痕迹。这条痕迹被称为“执行轨迹”(execution trace)。长期以来,试图修复这些机器人的科学家们有两种观察这些混乱的方法。第一种方法只是说:“你失败了,”然后就跳过。这就像老师在考试后只给了一个红色的“F”而不告诉你是为什么错了。第二种方法是要求机器人写一篇冗长的、东拉西扯的文章来解释哪里出了错。这虽然好一些,但就像要求一个学生在每做错一道数学题时,都要用不同的词汇重新写一篇关于这道题的新文章。机器人永远无法为它的错误建立一套一致的词汇表,而试图修复机器人的老师(或计算机程序)也会被各种各样描述同一错误的表达方式搞得精疲力竭。

这个计算机科学领域的重大问题是:我们如何帮助 AI 智能体从失败中学习,而不至于陷入无止尽、重复性的文本中?目标是将那些混乱、漫长的错误痕迹转化为一份干净、有序的“错误代码”列表——就像一本标准化的错误字典。如果机器人总是忘记检查自己的工作,与其每次都写一段话,不如直接给它一个标签,写着“忘记检查”。这使得系统能够识别模式、修复根本原因,并停止重复犯错。这就是名为 AdaMAST 的新方法的基础。


论文的核心思想:机器人的个人“错误字典”

这篇论文介绍了一个聪明的系统,叫做 AdaMAST(自适应多智能体系统失败分类法)。你可以把 AdaMAST 想象成一位超级聪明的图书管理员,他观察着机器人智能体尝试解决问题的过程,并且不只是阅读机器人混乱的日记,而是为它创建一本个性化的、动态更新的错误字典。

以下是它在实际场景中的运作方式:

  1. 观察: 机器人尝试解决一系列任务(如编写代码或解决数学问题)并失败了。它留下了一段长长的、混乱的文本痕迹。
  2. 神奇的翻译: 与其让人类阅读每一个字,AdaMAST 会阅读这段痕迹并说:“啊,我看到了这个模式!机器人一直在尝试使用一个不存在的工具,”或者“机器人思考得太早停止了。”它将这些混乱的观察转化为简短、朗朗上口的名称,如 “Premature_Reasoning_Truncation”(推理过早截断)或 “Tool_Mismatch”(工具不匹配)。
  3. 动态字典: 该系统构建了一个“分类法”(taxonomy),这只是一个高级词汇,意为分类列表。这个列表有三个层级:
    • 系统级(System-level): 与整个设置相关的错误(例如机器人陷入死循环)。
    • 角色特定级(Role-specific): 机器人团队中特定部分的错误(例如“检查者”部分变得偷懒)。
    • 领域特定级(Domain-specific): 关于实际学科内容的错误(例如数学算错了)。
  4. 最棒的部分: 机器人 永远 不需要由人类来教它这个字典。这个字典完全是根据机器人自身的失败构建的。这就像一个学生根据自己做错的题目编写了自己的复习指南,然后利用这份指南为下次考试做准备。

论文发现:字典确实有效

作者通过三种不同的方式测试了这个想法,结果表明,拥有这个“错误字典”能让机器人们变得显著更聪明且更可靠。

1. 寻找更好的机器人设计(搜索)
想象一下,你正在尝试通过混合搭配不同的部件来发明一个更好的机器人。通常,你只看分数:“这个机器人得了 80 分,那个得了 85 分。”但有了 AdaMAST,系统会查看失败机器人的“字典代码”。

  • 结果: 当研究人员使用这些代码来引导他们寻找更好的机器人设计时,新的机器人表现得更好。在五种不同类型的挑战(从竞争性编程到数学)中,使用该字典引导的机器人比仅获得模糊自由文本反馈的机器人,其得分提高了 3.4% 到 7.5%
  • 类比: 这就像教练告诉球员:“你之所以一直没接到球,是因为你在看错误的位置”(一个具体的代码),而不是仅仅说“你表现得很差”(一个通用的评分)。球员知道具体该修补哪里。

2. 工作期间的错误修复(运行时监控)
有时,机器人在执行任务的过程中开始偏离轨道。论文测试了机器人是否可以在完成任务前停下来,检查自己的“错误字典”,并自我修复。

  • 结果: 当机器人被给予这个字典进行自我检查时,它解决了更多的难题。
    • 在一个名为 SWE-bench 的软件工程测试中,一个名为 SWE-agent 的机器人,其解决问题的能力从使用普通自我检查时的 60% 提升到了使用字典后的 70%
    • 另一个机器人 Claude Code64.0% 提升到了 70.7%
  • 总结: 字典帮助机器人捕捉到了特定的、反复出现的错误(例如忘记检查语法错误),而当它仅仅使用通用的“检查你的工作”提示词时,它会漏掉这些错误。

3. 选择最佳尝试(轨迹选择)
假设一个机器人尝试解决一个问题五次。你不知道哪一次是对的,但你必须选出一个赢家。

  • 结果: 研究人员构建了一个“裁判”,它查看这五次尝试并统计“错误代码”。错误代码最少的尝试通常就是赢家。
  • 数据: 与仅仅靠猜测或使用标准清单相比,这种方法将挑选正确答案的准确率提高了 8 到 15 个百分点。它特别擅长识别出“接近正确但错误”的尝试与“真正正确”的尝试之间的区别。

论文排除了什么(以及它没做什么)

作者谨慎地指出,这个系统 不是 什么。

  • 它不是解决一切问题的万灵药: 论文表明,一个固定的、预先制作好的错误列表(比如标准的教科书列表)虽然还可以,但不如专门为该机器人构建的字典好。其中的“自适应”(Adaptive)部分是关键。如果你使用一个通用的列表,你会错过那些只有 你的 机器人才会犯的独特、古怪的错误。
  • 它不是关于写更好的文章: 论文测试了如果将反馈写成一种更高级、更有结构的形式(比如列表)是否就是成功的秘诀。他们发现,字典的 内容 比格式更重要。真正的胜利在于拥有一个一致、可重用的错误名称列表,而不仅仅是单词的排列方式。
  • 它不是人类发明的: 论文明确反对由人类手动编写这些列表。他们发现,当人类试图猜测机器人会犯什么错误时,他们会错过那些特定的、奇特的错误。机器人的自身行为才是最好的老师。

我们有多确定?

论文将这些发现作为来自真实实验的测量结果,而非仅仅是猜测。

  • 数据是可靠的: 这些改进(例如解决问题能力从 60% 跳升到 70%)是在多种不同测试和不同类型的机器人上测量的。
  • “字典”非常精简: 作者展示了这个字典是非常高效的。它可以将大量的、混乱的失败数据压缩成一个极小的代码列表(缩小了约 18 倍),且不会丢失重要的细节。
  • 它对人类友好: 当他们将机器人的自制字典与人类专家制作的列表进行比较时,发现机器人的列表在理解错误方面甚至比人类制作的列表更符合专家的理解。这表明机器人对于理解自己的错误有着惊人的能力。

简而言之,AdaMAST 表明,修复一个聪明的机器人最好的方法不是给它写一本新的手册或给它一个通用的训斥。相反,你应该让它从自身的失败中构建属于自己的错误字典,然后利用这个字典来教会它下次如何做得更好。它将一堆混乱的错误变成了一份清晰、可操作的进步路线图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →