← 最新论文
💬 NLP

Tracing Agentic Failure from the Flow of Success

该论文提出了 OAT,一种轻量级的无监督故障归因模型,该模型利用神经受控微分方程进行单类学习,通过对成功轨迹的动力学进行建模来识别基于大语言模型(LLM)的智能体系统中的错误步骤,其速度和准确率均显著高于现有的基于提示或监督的方法。

原作者: Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Samuel Yeh, Yiwen Zhu, Shaleen Deep, Sharon Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观察一群机器人助手尝试建造一个树屋。它们互相交流、抓取工具、测量木材。突然,屋顶坍塌了。究竟是哪一个具体的动作导致了这场灾难? 是它们忘了测量木材?还是用了错误的锤子?或者是关于设计方案争论得太久了?

寻找这一个错误的步骤,就像是在一千个机器人动作组成的干草堆中寻找一根掉落的针头。通常,为了解决这个问题,专家们必须坐下来,手动标注每一次失败尝试中的每一个错误,从而教给一个超级聪明的 AI(就像一个巨大的大脑)如何识别错误。但这既缓慢又昂贵,且需要大量的人力劳动。

论文的核心思想:仅从成功中学习
作者 Samuel Yeh 及其团队说:“等等。为什么我们一定要通过研究失败来寻找错误呢?如果我们只研究那些完美的树屋呢?”

他们提出了一种名为 OAT(单类智能体追踪,One-class Agent Tracing)的新方法。OAT 不是向 AI 输入一个破碎机器人的库并要求它学习什么是“错误”,而是只给它输入成功的、完美的轨迹。它学习的是完成一项完美工作的“节奏”或“流向”。它学习机器人在一切顺利时应该如何移动、思考和行动。

神奇的技巧:隐形的河流
这里是最酷的部分。团队将机器人的动作视为一条随时间流动的河流。他们使用了一种叫做神经控制微分方程(Neural Controlled Differential Equations, Neural CDEs)的数学工具。你可以把它想象成一张极其精确的地图,描绘出了机器人应该采取的“理想路径”。

当机器人失败时,就像河流突然撞到了岩石或卷入了漩涡。因为 AI 准确地知道平滑、成功的河流是什么样子的,所以它可以瞬间发现哪里变得波涛汹涌。它会为每一个步骤分配一个“怪异度分数”(异常得分)。如果某一步看起来与完美的流向过于不同,AI 就会将其标记为罪魁祸首。

他们排除了什么
论文明确反对了两种常见的方法:

  1. “询问巨型大脑”法: 使用庞大且昂贵的 AI 模型(如 GPT-5)来阅读整个故事并猜测错误。作者指出,这种方法太慢,且成本过高。
  2. “标注一切”法: 试图收集数以千计的破碎机器人案例,并手动标注其中的每一个错误步骤。作者认为,这种方法难以规模化,且具有歧义性。

结果:快速、廉价且出奇地好
团队在真实数据上测试了他们的想法。他们仅用 100 个成功的机器人旅程训练了 OAT。然后,他们将它投入到从未见过的破碎旅程测试中。

  • 速度: OAT 比询问巨型 AI 模型快 200 到 5,000 倍。因为它不需要通过与大型模型进行对话来解决问题,所以它不产生额外的“Token”费用。
  • 准确性: 尽管它只看到了 100 个完美的例子,但 OAT 击败了巨型 AI 模型。在类似任务的测试中,它在寻找错误方面表现得好出 20%。在完全不同的复杂任务中,它仍然比对手好出 7%
  • “守门员”: 他们在数学模型中添加了一个特殊的“门”。这个门可以帮助系统在看到机器人表现出完全怪异、全新的行为(比如来自外星的机器人)时保持冷静。这个门让系统在处理陌生、不熟悉的场景时表现得更好,而不会感到困惑。

他们有多确定?
作者对这些数字非常有信心,因为他们使用不同的随机种子多次运行了测试,并得到了连贯的结果。他们使用标准数学指标(如 F1 分数和 AUROC)来衡量性能,发现 OAT 始终优于竞争对手。

然而,他们也谨慎地指出,虽然该系统效果很好,但并非完美。在某些情况下,它可能会错过最初的错误,但仍能捕捉到错误变得明显的后续步骤。他们建议,通过一些微调,它可能会变得更好,但就目前而言,他们已经证明了通过成功来学习是诊断失败的一种强大且实用的高效方法。

底线
与其通过研究残骸来找出哪里出了错,OAT 学习的是完美建筑的蓝图。当某些东西崩塌时,它能瞬间知道哪块砖头被放错了位置,而且它做得极快,不需要超级计算机。这是调试未来机器人的一个高效、实用的新方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →