← 最新论文
🤖 AI

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems

本文介绍了 AgentForesight,这是一个框架,其核心在于利用新构建的 AFTraj-2K 数据集训练的一个紧凑在线审计器,以实时预测并定位基于大语言模型的多智能体系统中的决定性错误,从而实现在部署阶段的干预,而非依赖事后归因。

原作者: Boxuan Zhang, Jianing Zhu, Zeru Shi, Dongfang Liu, Ruixiang Tang

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Boxuan Zhang, Jianing Zhu, Zeru Shi, Dongfang Liu, Ruixiang Tang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观看一支机器人团队协同工作,共同组装一件复杂的家具。它们有一个计划:一台机器人负责切割木材,另一台负责打磨,第三台负责喷漆。

在过去,如果最终制成的桌子摇晃不稳或颜色涂错,专家们会等到最后,看着成品的一团糟,然后说:“啊,问题出在打磨机器人使用了错误的砂纸粒度上。”这被称为事后故障归因。这就像侦探在房子已经烧毁后才去破案。你知道是谁干的,但无法阻止火灾的发生。

AgentForesight 改变了这一局面。想象一位超级警觉的安全检查员站在机器人旁边,实时观察它们每一个动作,而不是坐等灾难发生。

核心理念:“停或行”检查员

这位检查员(即审计员)并不知晓未来。它只能看到到目前为止发生的情况。在每一个步骤,检查员都必须做出瞬间决定:

  1. 继续:“目前一切看起来安全。让机器人继续工作。”
  2. 警报:“停下!我刚刚发现了一个关键错误。如果我们让它们继续,整个项目将失败。”

目标是捕捉决定性错误——那个导致列车脱轨的特定时刻——在其他机器人盲目跟随这一错误指引并毁掉整个项目之前将其拦截。

问题:为何此前如此困难?

直到如今,我们缺乏训练这些检查员所需的良好数据。

  • “安全”问题:大多数现有数据仅展示了失败的项目。我们没有足够完美项目的示例,在这些示例中,我们确切地知道每一步都没有出错。仅基于失败案例训练的检查员可能会惊慌失措,叫停每一个项目,认为任何小插曲都是灾难。
  • “时机”问题:现有模型擅长在查看已完成的失败案例后说:“问题出在第 4 步。”但它们极不擅长在第 4 步正在进行时就指出:“立刻停下!”

解决方案:AgentForesight

研究人员构建了一个包含三个主要部分的新系统:

1. 训练手册(AFTRAJ-2K)

他们创建了一个名为AFTRAJ-2K的庞大机器人工作日志库。

  • 安全日志:他们仔细筛选了数千个成功的机器人任务,确保它们从头到尾真正完美。这教会了检查员“安全”是什么样子的。
  • 破损日志:他们选取安全任务,并在特定步骤故意制造故障(例如指示机器人使用错误的工具),然后利用一组 AI 裁判来一致确认哪一个步骤导致了失败。这教会了检查员何时该拉响警报。

2. 训练方法(由粗到精)

他们没有直接将检查员扔进深水区,而是像训练武术学生一样分两个阶段进行:

  • 阶段 1:“直觉”(风险预判):首先,他们教导检查员分辨“安全”时刻与“危险”时刻的区别。他们向检查员展示成对的步骤:“这看起来安全”与“这看起来危险”。检查员学会了感知事物出错的分界线。
  • 阶段 2:“狙击手般的精准”(精确性):一旦检查员具备了良好的“直觉”,研究人员便进一步磨练其技能。他们教导它 pinpoint(精确定位)确切的步骤以及确切负责的机器人。他们使用了一套奖励机制,当检查员在以下三方面做对时给予表扬:
    • 什么:是否给出了正确的答案格式?
    • 何处:是否在确切的步骤捕捉到了错误?
    • :是否归咎于正确的机器人?

3. 成果(AgentForesight-7B)

成果是一个紧凑、快速的 AI 审计员(命名为AgentForesight-7B),可与其他 AI 系统并行运行。

  • 更快更智能:在测试中,它捕捉错误的能力远超庞大且昂贵的 AI 模型(如 GPT-4.1 或 DeepSeek-V4-Pro)。
  • 精准:它不仅仅说“有些东西错了”;它会说:“停下!经理机器人在第 3 步犯了错。”
  • 实用:它体积小巧,足以在标准硬件上运行,意味着它实际上可用于现实世界的应用,而不会拖慢整体速度。

为何这很重要

将其视为AI 团队的拼写检查器

  • 旧方式:你写完整篇文章并提交,然后拼写检查器说:“你在第 1 页犯了一个拼写错误。”但文章已经发送了。
  • AgentForesight 方式:当你输入时,拼写检查器在你犯错的那一刻就高亮显示错误,甚至在你完成句子之前。它阻止你发送一个有缺陷的产品。

该论文声称,这一系统允许我们在 AI 工作过程中进行干预,防止小错误在编码、数学和网页导航任务中演变成巨大且不可逆的失败。它将故障分析从“尸检”(post-mortem)转变为“活体手术”(saving the patient)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →