← 最新论文
💻 computer science

Fail-Fast, Restart-Smart: Early Failure Prediction and Restart for SWE Agentic Tasks

本文介绍了 FailFast-RestartSmart,这是一种两阶段控制器,它利用轻量级监控器来预测并提前终止失败的 SWE 智能体轨迹以节省 Token,同时采用一种能够利用中断运行中的部分编辑来显著提高任务解决率(相比于冷启动)的智能重启机制。

原作者: Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenyu Wang, Yunbo Lyu, Junda He, Zhou Yang, Chenxing Zhong, Yaniv Harel, David Lo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但有时过于热情的机器人去修理工厂里一台坏掉的机器。这个机器人(一个“AI智能体”)并不会通过变魔术来修复故障,它必须走动、阅读手册、拿起工具、尝试拧紧螺栓、检查是否奏效,然后才能进入下一步。这个过程被称为“轨迹”(trajectory)。有时,机器人会陷入循环,一遍又一遍地尝试同一个错误的方案,或者在一条没有出路的路径上徘ft徘徊。因为机器人必须记住它在工厂里走的每一步以保持定位,这些漫长且失败的旅程在计算能力和时间成本上都极其昂贵。这就像一个学生在意识到自己读错了书并应该换一本时,却在错误章节里反复阅读了三个小时。

核心问题是研究人员一直在探讨的:我们能否教会机器人意识到,“嘿,我正在走一条错误的路径”,并在它浪费数小时时间之前意识到这一点?如果我们阻止它,我们能否保留它所做尝试中的有用部分,从而让它不必从绝对零点重新开始?这篇论文正是针对这一问题展开研究的。它引入了一个系统,充当一个聪明的监督者,实时观察机器人的进度。如果监督者看到机器人即将失败,它会提前踩刹车以节省能量。但它不仅仅是告诉机器人“忘掉一切并重新开始”,而是递给机器人一个包含其所做有用代码更改的“魔法剪贴板”,让机器人以全新的心态重新尝试,同时保留已完成的成果。

问题所在:“Token雪崩效应”与浪费的循环

软件工程智能体就像是在解开谜题的侦探。它们观察一个代码问题,思考解决方案,编写代码,运行测试,然后观察结果。如果失败了,它们会再次尝试。问题在于,这些侦探经常陷入“冗余探索”。它们可能会不断尝试同一个错误的修复方案,或者在代码库中绕圈子。随着这种行为的发生,它们必须在记忆中携带所有的思考和行动历史。这产生了一个“Token雪崩效应”,即随着机器人运行时间越长,每一步的成本就变得越高。

当机器人失败时,它通常比成功时运行得更久。这就像一辆车在原地转圈直到耗尽燃油。研究人员注意到,这些失败往往很早就出现了预兆——重复的循环或冗余的步骤——远在机器人最终放弃之前。挑战在于,过早停止机器人是有风险的。如果你在它即将取得突破的时刻停止它,你就浪费了一次好的尝试;但如果你让它一直运行到彻底失败,你则浪费了更多的资源。

解决方案:快速失败与智能重启

作者提出了一个名为 Fail-Fast–Restart-Smart(快速失败–智能重启) 的两部分系统。把它想象成一个两人小组:一个名为 FailFast 的微型、超快速的看门狗,和一个名为 RestartSmart 的聪明恢复向导。

FailFast:微型看门狗
FailFast 是一个非常小、轻量级的 AI 监控器(只有 0.6 亿参数,相对于主机器人来说非常小)。它的任务是观察机器人的“想法”和“行动”的变化。它不需要查看机器人的内部脑电波;它只需要读取机器人生成的文本。

为了学习如何识别失败,FailFast 在数千个案例中进行了训练,学习如何辨别机器人是在取得进展还是在原地打转。它寻找特定的迹象,比如修复代码测试方面的进展停滞。如果 FailFast 发现机器人很可能失败,它就会拉响警报。至关重要的是,这个警报经过了校准,使其极少误停那些实际上会成功的机器人(保持“误报率”处于低水平)。

RestartSmart:魔法剪贴板
当 FailFast 拉响警报时,机器人会停止。但奇迹就在这里发生。在过去,如果机器人失败了,你只会让它“从头开始”。这被称为“冷启动”(cold restart),它是低效的,因为机器人必须重新发现它已经弄明白的所有东西。

RestartSmart 改变了游戏规则。当机器人被停止时,系统会提取机器人被停止前所做的所有代码编辑,并将其保存为一个“差异”(diff,即变更列表)。然后,它会启动一个全新的、清醒的机器人运行。这个新机器人没有旧的、导致失败的混乱思维记忆。然而,它可以使用“魔法剪贴板”中的内容。

这个新机器人可以查看剪贴板并说:“哦,这个代码改动看起来不错,我会保留它,”或者“这部分不对,我会把它扔掉。”它有权接受、修改或丢弃之前的成果。这使得机器人能够跳过重新发现解决方案的枯燥部分,同时避免陷入导致失败的错误推理陷阱。

研究发现:节省时间并获得更好的结果

研究人员在著名的 SWE-bench Verified 基准测试上测试了这个系统,该测试涉及修复现实世界的软件漏洞。他们使用了一个强大的 AI 模型 (Qwen3.6-27B) 作为主机器人,并使用微小的 FailFast 监控器进行观察。

节省“燃油”
结果显示,FailFast 在识别早期麻烦方面表现出色。在一种严格的设定下(即他们只允许 5% 的概率误停成功的机器人),FailFast 成功节省了 20.4% 的总计算资源(Tokens)。这是一个巨大的胜利。相比之下,其他仅通过计算机器人执行步数的方法仅节省了约 11.4%,而一个更复杂的名为 AgentStop 的方法则节省了 12.5%。这个微型监控器所节省的资源比那些需要更复杂数据的复杂方法还要多。

“魔法剪贴板”的力量
当他们将 FailFast 与 RestartSmart 结合使用时,结果更加出色。通过停止失败的运行,并让机器人带着“魔法剪贴板”重新尝试,他们将 Qwen3.6-27B 机器人的成功率从 66.6% 提升到了 71.8%

这是一个显著的飞跃。如果他们只是使用“冷启动”(即不带任何帮助重新开始),成功率只会上升到 66.8%。这证明了仅仅停止是不够的;你需要保留工作的有用部分。“魔法剪贴板”让机器人能够从原本会失败的错误中恢复,同时避免陷入导致错误的错误推理。

它也适用于其他机器人
最酷的发现之一是该系统的灵活性。FailFast 监控器是使用一种类型的机器人(Qwen3.6-27B)的数据训练的,但它在三种不同的机器人类型上同样表现出色,其中包括一个闭源的专有系统(Gemini 3 Flash)。这表明“失败的迹象”在不同的 AI 模型之间是通用的,而不仅仅局限于某一个模型。

为什么这很重要

这篇论文表明,我们不需要依赖庞大、昂贵的 AI 模型来纠正其他庞大模型的错误。一个微小、廉价的监控器可以通过提前停止错误的运行来节省大量的资金和能源。此外,它还表明当 AI 失败时,它往往会留下一些有用的“面包屑”。与其烧毁这些痕迹,不如保存它们,让 AI 以全新的视角再次尝试,保留好的部分,丢弃坏的部分。

研究人员谨慎地指出,这项测试是在特定的环境(SWE-bench)中进行的,应用到所有类型的软件任务可能还需要更多研究。然而,结果强烈表明,“快速失败,智能重启”是一种让 AI 智能体更高效、更有效的有力途径,能将浪费的努力转化为成功的第二次机会。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →