← 最新论文
💻 computer science

An Empirical Investigation of Multi-Trial Consistency, Trajectory Pathologies, and Reliability Rankings in Software Engineering Agents

本文提出了一种全面的多轮试验评估框架,用于评估自主软件工程智能体的连贯性、可靠性和轨迹病理特征,并通过一项试点研究证明了其操作可行性,该研究揭示了显著的基础设施审查率,并为超越单次试验成功指标奠定了基础。

原作者: Muhammad Tayyab

发布于 2026-09-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Muhammad Tayyab

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代软件开发领域,庞大的代码库由工程师团队维护,他们依赖自动化工具来发现并修复漏洞。最近,新一代人工智能应运而生,能够作为自主助手,阅读这些代码库、理解问题,并尝试自行编写必要的修复程序。这些系统通常由大语言模型驱动,已在受控测试中展示出解决复杂编程任务的能力。然而,一个关键问题仍悬而未决:这些数字员工能否被信任,在每次执行任务时都保持可靠?在现实世界中,软件更新是自动部署的,如果一个助手在一次尝试中成功,但在下一次被要求执行完全相同的工作时却失败了,这会造成混乱。它引入了不可预测性,迫使人类开发者必须不断检查其工作成果,这反而抵消了自动化的初衷。核心挑战不仅在于 AI 是否能解决一个问题,而在于它能否在不产生困惑、不犯随机错误或不以破坏系统的逻辑方式改变方法的情况下,始终如一地解决问题。

一位来自巴基斯坦拉合尔工程技术大学的研究人员提出了一种衡量这种可靠性的新方法,超越了目前仅计算 AI 单次尝试成功次数的现有标准。现有的方法被称为“单次试验通过率”,它将 AI 视为参加一次性考试的学生:如果答案正确,学生就算通过,而不管该学生是否能再次解出此题。这项新研究认为,对于软件工程而言,这种方法是不充分的。相反,研究人员设计了一套严密的协议,对这些智能体进行多次重复测试,以观察其一致性。其目标是观察 AI 是否能够每次被要求时,都能以完全相同的方式导航代码库、发现漏洞并修复它,还是会在重复的审视下表现崩溃。

为了测试这一点,研究人员建立了一个大规模实验,涉及从流行开源项目中提取的一组特定真实世界编程任务。该研究计划在不同的 AI 模型和不同的软件框架网格上运行这些任务,并将每个任务重复执行五次,以获取完整的性能图景。在开展全面实验之前,研究人员进行了规模较小的“可行性试点测试”,以确保测试机制正常运行。该试点涉及在两个特定的 AI 模型和两个不同的软件脚手架系统上,对 360 次尝试进行规划。然而,其中只有 312 次尝试成功完成并被分析,另有 48 次因外部因素中断。研究人员仔细追踪了 AI 采取的每一步骤,不仅记录了成功或失败,还记录了它改变主意的次数、在使用计算机工具时犯错的频率,以及测试基础设施本身崩溃的频率。

试点研究表明,测试环境本身是脆弱的。在计划的 360 次尝试中,有 48 次被外部因素中断,例如云服务提供商超时或计算机容器意外重置。这导致了 13.3% 的取消率,这一发现凸显了运行此类复杂测试的难度。更重要的是,试点研究显示,当前的测试预算(时间限制)过短,无法产生成功的修复。由于 AI 在每次尝试中被限制在仅五轮对话或行动内,这 312 个完成的序列中没有一个实现了成功的修复。智能体将全部有限的时间都花在了尝试导航代码和理解问题上,从未达到能够应用解决方案的阶段。

尽管在这次简短的试点中缺乏成功的修复案例,但该研究成功证明了收集关于这些智能体行为详细数据的可能性。研究人员识别了 AI 在尝试与计算机系统交互时发生的特定错误类型,例如生成计算机无法理解的命令,或尝试访问不存在的文件。他们还开发了衡量“代码变更”(code churn)的新方法,用于追踪 AI 在得出最终答案前修改自身工作的程度。高水平的变更意味着智能体犹豫不决或不稳定,在没有明确计划的情况下不断重写自己的代码。此外,研究还引入了“工具失败”指标,以区分由 AI 推理能力差引起的错误与由计算机系统崩溃引起的错误。

论文结论指出,虽然这些 AI 智能体展现出了潜力,但目前的评估方法是不完整的。通过仅关注单次尝试,业界忽略了导致这些工具在现实使用中变得不可靠的“波动性”(flakiness)。研究人员认为,一个真正可靠的智能体必须能够在多次试验中一致地解决问题,而不仅仅是侥幸成功一次。试点研究证明,衡量这种一致性的必要工具已经存在,且基础设施可以处理数据收集,即便目前的 AI 模型尚未准备好通过完整测试。研究结果表明,未来的评估必须超越简单的通过或失败评分,转而包含对 AI 行程的详细日志,测量它跌跌撞撞的次数、犹豫不决的程度,以及因外部中断而无法完成任务的频率。

这项工作的终极目标是为自动化软件工程建立一种新的信任标准。正如一名人类员工会因为表现反复无常和不可靠而被解雇一样,AI 助手也必须证明它能够以同样的稳定性履行职责。这项研究并不声称目前的 AI 模型已经解决了自动化修复的问题;事实上,试点数据表明,在严格条件下成功修复次数为零。相反,它提供了一个如何正确测试这些系统的蓝图。通过定义一致性的新指标并追踪导致失败的具体病理特征,研究人员为对人工智能进行更诚实、更严谨的评估奠定了基础。未来的路径包括运行具有更长时限和更强大模型的全规模实验,以观察一致性是否会提高,或者智能体是否只是在错误方面变得更加复杂。在此之前,业界必须认识到,在复杂的软件维护世界中,单次成功的修复不足以保证安全性或可靠性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →