← 最新论文
💻 computer science

BulkPR-Bench: Benchmarking Queue-Level Governance of Interacting Pull Requests

本文介绍了 BulkPR-Bench,这是一个用于评估编程智能体在通过共同确定安全合并顺序来治理交互式拉取请求的能力方面的新基准,研究表明,尽管当前模型在处理关系依赖方面有所改进,但在实现可靠的全队列治理方面仍面临困难。

原作者: Zetong Xiong, Qiao Zhao, Jun Zhang, Xueying Lyu, Zhi Li, Yixiang Tu, Xiaowen Yang, Yunjie Zhang, Yufeng Wang, Zhe Zhang, Kaize Yu, Hanwen Du, Zhongkai Sun, Zhuoxin Liu, Zekun Lin, Jianwen Yang, Ruinin
发布于 2026-08-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Zetong Xiong, Qiao Zhao, Jun Zhang, Xueying Lyu, Zhi Li, Yixiang Tu, Xiaowen Yang, Yunjie Zhang, Yufeng Wang, Zhe Zhang, Kaize Yu, Hanwen Du, Zhongkai Sun, Zhuoxin Liu, Zekun Lin, Jianwen Yang, Ruining Chen, Ying Zhang, Tingxuan Pan, Ke Chen, Shubin Han, Chuanhao Sun, Yehua Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个规模宏大、混乱不堪的建筑工地,数百支队伍正试图在同一栋摩天大楼中同时建造不同的房间。在软件世界中,这些“房间”被称为拉取请求(Pull Requests,简称 PR)——即对代码库提出的变更建议。通常情况下,一位团队负责人(或自动化系统)会一次检查一个提案。如果看起来没问题,就允许其通过;如果看起来有问题,就将其退回。当每个人都在处理独立的、隔离的任务时,这种方式运作良好。

但如果各支队伍开始互相干扰,情况会变成怎样呢?也许 A 队正在建造一扇新门,而 B 队正试图在旁边安装一扇窗户,同时 C 队正试图加固门和窗都需要的那面墙。如果你不观察全局,只是一个接一个地让他们进入,你可能会得到一扇尺寸不合的门、一扇挡住门的窗户,或者一面坍塌的墙。这就是**相互影响的拉取请求(interacting pull requests)**的问题。计算机科学家面临的重大课题是:我们能否构建一个“智能经理”(AI 智能体),它不仅仅是逐个检查房间,而是能观察整个建筑工地,弄清楚哪些队伍在冲突,哪些队伍需要协作,并决定完美的准入顺序,从而确保建筑不会倒塌?

这正是论文 BulkPR-Bench 所要解决的问题。研究人员创建了一个巨大的、棘手的测试,旨在测试目前的 AI 编程助手是否能担任这些“智能经理”。他们设定了一个包含 18 个不同真实软件项目和 581 个复杂变更的情景。目标不仅是看 AI 能否修复单个漏洞,而是看它能否管理一整队列的变更,理清它们之间隐藏的关系(例如“在 A 队完成之前,B 队无法开始”),并安全地合并它们。

研究结果呈现出一种“不算太差,但仍有很长路要走”的状态。AI 智能体在发现某些问题点方面表现得相当出色。表现最好的 AI 模型能够安全地合并大约 66.6% 的复杂变更组,这比以往那种一次只检查一个的简单方法(仅能达到约 53.1%)要好。然而,当涉及到终极目标——即在不犯任何错误的情况下成功合并整个队列中的每一个变更时,AI 显得有些吃力。在 324 次管理完整队列的尝试中,只有 8 次是完美的。

论文指出,虽然这些 AI “经理”在理解不同代码变更之间如何相互关联方面变得越来越好,但它们目前还不足以可靠地独立运行整个建筑工地。它们经常会遗漏隐藏的冲突或弄错顺序,导致不安全的合并。研究人员发现,给 AI 提供更多信息(让它同时看到更多变更)会有所帮助,但这并不能完全解决问题。简而言之,AI 正在学习成为小型团队的优秀工头,但它离成为整栋大楼的总承包商还有一段距离。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →