← 最新论文
💻 computer science

Predicting Acceptance and Review Effort in Human and Agent Pull Requests

本文表明,仅使用提交时特征的机器学习模型可以准确预测人类和智能体拉取请求的接受情况,但在预测评审工作量方面表现不佳,这说明其最佳用途是作为分流的辅助工具,而非自动化决策者。

原作者: Kartik Ghanshyambhai Pansuriya, Ehsan Ghorbani, Deepak Singh, Eman Abdullah AlOmar

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Kartik Ghanshyambhai Pansuriya, Ehsan Ghorbani, Deepak Singh, Eman Abdullah AlOmar

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个繁忙的软件工作坊,代码变更就像是等待发货的包裹。在旧时代,只有人类工人负责发送这些包裹。但现在,一群新的 AI 机器人加入了团队,它们也开始和人类一起投递自己的代码包。管理者们(被称为“维护者”)突然感到应接不暇。他们面临着堆积如山的包裹需要检查,而且他们需要立即知道两件事:哪些包裹会被批准并发出? 以及 哪些包裹需要进行极其繁重且令人精疲力竭的检查?

这篇论文就像是一个侦探,试图仅凭包裹到达时外部可见的线索来解开这个谜团,甚至在有人打开盒子或开始讨论之前。

重大发现:“包裹标签”透露了大量信息

研究人员发现,仅仅通过观察标签和它所在的盒子,你就能相当准确地猜测一个包裹是否会被接受。他们构建了一个智能计算机系统,观察诸如以下内容:

  • 标签上描述的长度。
  • 盒子内包含的文件数量。
  • 发送包裹时的时间点。
  • 包裹来源工作坊的声誉。

当他们测试这个系统时,计算机在识别“已批准”包裹方面表现得非常出色。事实上,表现最好的模型(使用一种称为“随机森林”的方法)在正确识别哪些包裹会被接受方面的得分达到了 0.958(总分为 1.0)。这就像是一个侦探仅凭瞥一眼地址就能解决 100 桩案件中的 96 桩一样!

然而,这里有一个陷阱。 论文明确警告说,这个系统并不是一个神奇的“是/否”按钮。计算机擅长于将“很可能通过”与“很可能拒绝”进行分类,但它本身并不完美到足以独立做出最终决定。研究人员建议将其作为一名得力的助手,用来告诉管理者:“嘿,先看看这个!”而不是一个无需人类查看就直接说“发货!”的自动化机器人。

更难的谜团:需要付出多少工作量?

第二个问题更难了:“审查这个包裹需要多少精力?”研究人员尝试预测两件事:包裹会收到多少条评论(即“闲聊量”)以及它在排队等待发货前会在队列中停留多少小时(即“等待时间”)。

在这里,结果要平庸得多。计算机预测评论数量的平均误差约为 1.00 条评论,但它只能解释为什么有些包裹会获得更多评论的 20% 的原因。预测等待时间甚至更加困难;计算机的猜测平均偏差为 24.00 小时,且仅能解释 12% 的变动。

为什么这会这么难?论文指出,等待时间不仅仅取决于包裹本身。这就像等公交车:即使你的票是对的,如果你等到的司机正在休息、交通拥堵或者车上人满了,你可能仍然要等很久。同样,一个代码包可能会等待很久,是因为审查员正忙、自动化测试工具运行缓慢,或者团队本身的工作流程较慢。论文认为,你无法仅通过观察包裹标签来预测这些“交通堵塞”。

人类 vs. 机器人:它们的规则不同吗?

团队还想知道,AI 机器人的包裹是否比人类的包裹更难预测。他们发现,AI 包裹实际上更容易分类,因为它们遵循非常整齐、规律的模式。而人类的包裹则更加杂乱且多变。

有趣的是,AI 包裹往往会产生更多的“闲聊”(评论),并且发货时间稍长。论文认为,这可能是因为人类管理者在格外小心,通过双重检查来确保机器人没有隐藏任何小花招。但尽管有这种额外的审查,计算机预测机器人和人类结果的能力依然相当。

论文对哪些情况说“不”

了解这项研究没有做的事情也很重要。研究人员明确排除了使用任何在包裹被打开之后出现的信息。他们没有查看人们写的评论、自动化测试的结果或最终的合并决策。如果他们使用了这些信息,那就好比是在地面淋湿之后再去预测天气。这项研究的核心意义在于,看你是否能在降雨开始之前就猜出结果。

他们也排除了利用计算机取代人类审查员的可能性。结果表明,虽然计算机是一个优秀的“分流”工具(就像指挥车辆的交通警察),但它无法完全解释导致审查过程漫长的复杂的社会性和工作流原因。

核心结论

简而言之,论文表明我们可以构建一个智能系统来帮助管理者优化工作优先级。如果一个包裹拥有清晰的标签、合理的规模,并且来自可靠的来源,系统就可以说:“这个看起来很安全,我们先检查这个。”但当涉及到猜测审查需要多久或会有多少争论时,系统就会遇到瓶颈。论文的结论是,这些工具最适合作为人类判断的得力助手,而不是替代品。如果加入更多线索(例如审查员当前的忙碌程度或代码本身的逻辑),这项技术未来可能会变得更好,但就目前而言,“盒子外部”的线索只能讲述故事的一部分。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →