← 最新论文
💬 NLP

AI-assisted pre-review of open-source software submissions: an experience report from BOSC 2026

这份来自 BOSC 2026 的经验报告详细介绍了开发并评估了一种利用智能体技能(agentic skills)和自动化容器化测试来辅助人类评审员评估开源软件提交的 AI 辅助预审系统,结果表明,尽管评审员认为该工具很有用,但他们更倾向于验证其发现,而非盲目信任。

原作者: Tazro Ohta, Nomi L. Harris, Seth Carbon

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Tazro Ohta, Nomi L. Harris, Seth Carbon

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

科学大洪水与机器人助手

想象一下,科学世界就像一座巨大且繁忙的图书馆,研究人员在这里不断撰写关于世界运作方式的新书。长期以来,这座图书馆依赖于一小群志愿者图书管理员来阅读每一本新书,检查事实是否真实,并决定哪些书足够优秀可以被放入书架。但最近,一种被称为“生成式人工智能(Generative AI)”的神奇新工具出现了。这个工具就像一个超快速的写作助手,能帮助研究人员更快地编写他们的书籍。虽然这听起来很棒,但也制造了一个巨大的问题:图书馆突然被成千上万的新手稿淹没了,而志愿者图书管理员们正面临溺水的危险。他们根本没有足够的时间去阅读每一页、核实每一个事实或测试每一个实验。

这个故事发生在一个被称为生物信息学(bioinformatics)的特定科学领域,这基本上是利用计算机解决生物学谜题(如解码 DNA 或追踪病毒)的艺术。在这个领域,一条金科玉律是开放性:科学家应该分享他们的代码(计算机程序的指令)和数据,以便任何人都能检查他们的工作。这对于**可重复性(reproducibility)**至关重要,即如果你给别人完全相同的原料和指令,他们应该能够做出完全相同的结果。如果一位科学家说:“我发明了一种新药,”却拒绝分享配方,那么没有人会信任他们。这篇论文所应对的挑战既简单又紧迫:当新书的洪流大到人类志愿者无法独自应对时,我们如何保持图书馆的顺畅运行,同时又不让机器人接管决定好坏的工作?


BOSC 实验:机器人图书管理员的第一天

2026 年,**生物信息学开源会议(BOSC)*的组织者决定尝试一次大胆的实验。他们知道他们的志愿者评审员已经感到疲惫不堪。因此,他们并没有要求机器人做出最终决定,而是构建了一个“机器人助手”,在人类开始阅读之前*完成那些枯燥、繁重的体力活。他们将这个系统称为 bosc-pre-review,并且它有一个特别的搭档名叫 Runabilly

把评审过程想象成一场选秀节目的评委。通常,评委需要检查三件事:麦克风插好了吗?歌手带了自己的乐谱吗?最重要的是,歌手能否在不绊倒脚的情况下唱出高音?过去,人类志愿者必须亲自完成所有这些工作。有时,检查“麦克风”(代码)是否真的起作用需要花费数小时来摆弄电线和软件。

为了这次实验,组织者搭建了一条数字流水线。首先,bosc-pre-review 机器人扫描了每一份提交。它并不试图猜测科学研究是否卓越或想法是否“酷”。相反,它扮演着一个非常严格的事实核查员的角色。它检查作者提供的链接,以查看:

  • 门开着吗?(我们真的能找到代码吗?)
  • 许可证有效吗?(他们是否允许他人使用它?)
  • 这是一首新歌吗?(这个项目以前在这次表演中出现过吗?)
  • 乐队还在活跃吗?(人们还在研究它吗?)

接着轮到了 Runabilly,这是最令人兴奋的部分。想象一个机器人,它为每一个项目构建一个微小的、一次性的“沙盒”(一个安全、隔离的计算机房间)。它会将代码克隆到这个沙盒中,尝试构建它并运行它,以观察它是否真的可以工作。如果代码崩溃了,机器人会说:“哎呀,这个坏了。”如果成功了,它会说:“成功!”这节省了大量时间,因为对于人类来说,构建和测试软件可能会带来数小时的挫折感;而机器人可以在几分钟内安全地完成,绝不会危及人类评审员自己的电脑。

结果:是一个得力的助手,而非老板

团队在 60 份提交件上运行了该系统。以下是他们的发现:

  • 机器人速度快且基本准确: AI 成功检查了几乎所有人的链接和许可证。它发现 39 个项目有可用的链接,37 个项目有有效的许可证。它发现了 3 个项目存在失效链接,以及 3 个项目缺少许可证,如果人类在匆忙处理时可能会忽略这些问题。
  • “新鲜度”检查: 机器人非常擅长识别旧项目。它发现 60 份提交中的 50 份是针对本次会议的新项目,而 10 份是过去四年中出现过的项目的更新。它甚至抓住了作者试图通过稍微更改标题来混入旧项目的案例。
  • “可运行性”的惊喜: 当机器人尝试构建并运行代码时,它发现 17 个项目完美构建并通过了所有测试。然而,有 18 个项目虽然构建成功,但遇到了“警告(WARNING)”。这并不意味着代码很差,而是意味着机器人的微型沙盒缺少了代码所需的某些东西,比如特殊的显卡或付费数据库。5 个项目完全失败,4 个项目仅仅是数据或训练材料,无法被“构建”。
  • 人类的触感: 最重要的发现不在于数字,而在于人。评审结束后,组织者询问了 28 名人类志愿者。其中 17 人作答。在这些人中,有 15 人查看了机器人的笔记。
    • 13 人表示,机器人在检查链接和许可证等枯燥事实方面非常有帮助。
    • 10 人表示它为每项评审节省了至少 3 分钟,有 2 人表示节省了超过 15 分钟
    • 至关重要的是,没有人完全信任机器人。 每一位使用了机器人笔记的评审员都表示,他们仍然会反复检查机器人的工作。一位评审员指出:“在使用 AI 工具时,我处于‘验证一切’的阶段。”他们喜欢这种帮助,但并不希望机器人做最终决定。

机器人没做的事(以及为什么这很重要)

论文非常明确地说明了机器人没有做的事情。它没有决定哪些项目被接受或拒绝。所有的决定都是由人类做出的。机器人也没有试图判断“创造力”或“相关性”,因为这些过于主观。一位评审员认为,让机器人猜测一个项目是否“相关”会引入偏见,而这种判断应当留在能够承担责任的人类手中。

作者还发现,机器人有时会犯一些小错误,但通常是因为给它的规则有点模糊。例如,如果一个项目的许可证文件与作者写下的不符,机器人可能会感到困惑。论文指出,问题不在于机器人的大脑,而在于给它的指令。如果规则清晰,机器人就很出色;如果规则模糊,机器人也会变得模糊。

底线

这次实验表明,AI 可以成为会议中出色的“预审员”。它可以处理像检查链接、验证许可证和测试代码是否实际运行这类乏味的机械任务。这释放了人类志愿者,让他们能够专注于需要人类心灵和智慧的部分:判断科学的质量和创意的价值。

论文总结道,虽然机器人是一个伟大的助手,但它不是替代品。志愿者们对节省下来的时间表示赞赏,但他们对让 AI 做出最终选择仍持怀疑态度。正如作者所言,科学评审的未来不在于机器人接管一切,而在于机器人承担重活,从而让人类能够进行思考。这次实验是成功的,但这仅仅是个开始。团队已经在考虑如何改进明年的规则,以及如何让机器人变得更聪明,同时始终让人类志愿者稳坐驾驶位。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →