← 最新论文
💻 computer science

LLM-Assisted Empirical Software Engineering: Systematic Literature Review and Research Agenda

本系统文献综述分析了 2020 年至 2025 年的 50 项研究,以描绘大语言模型在实证软件工程中的应用现状,强调其主要用于自动化程度高的数据处理任务,同时指出在人本整合、透明性和可重复性方面存在关键缺口,从而为未来研究议程提供指导。

原作者: Victoria Gomes, Delaney Selb, Fabio Palomba, Rodrigo Spinola, David Lo

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Victoria Gomes, Delaney Selb, Fabio Palomba, Rodrigo Spinola, David Lo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,实证软件工程(ESE) 领域就像一家规模宏大、风险极高的侦探事务所。这些侦探(研究人员)花费时间破解关于软件如何构建、为何出错以及开发者如何工作的谜团。为了侦破这些案件,他们必须从堆积如山的证据中筛选:数百万行代码、数千份缺陷报告,以及与开发者无休止的访谈。

多年来,这些侦探一直依靠手工或非常具体、单一用途的工具来完成这项工作。但证据的堆积已超出人力所能处理的范围。此时,大语言模型(LLMs) 登场了——把它们想象成超级聪明、不知疲倦的机器人实习生,能以闪电般的速度阅读、总结和分类文本。

本文是一篇系统文献综述,本质上是一份关于这些机器人实习生目前在侦探事务所中如何被使用的“成绩单”。作者审查了 50 项近期研究,以了解这些实习生实际在做什么、做得有多好,以及侦探们是否记录了足够的笔记来证明工作是如何完成的。

以下是他们发现的详细分解,使用了简单的类比:

1. 机器人实习生实际在做什么?(任务)

研究发现,实习生主要被用于排序和分级,而非从头开始解决谜团。

  • “分类员”角色:最常见的工作是处理堆积如山的论文或代码,并将它们分类到不同的盒子中(例如,“相关”与“不相关”,或“缺陷”与“功能”)。
  • “评分员”角色:它们常被要求对某事物打分或贴标签(例如,“这份代码审查是否有用?是/否”)。
  • “过滤器”角色:它们像筛子一样,只让重要信息通过,阻挡噪音。

比喻:想象一位擅长按颜色或大小整理书籍的图书管理员,但尚未被要求创作新故事或解决复杂谜团。实习生非常擅长枯燥、重复的归档工作,但它们尚未成为“首席侦探”。

2. 它们在流程的哪个阶段工作?(阶段)

研究生命周期有不同的阶段:规划、收集证据、分析证据和撰写报告。

  • 最佳区间:实习生在中间阶段(收集和数据分析)被大量使用。这是“数据处理”发生的地方。
  • 空白区:它们极少在最初阶段(规划研究)或最后阶段(撰写最终报告)被使用。
  • 比喻:这就像雇佣机器人来洗碗和叠衣服,但你仍需自己做饭和摆桌子。机器人处理混乱、重复的清理工作,但创意和最后的润色仍由人类完成。

3. 它们如何与人类协作?(整合)

作者发现,这种关系主要是自动化,而非协作

  • 自动化(“自己动手”模式):在大多数情况下,人类向机器人下达指令,机器人独自完成整个任务,不再回头。人类只需接收结果。
  • 决策支持(“顾问”模式):这种情况很少见。这相当于机器人说:“我认为选项 A 最好,但这里有另外三种可能性及其原因”,将最终选择权留给人类。
  • 比喻:目前,机器人就像自助结账机。你把商品放进去,它扫描,然后你离开。它不像一位私人购物助理,会陪着你,推荐商品,并在你购买前询问:“你喜欢这个吗?”

4. 好坏之处是什么?(优势与局限)

好的方面(优势):

  • 速度:机器人速度极快。它们能在几分钟内处理数年的数据。
  • 规模:它们能处理人类需要数年才能读完的庞大证据堆。
  • 一致性:它们不会感到疲倦或无聊,因此对每个项目都应用相同的规则。

坏的方面(局限):

  • 幻觉:有时机器人会编造内容。它可能会自信地陈述一个完全错误的事实。
  • 敏感性:机器人对提问方式非常敏感。如果你指令中改变一个词,答案可能会完全改变。
  • 不一致性:如果你两次问同一个问题,可能会得到两个不同的答案。
  • 比喻:机器人就像一个非常快、非常自信但有时会猜测的学生。它可以在一小时内读完整个图书馆,但如果你不小心,它可能会编造一本不存在的书。

5. 它们是否做好了记录?(可复现性)

这是本文的一项重大发现。大多数侦探并没有记录下他们如何使用实习生。

  • 要重复一项研究(可复现性),你需要确切知道使用了哪个机器人、机器人的版本是什么,以及你给出的确切指令(提示词)是什么。
  • 研究发现,许多研究忘记记录这些内容。它们只是说“我们使用了人工智能”,而没有说明是哪一个,或者如何向它提问。
  • 比喻:想象一位厨师发布食谱说:“我使用了一种特殊的香料让这道菜味道极佳”,但没有说明是哪种香料、用了多少、以及何时添加。你就无法重现这道菜。本文指出,软件工程界目前在分享使用这些 AI 工具的“食谱”方面做得很差。

总体结论

本文得出结论,AI 在软件研究中的应用正在快速增长,但目前非常狭窄

  • 我们使用 AI 来做“苦力活”(排序、过滤、分级)。
  • 我们尚未利用它来帮助人类思考、规划或做出复杂决策。
  • 我们没有足够谨慎地记录如何使用它,这使得结果难以信任或实验难以复现。

最终启示:机器人实习生在重体力劳动方面很有帮助,但人类侦探需要开始将它们视为合作伙伴,而不仅仅是工具,并且需要开始确切记录它们的使用方式,以便他人能从他们的工作中学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →