← 最新论文
🤖 AI

How Do Practitioners Build SE Agents? Insights from a Mixed-Methods Study

通过对100名从业者的混合方法研究,本文揭示了构建软件工程智能体使开发瓶颈从编码转向了需求和协调等非编码活动,从而促进了一种以评估为驱动的工作流,其特征是包含一个七阶段的过程,并面临诸如评估信号不可靠和理解债等挑战。

原作者: Yunbo Lyu, David Williams, Jieke Shi, Zhensu Sun, Chao Peng, Zhou Yang, Federica Sarro, David Lo

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunbo Lyu, David Williams, Jieke Shi, Zhensu Sun, Chao Peng, Zhou Yang, Federica Sarro, David Lo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,软件开发曾经就像是用锤子和锯子盖房子。你必须亲手切割每一块木板,钉好每一片瓦片,并手工打磨每一个表面。这很慢,很累,而“难点”仅仅是挥动那把锤子。

现在,想象有人递给你一个神奇的、超高速的机器人,它可以在眨眼之间切割、钉钉子并打磨好一整栋房子。突然间,锤子不再是问题了。问题在于,这个机器人太快了,在你还没画完蓝图时,它就已经盖好了一座豪宅。

这正是当开发者开始使用 SE agent(编写代码的 AI 机器人)时所发生的情况。由研究人员对来自 12 家不同公司20 位建设者 进行访谈,并向另外 80 人 进行问卷调查后发现,虽然机器人让编写代码变得廉价且快速,但并没有让这项工作消失。相反,“瓶颈”(流程中的交通堵塞)只是转移到了道路的其他部分。

以下是研究人员通过一位好奇探险家的语言所发现的内容。

新的七步舞步

论文指出,构建这些 AI agent 不再是一条直线,而是一个包含七个步骤的循环舞步。它不像工厂的流水线那样线性,更像是一款视频游戏,你需要不断重玩关卡以获得更高的分数。

  1. 蓝图(需求/Requirements): 你告诉机器人要做什么。但现在,你必须把指令写得足够清晰,以便人类和机器人都能读懂。
  2. 计分卡(评估/Evaluation): 这是最重要的全新步骤。你不仅仅是在最后检查工作结果;你还要使用一张计分卡在机器人工作时对其进行引导。
  3. 燃料(数据/Data): 你喂给机器人优秀的范例,让它从中学习。
  4. 建造(系统构建/System Construction): 你为机器人挑选一个“大脑”(模型),并在它周围构建一个“护具”(一套带有工具和记忆的盔甲)。
  5. 试驾(测试与部署/Testing & Deployment): 你让机器人运行,看看它是否会崩溃。
  6. 反馈环(人类反馈/Human Feedback): 你观察它的行为,并告诉它:“不,按这种方式做,”或者“是的,做得很好。”
  7. 调优(自适应维护/Adaptive Maintenance): 机器人的大脑可能会从它的创造者那里获得更新,从而改变其思考方式。你必须不断调整你的“护具”以跟上步伐。

伟大的转变:从挥锤者到机器人管理者

研究发现,由于机器人写代码的速度极快,过去那种“编码是难点”的观念已被推翻。研究人员认为,编码从来不是最难的部分,它只是最显眼的部分。

现在,当机器人承担了繁重的体力活,真正的核心工作已转向了评审评估

  • “氛围编程”(Vibe Coding)效应: 由于机器人构建东西的速度极快,研究员、工程师和经理之间的界限正在模糊。一个人现在可能完成整个工作流程:从构思创意到修复最终的 Bug。
  • “黑盒”问题: 研究人员指出,因为机器人是一个“黑盒”(你无法看到它具体的思考过程),所以你不能仅仅信任它。你需要一种严格的**评估驱动开发(Evaluation-Driven Development)**风格。这意味着你在开始之前就要定义成功的规则,并不断检查机器人是在变得更好,还是仅仅变得更快。

六大陷阱(挑战)

即便拥有超高速的机器人,建设者们仍会遇到六个主要的障碍。论文指出,这些都是真实的、棘手的难题,而非微小的故障。

  1. 破碎的计分卡: 你如何知道机器人做得好不好?研究人员发现,用于给机器人评分的“测试”经常是破碎的。有时机器人找到了一个比预期更好的方案,但测试却判定为“失败”,因为它还在寻找旧的答案。其他时候,测试本身运行起来成本太高,无法频繁执行。
  2. “改动无物,却改变一切”的诅咒: 这是一个诡异的现象。研究人员发现,如果制造机器人大脑的公司更新了模型(即使你没有改动任何代码),你的机器人可能会突然表现得完全不同。昨天还能用的工具,今天可能就失效了,尽管你一行代码都没改
  3. 安全 vs 速度: 建设者们通常承认他们既害怕机器人,又为了赶进度而任由其运行。论文指出,这样做是危险的。有一个团队放任机器人运行,结果它因为忘记了指令,意外删除了用户的家目录。
  4. “潜规则”差距: 机器人只能阅读写下来的内容。但在现实生活中,很多知识只是“存在于人们脑海中”的(比如为什么某面墙建得歪歪扭扭)。研究人员发现,机器人无法获取这些“未言明”的知识,从而导致混乱。
  5. 理解债(Comprehension Debt): 这是最大的惊喜。机器人编写代码的速度超过了人类理解的速度。这就像机器人一天之内盖起了一座摩天大楼,而你还在努力理解蓝图。建设者们正在积累他们无法理解的代码“债务”。为了解决这个问题,一些团队开始保存用于“重建代码的指令”,而不是仅仅保存代码本身。
  6. 虚假的生产力: 如果你只计算机器人写了多少行代码,看起来每个人都极其高效。但研究人员认为这是一个陷阱。编写一万行没人理解或没人需要的代码并不是“生产力”,那只是“噪音”。

我们有多确定?

研究人员对这些发现非常有信心,因为他们不仅仅是在猜测,而是在进行测量

  • 他们采访了 20 位专家,并对 80 多人 进行了调查。
  • 当他们询问调查组是否同意这些发现时,91% 的人认同新的工作流,且有 71% 至 95% 的人认同具体的挑战。
  • 他们甚至回到最初的受访者那里进行核实(这一过程称为“成员校验”),专家们表示:“是的,这正是我们正在做的事情。”

核心结论

论文表明,构建 AI agent 并没有让软件工程变得容易,它只是让其变得不同了。所谓的“难点”已经从编写代码转移到了管理机器人、检查其工作,以及确保它不会意外删除整个互联网。

研究人员总结道,随着实现成本变得低廉,瓶颈并不会消失——它们只是发生了转移。构建软件的未来不在于打字更快,而在于成为一个更好的管理者、一个更严格的评判者,以及一个为那些承担重活的机器人提供智慧架构的设计师。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →