Beyond the Commit: Developer Perspectives on Productivity with AI Coding Assistants
这项在纽约梅隆银行(BNY Mellon)开展的混合方法研究,通过 2,989 份调查问卷回复和 11 场访谈,认为评估 AI 编程助手需要一种全面的、多维度的评估方法,即纳入技术专业知识和工作所有权等长期的以人为本的因素,而非仅仅依赖传统的短期生产力指标。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你经营着一家规模宏大的建筑公司。多年来,你一直通过计算建筑工每小时砌多少块砖或每天完成多少面墙来衡量他们的生产力。但最近,你给每位建筑工都配备了一个神奇的助手机器人,它能瞬间建议下一块砖的位置、编写蓝图,甚至修复错误。
现在,你感到很困惑。这些机器人很受欢迎,但它们真的让公司变得更快了吗?如果确实如此,这种“快”是否还和以前是一回事?
这篇论文就像是一场由研究团队(来自卡内基梅隆大学和纽约梅隆银行)进行的深度调查,他们去采访了近 3,000 名这些“建筑工”(软件开发人员),试图弄清楚在这个 AI 机器人的新时代,该如何衡量成功。
以下是他们发现的研究成果,分为几个简单的部分:
1. 大大的困惑:快乐 vs. 快速
研究人员首先提出了一个简单的问题:“你对你的机器人助手满意吗?”以及“它为你节省了多少时间?”
- 结果: 大多数开发者说:“是的,我爱这个机器人!它让我的工作变得更容易了。”(86% 的人表示满意)。
- 转折: 但当被问到“你节省了多少时间?”时,大多数人说:“没多少。可能每周也就 30 分钟吧。”
类比: 想象你有一辆超级跑车,只需 5 分钟就能到达公司,但你却要在交通堵塞中耗费 45 分钟。你可能会因为这辆车既好玩又可靠而喜欢它,但你实际到达公司的时间并没有比以前更快。研究发现,开发者热爱使用 AI 的“感觉”,但这并不总是能转化为巨大的时间节省。这证明了你不能仅仅用一个数字(如“节省的时间”)来判断工具是否奏效。
2. 六条新游戏规则
既然旧的计数方式(每小时砌砖数)不再适用,研究人员采访了 11 位开发者以寻找新的衡量成功的方法。他们发现了 六个不同的影响因素,并将其分为项目的三个阶段:
阶段 A:建造过程中(“当下”的感觉)
- 自给自足(“自助式”超能力):
- 以前: 如果建筑工不知道如何修理漏水的管道,他们必须停下手头的工作,去请教资深专家,或者去翻阅庞大的手册库。
- 现在: 机器人会在他们耳边低语答案。他们觉得自己像个超级英雄,可以无需离开座位就解决问题。
- 挫败感与大脑负荷(“精神拉锯战”):
- 隐患: 机器人并不完美。有时它会提供一个看起来正确但实际上错误的方案。开发者必须停下来,深入思考,并反复检查每一项内容。这甚至可能让他们感到更累、更沮丧,即便他们打字的速度变快了。
阶段 B:移交钥匙(团队审核)
- 任务完成速度(“吞吐量”检查):
- 这是老派的指标:我们完成工作的速度有多快?研究发现,虽然 AI 有所帮助,但它并不总是意味着工作完成得更快。有时它只是意味着工作完成得更轻松,但节省的时间其实很少。
- 同行评审(“安全检查”):
- 以前,资深建筑工会检查初级工的作品。现在,如果初级工使用了机器人,资深工不得不询问:“这是你写的,还是机器人写的?”如果代码是机器人写的,资深工就必须花额外的时间去理解这些代码,以确保其安全性。有时,机器人会让代码看起来“过于完美”或令人困惑,从而增加了安全检查的难度。
阶段 C:长远发展(建筑工的未来)
- 技术专业知识(“学习曲线”):
- 风险: 如果初级建筑工过度依赖机器人进行思考,他们可能永远学不会如何亲手修理漏水的管道。他们可能会成为擅长按按钮的人,但在理解水管原理方面一窍不通。研究警告说,如果我们不小心,可能会创造出这样一代离不开机器人的开发者。
- 所有权(“创作的自豪感”):
- 感受: 开发者喜欢说“这是我造出来的”。如果机器人写了 90% 的代码,他们还会感到自豪吗?如果出了问题,他们还会承担责任吗?研究发现,开发者担心如果不是亲手编写代码,他们会对作品缺乏深层的连接感,并且在以后出现故障时,修复速度可能会变慢。
3. 这取决于你在做什么
研究人员还发现,AI 在不同任务中的表现各异:
- 构建新事物: 机器人在提供一个良好的开端方面表现出色,但你必须小心不要盲目地复制粘贴。
- 修复旧代码: 机器人在这里表现挣扎,因为它需要大量的上下文信息。这就像是用一个只知道如何盖新房子的机器人,去修理一座 50 年历史的老房子。
- 编写手册或测试: 这是机器人的强项。它就像是一个能瞬间为你刚建好的房子写好说明书的机器人。这节省的时间最多。
核心结论
论文的结论是,我们需要停止寻找衡量生产力的单一“魔法数字”。
类比: 想象一下,如果你试图仅通过计算一名厨师端出了多少盘菜来评判其技能。如果他使用机器人来切菜,他可能会端出更多的菜肴,但如果机器人让食物变得难吃,或者厨师因此忘记了如何烹饪,那么餐厅最终还是会失败。
要真正了解 AI 编程助手是否真的有所帮助,我们需要观察全局:
- 开发者是否快乐?
- 他们是在学习,还是仅仅在复制?
- 他们是否对代码有责任感?
- 团队的检查是否有效?
作者认为我们需要一种“整体性”的视角——一个既重视人类体验,也重视长期成长的平衡计分卡,而不仅仅是关注输出的速度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。