How Do Software Professionals Evaluate AI-Generated Code? (Registered Report)
本注册报告概述了一项建构主义扎根理论研究,该研究将已完成的问卷调查与迭代访谈相结合,旨在构建一个关于软件专业人员如何评估 AI 生成代码的理论。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你刚刚把一个巧克力蛋糕的食谱交给了一个机器人厨师。机器人发出嗡嗡声、旋转着,然后吐出了一个看起来完美的蛋糕。但转折在于:你并没有亲手烘焙它。你必须品尝它,检查它的配料,并在把它端给朋友们之前,决定它是否可以安全食用。
这正是软件专业人士目前正在做的事情——使用生成式人工智能(Generative AI)。像 GitHub Copilot 和 ChatGPT 这样的工具就像那些机器人厨师,以极快的速度编写出代码行。但尽管机器人的速度越来越快,人类却仍然困在厨房里,试图弄清楚:这段代码真的好吗?还是一个看起来美味的陷阱?
这篇论文并不是一份关于成品蛋糕的报告;它是一份新研究的“食谱”(称为“注册报告”),作者们才刚刚开始烘焙它。他们想要了解人类目前是如何去品尝、测试并信任这些由 AI 创造的作品的。
巨大的谜团:我们在检查蛋糕吗?
作者们怀疑情况正变得复杂。当你亲自编写代码时,你了解每一种配料。但当 AI 编写代码时,代码中可能隐藏着漏洞、奇怪的味道,或者你并未要求的成分。
论文指出,由于每个人都处于匆忙之中(截止日期、竞争、老板在背后催促),开发者可能会倾向于走捷径。与其仔细品尝每一口,他们可能只是假设机器人厨师做得很好。这就像是相信一根魔杖可以帮你修复作业,而不需要阅读答案一样。作者们担心这会导致过度依赖(over-reliance),即人类停止批判性思考,仅仅让 AI 来完成工作,这可能会导致混乱且破碎的软件。
计划:侦探的工具包
为了解决这个谜团,研究人员不仅仅是在靠猜测。他们正在基于来自真实人物的真实故事构建一个理论。以下是他们的游戏计划:
- 第一个线索(调查问卷): 他们已经询问了芬兰的 163 名软件专业人士的想法。他们问的问题包括:“你会以不同于人类代码的方式来检查 AI 代码吗?”以及“你对这些工具的信任发生了变化吗?”他们得到了 51 个关于验证的回答,79 个关于保持生产力的回答,以及 103 个关于信任如何转变的回答。
- 深度挖掘(访谈): 现在,他们想要采访 20 到 50 名这些专业人士。他们不仅仅是在问“你喜欢这个蛋糕吗?”他们使用的是一种被称为**“阶梯法”(laddering)**的特殊技术。
- 想象一把梯子: 他们从一个具体的行动(底层的横木)开始,比如“我运行一个针对代码的测试”。然后他们会问,“为什么这很重要?”(更高一级的横木)。答案可能是“因为我需要感到安全”。然后他们再问,“为什么感到安全很重要?”(顶层的横木)。答案可能是“因为我不想丢掉工作”或者“因为我关心我的名誉”。
- 这有助于他们从简单的习惯一直攀爬到驱动这些习惯的深层价值观和恐惧。
他们在和谁交流?
他们正在寻找真正使用这些工具的人。从最初的调查来看,他们找到了一个由 163 人组成的混合群体。大约 48.5% 的人拥有不到 10 年的经验,而 12.9% 的人拥有 30 年以上的经验。这个群体包括了全栈开发人员、架构师、数据科学家,甚至还有 CEO。他们想听取所有人的声音,从职场新人到资深专家。
他们“不是”在做什么
了解这项研究不是关于什么的非常重要:
- 他们不是在试图证明 AI 是好是坏。
- 他们不是在测量 AI 具体制造了多少个 Bug(那是另一项研究)。
- 他们不是在说他们已经有了最终答案。事实上,他们承认在开始访谈之前,他们并不确切知道自己会发现什么。他们保持着开放的心态,让答案来带给他们惊喜。
研究背后的“为什么”
研究人员持有一定的怀疑态度。其中一位首席作者是一名从未在真实软件公司工作的博士生。他既好奇又谨慎,担心人们可能会在没有意识到自己的情况下,让 AI 取代了自己的技能。另一位作者多年来一直研究如何衡量代码质量,他担心我们可能正在用旧的规则来衡量这些全新的、神奇的工具。
他们认为知识不仅仅是像“发现”一枚丢失的硬币那样被“找到”;它是通过与人交谈并理解他们的故事而“构建”出来的。他们想要建立一个理论,解释软件专业人士在与 AI 协作时,是如何构建他们对于信任和安全的现实认知的。
底线
这篇论文是一份邀请,邀请你去观察一场科学实验的展开。研究人员正在聚集一群 20–50 名专家来攀爬思想的“阶梯”,希望能发现为什么他们会信任(或不信任)那些代码机器人所写的代码。他们并不承诺提供解决糟糕代码的奇迹疗法,但他们承诺会对人类如何努力跟上机器步伐的过程进行一次深刻、诚实的观察。
正如他们所说,他们想要理解厨房里人们的主观体验。因为直到我们知道他们对蛋糕的感觉如何,我们才能确定那个机器人厨师是一位天才,还是仅仅运气好而已。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。