大局观: “魔法笔”实验
想象一个烹饪课,学生们每个学期都要烘焙一种特定的蛋糕。在五年的时间里,老师一直在观察他们是如何烘焙的。然后,在 2022 年底,一支“魔法笔”(大语言模型或 LLM)问世了。只要学生提出要求,这支笔不仅能写出食谱,甚至还能帮学生搅拌面糊。
研究人员想知道:是这支魔法笔帮助学生更好地学会了烘焙,还是它只是让蛋糕看起来很华丽,却让学生忘记了如何烘焙?
他们查看了 10 个学期的数据(魔法笔出现前 5 年和出现后 5 年),数据来自一门研究生级别的计算机科学课程。他们专注于一个从未改变过的特定编程作业,将其作为那份不变的蛋糕食谱。
他们的发现:“膨胀”效应
研究人员注意到,在魔法笔出现后,发生了一些非常奇怪的事情:
更多更替,更少进步: 在魔法笔出现之前,学生会通过细微、谨慎的修改来修复代码错误。而在魔法笔出现后,学生开始在每次提交之间进行巨大的、大规模的改动。
- 类比: 想象你正在修改一个句子。以前,你可能会改动一个单词来修正拼写错误。有了魔法笔后,你可能会删除整个段落,然后粘贴一段长出三倍的新段落,即便新版本其实并没有更好。
- 数据: 学生在尝试之间修改的代码量增加了三倍。他们提交的代码总量增长了 500%。
“满分”幻象: 几乎每个人在特定的作业上都拿到了满分。
- 类比: 这就像班里的每个人突然都在考试中拿到了“A”。但老师意识到,这些拿到“A”的学生只是从魔法笔那里抄袭了答案,而不是真正理解了数学原理。成绩不再能说明完整的问题。
“学习者变慢”的信号: 研究人员测量了学生的得分随每次尝试而提高的幅度。
- 类比: 把这想象成爬梯子。在魔法笔出现之前,每当学生向上移动一个横档,他们都会显著地接近顶端。在魔法笔出现后,学生爬梯子的速度变快了(做了更多改动),但他们并没有因此更接近顶端。他们只是在原地打转。
- 数据: “每次改动的得分提升度”显著下降。学生们付出了更多努力(更多的编辑),但学到的东西却更少了。
团队项目的转折
这项研究还观察了一个学生们共同构建网站的小组项目。
- 结果: 在魔法笔出现后,团队得分实际上略有上升。
- 类比: 这就像一支运动队,其中一名球员带了一个超快速的机器人参加比赛。球队赢得了更多的比赛,但人类队员可能并没有变得更强壮。机器人承担了繁重的体力活,掩盖了人类成员可能不再像以前那样做出贡献的事实。
“半人马”警告
作者将未来的工作与国际象棋进行了对比。
- 在国际象棋中,“半人马”(Centaur)是指人类与计算机协同工作的组合。这些组合比单纯的人类或单纯的计算机都要强大。
- 问题在于: 研究人员担心,学生正在变成那种因为只知道指挥计算机做事,而忘记了如何移动棋子的棋手。
- 他们发现,过度依赖魔法笔(由那些巨大的、臃肿的代码改动所体现)的学生,在其他个人作业中的表现实际上略差。这表明,虽然魔法笔能帮你完成任务,但它可能会损害你独立完成该任务所需技能的学习能力。
核心结论
文章得出结论,虽然学生们仍然取得了优异的成绩,但他们的行为发生了变化,这表明他们过度依赖 AI。
- 他们提交的代码变得更长、更混乱。
- 他们进行了更多改动,却没从中学习到多少东西。
- 他们在简单的任务上获得了完美的分数,但他们的整体学习效率似乎正在下降。
作者警告说,学校和雇主需要重新思考如何衡量“技能”。仅仅因为一个学生能用魔法笔产出完美的结果,并不意味着他懂得如何烘焙蛋糕。他们需要研究如何教导学生成为能够引导计算机的国际象棋大师,而不仅仅是按下“开始”键的人。
技术摘要:大语言模型引入后编码行为与性能的变化
问题陈述
大语言模型(LLMs)和智能体编程工具向软件开发工作流中的快速集成,从根本上改变了学生参与编程任务的方式。虽然这些工具承诺提高生产力,但也为教育者带来了显著挑战:如何区分真实的理解与 AI 生成的输出,以及当“机械负担”被卸载时,如何评估学习目标是否达成。现有文献对于 LLMs 对学习的影响存在矛盾的观点,范围涵盖了从增强辅导效果到因过度依赖而导致的损害。目前缺乏长期的、实证性的证据来量化在 LLMs 大规模普及前后,编码行为和学习成果具体是如何演变的。
研究方法
本研究采用准纵向设计,分析了卡内基梅隆大学(CMU)研究生级云计算课程的源代码提交记录。该数据集跨越 10 个学期(2020 年秋季至 2025 年春季),涵盖了 ChatGPT 发布(2022 年 11 月)前的五个学期和发布后的五个学期。
- 数据来源: 分析重点是来自 721 名学生、共 2,066 份提交记录。
- 任务选择: 研究主要关注个人项目中的一个特定静态作业(“PageRank 任务”)。选择该任务是因为其规范和初始代码在 2020 年至 2025 年间保持不变,从而允许对解决方案进行直接比较。该任务涉及在一个社交图谱上实现 PageRank 算法,仅提供极少的初始代码(60 行)。
- 指标定义:
- 编码行为: 提交次数(尝试次数)、总编辑距离(使用 Myers 算法计算连续提交之间行变化的累加和)以及平均编辑距离。
- 性能: 任务得分(最终 PageRank 提交的自动评分)、IP 得分(个人项目前五项得分之和)以及 TP 得分(团队项目得分)。
- 学习效率: “平均提交效应”,定义为两次连续提交之间任务得分的变化量除以提交次数。
- 约束条件: 个人项目中禁止协作和 AI 辅助编程。本研究依赖于行为代理(编辑距离和提交模式)而非自我报告的 LLM 使用情况,因为承认学生可能会少报误用行为。
关键结果
研究发现,在引入 LLMs 后,编码行为与性能之间的相关性发生了显著变化:
行为变化(2022 年后):
- 提交量增加: 每名学生的提交次数中位数增加了 50%(从 2 次增加到 3 次)。
- 代码量扩张: 总编辑距离的中位数增加了 500%,平均编辑距离的中位数增加了 300%。这表明学生在提交之间进行的修改幅度更大,且不再是增量式的。
- 代码膨胀: 获得满分的最终提交拥有显著更多的代码行数(如图 1 所示),这与 LLMs 倾向于生成未请求的格式、文档或样板代码的倾向一致。
性能结果:
- 任务得分: 保持稳定,所有学期的几乎所有学生都在 PageRank 任务中取得了满分,这表明该任务本身可能过于简单,难以区分表现差异。
- 个人项目 (IP) 得分: 在 ChatGPT 发布后显示出轻微的平均分下降。
- 团队项目 (TP) 得分: 显示出适度增加,这可能表明 AI 充当了“非正式团队成员”,辅助了有能力的个体。
相关性与效率:
- 学习效率下降: “平均提交效应”(每次编辑带来的得分提升)从 2024 年春季开始显著下降。学生进行了更多编辑,但获得的得分增益却更小。
- 负相关性: 平均编辑距离与 IP 得分之间存在显著的负相关关系($corr = -0.16, p < 0.001$)。平均编辑距离每增加 60 行,IP 得分约下降 1%。
- 团队动态转变: 在 ChatGPT 发布前,较高的编辑距离与较低的团队得分相关;这一相关性在 ChatGPT 发布后消失,表明 LLMs 可能在团队设置中掩盖了个体的学习差距。
核心贡献
- 实证证据: 这是第一项提供关于编码行为变化之长期数据的综合研究,通过连续 10 个学期的分析,专门隔离了 LLM 普及前后的时期。
- 行为代理: 本文确立了增加的编辑距离和提交次数,结合降低的得分提升率,可以作为潜在 LLM 过度依赖的强有力行为指标,即使在缺乏直接使用日志的情况下也是如此。
- 解构性能与学习: 研究表明,高作业得分(任务得分)不再保证学习效率。学生可以使用显著更多“膨胀”的代码和较少的策略性迭代来获得完美分数,从而掩盖了真实问题解决能力的下降。
意义与主张
作者声称,观察到的行为转变与以下假设一致:即学生过度依赖 LLMs,尽管表面性能指标保持稳定或有所提高,但这正负面影响了他们的学习成果。
- 教育警示: 研究结果引发了对进入 AI 时代的第一代毕业生就业前景的担忧。数据表明,编写高效、增量式代码的能力以及依赖工具生成过度、未请求变更的能力可能正在下降。
- 评估错位: 当前的评估方法可能与 AI 增强世界中所要求的技能不匹配。论文指出,仅关注最终产出(得分)的指标无法捕捉到学习过程的退化。
- “半人马”模型: 论文最后提出了一种转向教育哲学的转变。借鉴国际象棋中的“半人马”模型(人类 + 机器优于两者单独存在),它建议人类开发者的角色正在从战术性代码生产转向战略性监督(定义抽象、集成组件以及批判性地评估输出)。作者呼吁教育课程和评估应进化,以衡量这些战略性能力,而非仅仅是孤立产生代码的能力。
本文的论点保持克制,承认由于缺乏直接的使用数据,无法确定地证明每位学生都存在 LLM 误用,也无法排除其他因素(如方案共享)的可能性。然而,统计趋势强烈表明,编程任务的处理和学习方式发生了系统性的变化。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。