想象一个世界,一夜之间出现了一个神奇且超级聪明的机器人助手。这个机器人可以比任何人类都更快地撰写论文、解决数学问题并起草代码。突然间,世界各地的学校都出现了一个巨大的疑问:如果学生利用这个机器人来做作业,他们是否还能真正掌握所学知识?或者,他们是否只是在从未翻开过教科书的情况下就拿到了完美的成绩?这是教育科学领域一场辩论的核心。研究人员试图弄清楚这种“机器人帮助”究竟是一个能促进学习的有用工具,还是一个让学生跳过思考这一艰苦过程的“认知捷径”。这很重要,因为成绩就像是发给未来的信号;它们告诉大学和雇主一个学生知道什么。如果因为每个人都使用了机器人而导致成绩开始贬值,那么整个筛选学生进入工作岗位和职业的系统可能会陷入混乱。
现在,让我们把目光聚焦到一项来自美国中西部某大型大学的大规模研究,这项研究试图解开这个谜团。研究人员就像是在寻找某种特定“魔术技巧”的侦探。他们知道并非所有的课程都是一样的。有些课程就像是“带回家考试”,你可以在自己的房间里独自使用笔记本电脑——这些课程最有可能受到机器人的“影响”。而其他课程则像是“现场表演”或闭卷考试,你必须在老师面前实时展示你的技能——这些课程很难由机器人伪造。
团队收集了海量的数据:包括超过13.8万名学生在数千门课程中的教学大纲、成绩和学生调查问卷,观察的时间跨度涵盖了著名的AI聊天机器人(ChatGPT)在2022年底发布前后的年份。他们使用了一种巧妙的统计技巧,叫做“双重差分法”。把它想象成比较两组跑步者:一组在可以使用电动滑板车的跑道上跑步(易受影响的课程),另一组必须徒步跑步(不受影响的课程)。他们想看看在引入了滑板车之后,滑板车组是否突然比徒步组跑得快得多。
这里有一个转折:研究发现,滑板车组并没有突然飞速领先。事实上,研究人员发现,那些容易使用AI的课程与那些不能使用AI的课程在最终成绩上没有显著差异。无论一名学生是顶尖表现者还是通常表现挣扎的学生,AI似乎都没有给他们带来神奇的成绩提升。这个“机器人”并没有导致成绩通胀的浪潮。
研究人员还检查了学生对自己的课程感受是否有所不同。他们是否觉得对材料的理解减少了?他们是否失去了兴趣?工作是否感觉变得更容易了?同样,答案大多是否定的。一旦他们考虑了那段混乱、复杂的疫情时期(疫情已经改变了学校的运作方式),AI的引入似乎并没有让学生感到参与度降低或满意度下降。
那么,结论是什么?这项研究表明,关于学生利用AI来“替代”自身努力从而获得轻松A等的担忧,至少在这个大型大学环境中是被夸大了。虽然AI确实正在被使用,但它并没有破坏评分系统,也没有让学生停止学习。成绩的“信号”似乎仍然意味着它一贯的意义。研究人员谨慎地表示,这并不意味着AI完全没有影响,但它确实意味着那种认为由于机器人的存在导致成绩变得毫无意义的恐怖想法,在他们收集的数据中并不成立。成绩没有上升,学生没有退出,学习信号依然完好无损。
技术摘要:大型大学生成式人工智能(GenAI)的可获得性、成绩与学生满意度
问题陈述
生成式人工智能(GenAI)在高等教育中的快速普及引发了对“GenAI替代假设”的担忧。该假设认为,学生可能会将学习所需的认知努力外包给AI工具,从而在无需掌握底层知识的情况下在评估中获得高分。如果这一假设成立,这种替代现象将不成比例地推高“GenAI易感型”课程(即依赖居家作业、论文和开放式考试的课程)的成绩,而对“非易感型”课程(即依赖课堂内、受监考或现场表现评估的课程)的影响则较小。此外,这种替代可能会通过降低参与评估度和削弱社会化学习社区来侵蚀学生满意度。现有文献表明,GenAI可能会提高职场生产力,但其对大学规模的学生学习成果和满意度的影响仍存在争议,一些研究表明存在成绩通胀,而另一些研究的结果则尚不明确。
研究方法
本研究利用了一份来自美国某大型公立大学的大规模行政数据集,涵盖了从2016年秋季到2025年秋季的时期。该数据集包含138,386名唯一学生和72,730个课程开设记录,涉及6,357门独特的课程。
- 处理定义(GenAI易感性): 作者将课程的易感性定义为:分配给可在无需教师观察的情况下独立完成的评估(如居家考试、作业、论文、项目)所占的最终成绩比例。相比之下,非易感性评估包括线下闭卷考试、演讲和现场技能演示。
- 测量流程: 为了量化易感性,作者开发了一个经人工验证的大语言模型(LLM)流水线。他们抓取了44,876份教学大纲,并使用LLM(GPT-5.1)重建评估类型及其权重。该流水线通过了525个具有人类共识标签的分层样本验证,在0–1的易感性量表上实现了平均绝对误差(MAE)为0.063。
- 经验策略: 研究采用了双重差分法(DiD)设计,比较了ChatGPT发布(2022年11月)前后,高易感性课程与低易感性课程在结果上的差异。
- 锚定: 至关重要的是,课程易感性被锚定在2019年的课程开设情况(即疫情前、GenAI出现前),以防止处理变量吸收由于疫情或GenAI引起的教师反应。
- COVID-19调整: 考虑到疫情扰乱了高等教育并与处理前阶段重叠,作者对COVID效应进行了显式建模。他们通过两种假设估算了GenAI效应的边界:(1)COVID效应是完全暂时的(在2023年回归至疫情前基准);(2)COVID效应是完全持久的(造成永久性的水平位移)。“GenAI净COVID效应”是通过对COVID效应进行差分处理后的Post-AI效应得出的,这提供了一个保守的边界。
- 固定效应: 模型包含了学生、课程和学期固定效应,以控制时不变异质性和共同冲击。
- 结果指标:
- 表现: 最终成绩值(GPA)、退课率和不及格率。
- 满意度: 关于自我报告的主题理解程度、学科兴趣及相对工作量的课程评价中值分数。
- 异质性: 分析根据学生的先前学术准备情况(使用课程残差化的同届内第一学期GPA排名)对学生进行分层,以测试是产生均衡化还是扩大差距的效果。
核心结果
- 平均成绩效应: 研究发现,GenAI的可获得性对高易感性课程与低易感性课程的最终成绩没有产生统计学意义上的差异化影响。估计效应在0.030到0.045个成绩点(基于4.0分制)之间,在经济意义上很小,且在5%的水平上不具备统计显著性。这一零结果在两种COVID建模假设下均成立。
- 成绩分布: 虽然在易感性课程中存在A等成绩占比描述性增加的现象,但该变化未能通过平行趋势检验,且未能被稳健地识别为因果关系。没有证据表明存在“抬高底线”效应;不及格率和退课率保持不变。
- 基于先前表现的异质性: 与某些职场研究中发现AI对表现较差者帮助最大的结论相反,本研究发现对于处于学术表现分布底端、中端或顶端的学生,均不存在显著的成绩效应。零平均效应并非来自于不同能力分位数之间收益与损失的抵消。
- 学生满意度: 在考虑了COVID效应后,GenAI的可获得性对自我报告的理解程度或兴趣没有显著影响。仅在假设COVID效应是暂时的前提下,研究才显示出兴趣略微增加和相对工作量减少的倾向;然而,这些发现并不在所有设定下都具有稳健性。
贡献
- 方法论严谨性: 本文引入了一个经人工验证的、用于从教学大纲中提取评估权重的LLM流水线,提供了比以往基于任务构成代理指标更严谨的GenAI易感性衡量标准。同时,文章证明了若未能将易感性锚定在处理前时期(特别是疫情前),会导致选择偏差和虚假的正面成绩效应。
- 大学规模的满意度证据: 这是首个在大学全校范围内通过课程评价研究GenAI可获得性对学生满意度(通过课程评价)影响的研究,发现没有证据表明存在参与度或兴趣的侵蚀。
- 异质性分析: 该研究提供了关于GenAI成绩效应如何随学生先前学术准备情况变化的首次准实验证据,发现不同能力分布下的影响并无差异。
意义与主张
作者得出结论,其研究结果缓解了人们对GenAI是否已经破坏了成绩在ChatGPT发布后即刻降低信号价值或降低学生满意度的担忧。该研究挑战了此前两项大规模研究(Hausman等,2025年;Chirikov,2026a)中关于发现成绩通胀的共识。作者认为,先前研究中发现的正向效应可能是建模选择造成的伪影,具体表现为未能区分持续存在的COVID-19干扰与GenAI效应,以及使用了随时间变化的易感性度量,从而导致了选择偏差。
本文温和地主张,尽管GenAI替代在理论上可能会降低评估质量,但来自这所大型大学的数据目前尚不支持GenAI正在导致成绩通胀或满意度下降的假设。作者提醒说,疫情的持续影响可能仍会掩盖GenAI的影响,且“缺乏证据并不等于证据不存在”,建议应进行持续监测而非仓促做出教学反应。
每周获取最佳 quantitative finance 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。