← 最新论文
💻 computer science

Is Solving Better Than Evaluating GenAI Solutions?

一项针对大三算法课程的随机研究发现,虽然让学生评估有缺陷的生成式人工智能生成的解决方案提高了作业成绩,且并未损害整体考试表现,但与没有刻意支架的传统问题解决方式相比,这并未自动导致更好的概念迁移或学习收益。

原作者: Ethan Dickey, Marios Mertzanidis, Alexandros Psomas

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Ethan Dickey, Marios Mertzanidis, Alexandros Psomas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在学习成为一名名厨。多年来,证明你掌握了烹饪的唯一方法就是站在厨房里,亲手切好蔬菜,并从零开始烤制属于你自己的舒芙蕾。但现在,出现了一个神奇的机器人,它能在几秒钟内做出完美的舒芙蕾。这让烹饪学校陷入了一阵恐慌。他们应该禁止使用这个机器人吗?还是应该允许学生使用它,但改变测试方式?与其要求学生去烘焙,不如问他们去品尝机器人的舒芙蕾,找出烧焦的部分,并解释为什么它失败了。这就是当今计算机科学教育面临的大问题。我们正处于“生成式人工智能”时代,计算机几乎可以瞬间编写代码并解决数学问题。教育工作者们在思考:如果我们不再要求学生构建解决方案,而是开始要求他们去评判 AI 的解决方案,他们是真的会学到更多知识,还是仅仅会变得更不擅长独立思考?

这篇论文是一项旨在解决这场争论的现实世界实验。普渡大学的研究人员选取了一门由 220 名大三学生组成的“算法”课程——算法其实就是解决复杂问题的精妙、分步骤的“食谱”,比如寻找地图上的最快路径或整理一份庞大的数据列表。他们设计了一个巨大的“A/B 测试”游戏,就像通过抛硬币来决定谁得到哪份作业一样。在学期的前半段,一组学生(我们称之为“烘焙者”)必须从零开始解决一个困难的算法问题;而另一组学生(“评论者”)则必须要求 AI 来解决同一个问题,然后给 AI 的工作打分,指出机器人哪里做错了。随后,他们在学期后半段交换了角色:“评论者”变成了“烘焙者”,“烘焙者”变成了“评论者”。

研究人员想看看“评论者”是否比“烘焙者”学得更好。指出 AI 的错误是否能帮助他们更深入地理解概念?这是否会让他们在稍后独立解决问题时表现得更好?答案出人意料地有些“平庸”。当学生参加期中和期末考试时,“评论者”的分数并没有比“烘焙者”更高。事实上,他们也没有更低。两组学生的成绩几乎完全相同。这项研究表明,用评判 AI 解决方案的行为取代构建解决方案的行为,并不会自动让你成为更出色的问题解决者。它只是改变了你如何度过时间。“评论者”将精力花在诊断错误和判断逻辑上,而“烘焙者”则将精力花在从底层构建逻辑上。两种方法似乎都导向了考试中的同一个终点。

不过,还有一个小小的转折。那些扮演“评论者”角色的学生在进行 AI 评分的具体作业中,确实获得了更高的分数。发现机器人工作中的错误确实比亲手构建整个程序要容易。但问题在于:这些额外的作业分数并没有转化为更好的考试成绩。这就像是在模拟测试中得了 A,但在正式考试中却表现平平。研究人员还询问了学生的感受。大多数人表示,AI 作业并没有改变他们的学习方式。然而,少数确实表示改变了学习习惯的学生觉得,“评判型”作业更有帮助。这暗示了仅仅要求学生给 AI 打分并不是灵丹妙药。要真正实现学习,学生可能需要更多的引导——比如不仅要让他们找到漏洞,还要让他们修复它,或者准确解释为什么修复方案有效。

最后,这项研究表明,学校可以放心地让学生通过评判解决方案来与 AI 互动,而不用担心会毁掉他们的成绩,但这并不会自动让他们变成天才。魔法不在于 AI 本身,而在于教师如何设计任务。如果目标是建立深刻的理解,仅仅交给学生一个损坏的机器人方案并说“修好它”可能是不够的。他们可能需要更多的脚手架支撑,才能将这种评判转化为真正的“顿悟”时刻。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →