A systematic comparison of Large Language Models for automated assignment assessment in programming education: Exploring the importance of architecture and vendor
本研究呈现了首次针对十八种当代大语言模型在自动化编程作业评分方面的规模化系统性比较,揭示了不同架构与厂商之间显著的性能差异、较小模型变体持续存在的性能不足,以及自动化共识与人类教师评估之间持续存在的适度差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位面对堆积如山的作业需要批改的老师。你有 6,000 份编程作业要检查,而且眼睛已经看累了。这时,“数字阅卷员”出现了:这是一种被称为“大语言模型”(LLM)的超智能计算机大脑。把这些模型想象成博览群书的机器人,它们几乎读过了互联网上的所有内容,包括数百万行代码。它们被设计用来理解语言和逻辑,因此让它们立即为学生的作品评分似乎是一个完美的想法。但问题在于:就像人类一样,这些机器人也有不同的个性。有些很严格,有些很随和,有些则纯粹是古怪。学校面临的大问题是:如果我们让这些机器人接管评分工作,它们会公平吗?它们会与人类教师达成一致吗?还是会将评分系统变成一场混乱的游戏——一个机器人给你 A+,而另一个机器人却因为同样的代码给你 F?
这篇论文就像是一场大规模的“口味测试”,针对这些数字阅卷员进行测评。作者 Marcin Jukiewicz 收集了一门大学课程中 6,000 份真实的编程作业,并请 18 个不同版本的 AI 机器人对它们进行评分。他不仅要求它们给出分数,还观察了它们的思考方式、它们的严格程度,以及它们彼此之间或与人类教师之间是否达成一致。研究表明,这些 AI 模型并不是一个统一的智能整体;它们是一个由非常不同的“表亲”组成的家族。有些是“自由派”,像发糖果一样发放高分;而另一些则是“限制派”,会因为微小的错误就让学生不及格。甚至更令人惊讶的是,来自同一家公司(如 OpenAI 或 Google)的机器人往往以非常相似的方式思考和评分,就像是在同一个有着相同规则的家里长大的一样。
然而,最重要的发现是一个现实的警示。即使是研究中“最好”的 AI 机器人,也仅表现出与人类教师中等的统计一致性,远未达到完美匹配。在评分领域,这就像选秀节目中的两位评委对同一位歌手给出了完全不同的分数。研究表明,虽然 AI 可以做到与自身保持一致,但它仍然难以匹配人类教师那种细致、宽容且具备上下文感知能力的评分方式。此外,研究发现这些模型的“mini”或“nano”版本(即更小、更便宜的版本)在评分方面通常不如它们那些庞大、全尺寸的兄弟版本。因此,如果一所学校想要使用 AI 来批改作业,他们不能随便挑选一个机器人;因为选择哪个机器人实际上会改变学生得到的成绩。
伟大的机器人评分大对决
想象一下,你走进一间教室,里面坐着 18 个不同的机器人,每个机器人手里都拿着一支红笔。它们正准备给同一叠 6,000 份编程作业评分。这些可不是普通的机器人,它们是来自四大科技巨头(OpenAI、Google、Anthropic 和 DeepSeek)的最先进的“大语言模型”(LLM)。这项研究的目标是看看这些机器人是否会对谁获得 A、谁获得 B 以及谁不及格达成共识。
结果有点像是一档评委无法达成一致的真人秀节目。作者发现,这些机器人拥有截然不同的“评分哲学”。
“友善型”机器人 vs. “严厉型”机器人
有些机器人非常慷慨。像 GPT-4o 和 Claude-haiku-3.5 这样的模型是“自由派”阅卷员。它们倾向于经常给出高分(即“1”或满分)。如果学生的代码基本正确,这些机器人就会很乐意给他们通过的成绩。在光谱的另一端,是像 DeepSeek-Reasoner 和 GPT-4.1-nano 这样的“限制型”机器人。它们是严格的纪律执行者。如果它们发现哪怕是一个微小的错误,也更有可能给出“0”(不及格)。这些机器人会在你漏掉一个分号时就让你不及格,而友善的机器人只会给你一个温柔的提醒。
然后是像 Claude-sonnet-4 和 Gemini-2.0-flash-lite 这样的“平衡型”机器人。它们是中间地带的阅卷员。它们不会只给你满分或零分;它们非常喜欢“0.5”这个分数。它们会说:“你掌握了主要思路,但漏掉了一些细节,所以这里给你部分学分。”
家族相似性
一个最酷的发现是,来自同一家公司的机器人表现得就像兄弟姐妹一样。如果你观察不同 OpenAI 模型(如 GPT-4o、GPT-5 及其“mini”版本)的评分模式,它们会聚集在一起。它们的思维方式是一致的。Google 的 Gemini 模型和 Anthropic 的 Claude 模型也是如此。就好像 OpenAI 教导它所有的机器人都以一种特定的风格进行评分,而 Google 则教导它的机器人另一种风格。研究发现了六个不同的机器人组别:五个具有共同风格的主流“氏族”(GPT-5、GPT-4、Gemini、DeepSeek 和 Claude),以及一个特殊的“离群值簇”,该簇将两个独特的模型归为一类,因为它们不属于任何其他类别。
“迷你版” vs. “旗舰版”
研究还考察了机器人的规模。科技公司经常发布“mini”或“nano”版本的模型,这些模型更小、更快且运行成本更低。论文发现,这些较小的机器人通常在评分方面表现较差。全尺寸的“旗舰级”模型则更加一致且可靠。这就像是比较专业厨师和刚看完烹饪节目的孩子;孩子可能会把菜做出来,但专业人士更有可能每次都能精准掌握味道。 “mini”和“nano”模型与人类教师的一致性较低,这表明如果学校试图通过使用更便宜、更小的模型来节省成本,他们可能会得到质量较低的评分。
人类因素
这里有一个可能会让你感到意外的转折。当作者将所有这些机器人与对同一份作业进行评分的实际人类教师进行对比时,发现机器人并没有很好地匹配。事实上,人类教师是最慷慨的!他们给出的平均分最高(0.726),并且比任何机器人都更有可能给出满分“1”。
表现最好的机器人 Claude-haiku-3.5 与人类教师的统计一致性得分仅为 0.470。在统计学领域,这被认为是“中等”程度的一致性,而非“良好”。要达到“良好”标准,通常需要高于 0.75 的得分。这意味着,如果你使用这个机器人来批改你的作业,它给出的成绩很可能与你的老师给出的成绩不同,而且它会更加严格。
“群体”悖论
研究人员进行了一项聪明的测试来检验机器人之间的关系。他们没有将机器人与人类进行比较,而是问:“如果我们取 18 个机器人给出的最常见的成绩,那是否就是‘真实’的成绩?”当他们这样做时,机器人彼此之间的一致性要高得多(顶尖模型的一致性超过 80%)。这表明,机器人与同类高度一致,但它们与人类教师却始终存在差异。
这引发了一个大问题:是机器人是对的,而老师太宽松了?还是所有的机器人都在犯同样的错误,因为它们接受了相似的数据训练?论文指出,虽然机器人具有一致性,但它们可能缺失了“人文关怀”——即理解学生努力尝试,或者理解一个小错误并不意味着没掌握概念的能力。
这对未来意味着什么
这篇论文并不是说 AI 评分机制坏掉了,或者我们应该停止使用它。相反,它警告学校要保持谨慎。选择哪个机器人来批改你的作业并不是一个中立的决定;这是一个会改变结果的选择。如果你选择一个“自由派”机器人,学生可能会得到更高的分数;如果你选择一个“限制派”机器人,学生的成绩可能会降低。
研究结论认为,我们不能仅仅让 AI 完全接管评分工作。我们仍然需要人类教师来监督。机器人是很好的工具,但它们就像不同类型的计算器:有的会向上取整,有的会向下取整,有的则有不同的按键。在研究出如何让它们与人类教师达成一致之前,我们必须记住,机器人给你的成绩可能与你的老师给出的成绩并不一样。而在教育领域,这种差异至关重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。