LLM Performance on a Real, Double-Marked GCSE Benchmark
本文介绍了一个包含双重评分的 GCSE 考试答卷的大型数据集,并证明了现成的大型语言模型在对包括手写数学和主观英语论文在内的多样化科目进行评分时,可以达到甚至超过人类考官的一致性,从而为自动评分提供了一种具有成本效益的解决方案。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在主持一场规模宏大的学校考试,成千上万的学生交上了他们的答案。传统做法是需要两名人类教师阅读每一份试卷并给出评分。这既缓慢又昂贵,而且两位老师对于什么是“B”或“C”的理解有时也会存在分歧。
这篇论文提出了一个简单的问题:计算机(特别是大语言模型或“人工智能”)能否像人类教师一样胜任第二名老师的角色?
为了验证这一点,研究人员创建了一个巨大的“测试”。以下是他们所做的工作以及他们的发现,我将使用一些日常类比来进行说明。
1. “双重评分”实验厨房
研究人员收集了来自模拟考试(英国 16 岁全国统考的练习测试)的 32,534 份真实学生答案。
- 设置: 每一份答案都已经被两名不同的专家预先评分。这就像是在烹饪节目中,有两位评委同时品尝一道菜并写下分数。
- 多样性: 这些答案不仅仅是打字输入的文章。它们还包括凌乱的手写数学题、带有图表的题目、科学计算题以及创意写作。
- 目标: 他们想看看,如果给 AI 提供同样的问题和“标准答案”(评分标准),它给出的分数是否能像两位人类评委彼此之间的匹配程度那样,与人类评委的评分保持一致。
2. “味觉测试”结果
研究人员将这些问题输入到各种 AI 模型(如 GPT-5.5、Gemini 和 Claude)中,并使用了非常简单的指令:“这是问题、评分规则和学生的答案。请给我一个数字形式的分数。” 他们并没有要求 AI “深入思考”或进行复杂的推理;他们只是让它完成这项工作。
巨大的惊喜:
在几乎所有学科中,AI 不仅仅是做得“很好”。在许多情况下,AI 与人类评委的一致性甚至比两位人类评委彼此之间的一致性还要高。
- 类比: 想象两位人类评委品尝一块蛋糕。评委 A 给出了 7/10 分,评委 B 给出了 6/10 分。他们分歧了一分。现在,AI 品尝了同样的蛋糕。它给出了 6.5/10 分。AI 实际上正好处于中间位置,扮演了一个完美的“平局决胜者”。
- 数据:
- 英语作文: AI 是一个“超级评委”。它与人类共识的匹配程度甚至超过了人类彼此之间的匹配程度。
- 数学: 即便是面对凌乱的手写体和复杂的图表,AI 的表现也极其准确,几乎完美地匹配了人类的一致性。
- 科学: 情况相同。AI 与第二名人类教师一样可靠。
3. 规模并不总是决定因素
你可能会认为你需要最庞大、最昂贵、“最聪明”的 AI 来做这件事。论文指出:并非如此。
- 类比: 这就像尝试修理一个漏水的水龙头。你不需要一个带着 5,000 美元工具箱的高级管道工;一把标准的扳手通常就能完成工作。
- 发现: 小型、更便宜的 AI 模型表现得与那些庞大、昂贵的模型一样出色。事实上,对于某些任务,一款“预算型”模型的表现与“高端型”模型一样一致。
4. “性格”怪癖(偏差)
虽然 AI 在“与人类一致的程度”方面很准确,但某些 AI 存在“性格”偏差。
- 类比: 想象两位人类评委。一位是“严厉型老师”,总是给较低的分数;另一位是“亲和型老师”,总是给较高的分数。
- 发现: 一些 AI 模型天生比较“严厉”(给出的分数低于平均值),而另一些则比较“宽容”(给出的分数较高)。然而,一旦考虑到这种“性格”因素,它们的评分准确能力仍然非常出色。表现最好的模型是那些“中立”的模型——它们不会过度倾向于严厉或宽容。
5. “第二名老师”的成本
最后,论文研究了价格标签。
- 类比: 雇佣第二名人类教师来批改 1,000 份试卷是很昂贵的。使用 AI 则像是买一张电影票:只需花费几美元,而不是一百美元。
- 发现: 使用 AI 批改 1,000 份试卷的费用在 1 美元到 120 美元之间,具体取决于所使用的模型。由于较便宜的模型表现得与昂贵模型一样好,因此学校可以在获得可靠的“第二意见”的同时,节省一大笔费用。
核心结论
这篇论文证明了当今的 AI 已准备好成为学校考试中可靠的“第二名阅卷人”。它可以阅读凌乱的手写体,理解复杂的数学,并以一种往往优于人类之间一致性的水平来批改作文。它运行良好,成本低廉,而且并不需要最庞大、最昂贵的模型也能胜任这项工作。
这篇论文没有说的是:
- 它并未声称 AI 应该完全取代人类教师。
- 它并未说 AI 对每一种类型的考试题目都趋于完美(尽管它在测试的题目中表现得非常好)。
- 它并未讨论这将如何改变未来的学校,而仅是证明了在这些特定的测试条件下,该技术目前是有效的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。