Creating and Evaluating K-12 GenAI Assessment Graders Through Context Engineering
本文评估了经过上下文工程设计的语言大模型在根据评分标准对 K-12 学生作业进行评分方面的有效性,发现虽然这些模型在数学和科学领域与人类评分者保持了高度一致,并因其叙述性反馈而广受好评,但它们最适合作为混合系统中的形成性工具,从而在进行总结性评分时保留教师的监督。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的教室:一位老师不得不批改数百篇论文、数学题和科学报告。这是一座堆积如山的工作量。几十年来,计算机一直试图提供帮助,但它们就像僵化的机器人,需要从头开始学习每一条规则。
这篇论文是关于一种新型的助手:生成式人工智能(就像你可能知道的那些智能聊天机器人)。但研究人员并没有只是让 AI 自由聊天,而是为它构建了一份非常具体的“说明书”。他们称之为上下文工程(Context Engineering)。
以下是他们所做工作的叙述,使用了简单的类比:
1. 问题所在:“空白画布” vs. “蓝图”
如果你要求一个聪明的 AI 在没有任何指令的情况下批改数学测试,这就像要求一位厨师在没有食谱、食材或品尝环节的情况下烹饪一顿饭。厨师可能会做出美味佳肴,也可能给你端上来一只鞋子。AI 可能会进行猜测、产生幻觉(编造事实)或产生偏见。
研究人员意识到,要让 AI 成为一名优秀的阅卷人,你不能只说“请批改这个”。你必须构建一个**“评分包”(Grading Bundle)。把这个评分包想象成一个组织得非常完美的工具箱**,AI 每次都可以使用它来处理每一个学生。在这个工具箱里,他们放入了:
- 实际的问题。
- 官方的“标准答案”(正确解法)。
- “评分标准”(一份关于什么是优秀答案的清单)。
- 关于“完美”、“尚可”和“糟糕”答案的示例。
通过每次都给 AI 这个工具箱,他们确保了 AI 不是在瞎猜;它是在根据一个固定的标准来衡量学生的作品,就像人类教师那样。
2. 实验:一场“味觉测试”
研究人员利用这个“上下文工程”工具箱,在马萨诸塞州真实的学生作品(MCAS 测试)上进行了测试,涵盖了三个学科:数学、科学和英语(ELA)。
他们使用了四种不同的“大脑”(AI 模型)来进行评分:
- 大容量大脑: GPT-5 和 Claude Sonnet 4(功能非常强大,像资深教授)。
- 小容量大脑: GPT-5 Mini 和 Claude Haiku 4.5(速度更快且更便宜,像聪明的实习生)。
随后,他们将 AI 的评分与人类教师给出的分数进行了对比。他们主要观察了两点:
- 它们是否选择了完全相同的分数?(精确一致性)
- 如果它们选得不一样,它们是否接近?(例如,人类给 4 分,AI 给 3 分。这是一个“接近误差”,是可以接受的。如果 AI 给 1 分,那就是灾难性的错误。)
3. 结果:“学科领域”至关重要
结果就像是 AI 的一份成绩单,它显示出你正在批改的内容比 AI 本身的聪明程度更为重要。
数学与科学(“对或错”明确的学科):
- 结论: AI 在这些领域表现出色。
- 类比: 数学就像一把带有特定钥匙的锁。如果钥匙匹配,锁就能打开;如果不匹配,就打不开。因为 AI 在其工具箱中拥有了“正确的钥匙”(标准答案),它可以几乎完美地匹配人类教师。
- 统计数据: AI 与人类在精确分数上的一致性约为 54% 到 84%。当出现分歧时,它们通常只差一分(比如 4 分对比 3 分),这非常接近。
英语/ELA(“观点”主导的学科):
- 结论: AI 的表现好坏参半。
- 类比: 批改一篇论文就像评判一幅画。一个人可能喜欢它的色彩,另一个人可能讨厌它的风格。这是主观的。
- 统计数据: 在这里,结果很大程度上取决于使用的是哪种“AI 大脑”:
- 大容量大脑(Claude Sonnet) 表现得相当不错,在理解阅读理解方面几乎能达到人类教师的水平。
- 小容量大脑 以及其他一些模型在写作质量方面表现得很挣扎。它们的评分往往非常混乱,有时甚至比直接取平均值还要差。
- 启示: 对于写作,你需要的是一位“资深教授”级别的 AI,而不是“聪明实习生”。即便如此,它也并非完美无缺。
4. 人类反应:“优秀的反馈,怀疑的分数”
研究人员还询问了教师和学生的想法。
- 好消息: 大家都非常喜欢书面反馈。AI 可以写出一段优美的文字,解释为什么学生得到了某个分数,以及如何改进。这让人感觉很有帮助且具有鼓励性。
- 坏消息: 大家都对分数本身持怀疑态度。教师们并不信任 AI 来给出成绩单上的最终成绩。他们觉得 AI 是一个很好的“练习伙伴”,但不是“最终裁判”。
5. 结论:“副驾驶”模式
论文得出结论,我们不应该试图用 AI 取代教师。相反,我们应该使用一种混合模式。
- 将 AI 视为“副驾驶”: 它负责驾驶飞机(承担阅读和起草反馈的繁重工作),但教师才是机长。教师查看 AI 的工作,核对最终分数,并做出正式决定。
- 为什么要这样做? 这既节省了教师数小时的工作时间,又能为学生提供即时反馈,同时保留了人类专家作为掌控者,以确保公平性和准确性。
简而言之: 如果你给一个聪明的 AI 一本清晰的规则手册和正确的答案,它在数学和科学方面的评分可以几乎达到与人类相当的水平。对于英语论文,它需要非常聪明的 AI,并且仍需要人类进行复核。目前这项技术的最佳用途是帮助教师提供反馈,而不是取代他们在给出最终成绩时的角色。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。