← 最新论文
🤖 AI

Creating and Evaluating K-12 GenAI Assessment Graders Through Context Engineering

本文评估了经过上下文工程设计的语言大模型在根据评分标准对 K-12 学生作业进行评分方面的有效性,发现虽然这些模型在数学和科学领域与人类评分者保持了高度一致,并因其叙述性反馈而广受好评,但它们最适合作为混合系统中的形成性工具,从而在进行总结性评分时保留教师的监督。

原作者: Zewei Tian, Alex Liu, Lief Esbenshade, Michael Xiao, Zachary Zhang, Yulia Lápicus, Thomas Han, Kevin He, Min Sun

发布于 2026-06-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Zewei Tian, Alex Liu, Lief Esbenshade, Michael Xiao, Zachary Zhang, Yulia Lápicus, Thomas Han, Kevin He, Min Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的教室:一位老师不得不批改数百篇论文、数学题和科学报告。这是一座堆积如山的工作量。几十年来,计算机一直试图提供帮助,但它们就像僵化的机器人,需要从头开始学习每一条规则。

这篇论文是关于一种新型的助手:生成式人工智能(就像你可能知道的那些智能聊天机器人)。但研究人员并没有只是让 AI 自由聊天,而是为它构建了一份非常具体的“说明书”。他们称之为上下文工程(Context Engineering)

以下是他们所做工作的叙述,使用了简单的类比:

1. 问题所在:“空白画布” vs. “蓝图”

如果你要求一个聪明的 AI 在没有任何指令的情况下批改数学测试,这就像要求一位厨师在没有食谱、食材或品尝环节的情况下烹饪一顿饭。厨师可能会做出美味佳肴,也可能给你端上来一只鞋子。AI 可能会进行猜测、产生幻觉(编造事实)或产生偏见。

研究人员意识到,要让 AI 成为一名优秀的阅卷人,你不能只说“请批改这个”。你必须构建一个**“评分包”(Grading Bundle)。把这个评分包想象成一个组织得非常完美的工具箱**,AI 每次都可以使用它来处理每一个学生。在这个工具箱里,他们放入了:

  • 实际的问题。
  • 官方的“标准答案”(正确解法)。
  • “评分标准”(一份关于什么是优秀答案的清单)。
  • 关于“完美”、“尚可”和“糟糕”答案的示例。

通过每次都给 AI 这个工具箱,他们确保了 AI 不是在瞎猜;它是在根据一个固定的标准来衡量学生的作品,就像人类教师那样。

2. 实验:一场“味觉测试”

研究人员利用这个“上下文工程”工具箱,在马萨诸塞州真实的学生作品(MCAS 测试)上进行了测试,涵盖了三个学科:数学、科学和英语(ELA)

他们使用了四种不同的“大脑”(AI 模型)来进行评分:

  • 大容量大脑: GPT-5 和 Claude Sonnet 4(功能非常强大,像资深教授)。
  • 小容量大脑: GPT-5 Mini 和 Claude Haiku 4.5(速度更快且更便宜,像聪明的实习生)。

随后,他们将 AI 的评分与人类教师给出的分数进行了对比。他们主要观察了两点:

  1. 它们是否选择了完全相同的分数?(精确一致性)
  2. 如果它们选得不一样,它们是否接近?(例如,人类给 4 分,AI 给 3 分。这是一个“接近误差”,是可以接受的。如果 AI 给 1 分,那就是灾难性的错误。)

3. 结果:“学科领域”至关重要

结果就像是 AI 的一份成绩单,它显示出你正在批改的内容比 AI 本身的聪明程度更为重要。

  • 数学与科学(“对或错”明确的学科):

    • 结论: AI 在这些领域表现出色。
    • 类比: 数学就像一把带有特定钥匙的锁。如果钥匙匹配,锁就能打开;如果不匹配,就打不开。因为 AI 在其工具箱中拥有了“正确的钥匙”(标准答案),它可以几乎完美地匹配人类教师。
    • 统计数据: AI 与人类在精确分数上的一致性约为 54% 到 84%。当出现分歧时,它们通常只差一分(比如 4 分对比 3 分),这非常接近。
  • 英语/ELA(“观点”主导的学科):

    • 结论: AI 的表现好坏参半。
    • 类比: 批改一篇论文就像评判一幅画。一个人可能喜欢它的色彩,另一个人可能讨厌它的风格。这是主观的。
    • 统计数据: 在这里,结果很大程度上取决于使用的是哪种“AI 大脑”:
      • 大容量大脑(Claude Sonnet) 表现得相当不错,在理解阅读理解方面几乎能达到人类教师的水平。
      • 小容量大脑 以及其他一些模型在写作质量方面表现得很挣扎。它们的评分往往非常混乱,有时甚至比直接取平均值还要差。
    • 启示: 对于写作,你需要的是一位“资深教授”级别的 AI,而不是“聪明实习生”。即便如此,它也并非完美无缺。

4. 人类反应:“优秀的反馈,怀疑的分数”

研究人员还询问了教师和学生的想法。

  • 好消息: 大家都非常喜欢书面反馈。AI 可以写出一段优美的文字,解释为什么学生得到了某个分数,以及如何改进。这让人感觉很有帮助且具有鼓励性。
  • 坏消息: 大家都对分数本身持怀疑态度。教师们并不信任 AI 来给出成绩单上的最终成绩。他们觉得 AI 是一个很好的“练习伙伴”,但不是“最终裁判”。

5. 结论:“副驾驶”模式

论文得出结论,我们不应该试图用 AI 取代教师。相反,我们应该使用一种混合模式

  • 将 AI 视为“副驾驶”: 它负责驾驶飞机(承担阅读和起草反馈的繁重工作),但教师才是机长。教师查看 AI 的工作,核对最终分数,并做出正式决定。
  • 为什么要这样做? 这既节省了教师数小时的工作时间,又能为学生提供即时反馈,同时保留了人类专家作为掌控者,以确保公平性和准确性。

简而言之: 如果你给一个聪明的 AI 一本清晰的规则手册和正确的答案,它在数学和科学方面的评分可以几乎达到与人类相当的水平。对于英语论文,它需要非常聪明的 AI,并且仍需要人类进行复核。目前这项技术的最佳用途是帮助教师提供反馈,而不是取代他们在给出最终成绩时的角色。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →