← 最新论文
🤖 AI

LLM-as-Judge in Education: A Curriculum-Grounded Marking Pipeline

本文介绍了一种基于课程体系且可配置的“大语言模型作为评审”(LLM-as-Judge)流水线,该流水线将自动化题目级评分与授权的教育标准及教学大纲附件进行系统性对齐,在实现与人类导师相当的一致性的同时,为备考过程提供了更具可追溯性的理由说明。

原作者: Xiwei Xu, Chen Wang, Jacky Jiang, Phil Yang, Qian Fu, Mohan Dhall, Wenjie Zhang, Liming Zhu

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiwei Xu, Chen Wang, Jacky Jiang, Phil Yang, Qian Fu, Mohan Dhall, Wenjie Zhang, Liming Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位正在批改数百份试卷的老师。你有一本非常具体的规则手册(课程大纲)和一套评分指南。但你很疲惫,日程很忙,有时你的情绪或学生潦草的字迹可能会无意中影响你的评分。你希望做到公平、一致且快速,但仅靠手工完成这太耗费精力了。

这篇论文介绍了一种利用人工智能(AI)来辅助批改这些考试的新方法,但有一个非常重要的转折点:这个 AI 不仅仅是在进行猜测;它是在遵循一张严格的、预先批准的地图。

以下是该系统的运作方式,通过简单的概念进行拆解:

1. 问题所在:“黑盒”评分器

通常,当人们使用 AI 进行评分时,他们只是问它:“这是学生的答案,请给出一个分数。”这就像是要求一位厨师做饭,却不给他食谱。AI 可能会做出美味佳肴,也可能做出与学校初衷完全不同的东西。它可能会根据自己的“观点”而非官方规则来进行评分。对于每个分数都至关重要的重大考试来说,这是有风险的。

2. 解决方案:“以课程为基础”的流水线

作者构建了一个系统,让 AI 不再只是“自由思考”。相反,它的行为就像一位极其严谨的图书管理员,必须检查每一个步骤是否符合官方的“图书资料”(课程大纲)。

将评分过程想象成一个拥有三个主要工作站的工厂装配线:

  • 第一站:侦探(大纲匹配)
    在评分之前,系统会查看考试题目并询问:“这个问题到底在问什么?”它不会靠猜。它会在官方学校规则的数据库中进行搜索,以找到该问题应该测试的具体主题、技能和词汇。这就像是侦探将指纹与警察数据库中的特定档案进行比对。

  • 第二站:建筑师(构建评分标准)
    一旦系统知道了问题的核心内容,它就会为该特定问题构建一个定制的“计分卡”(评分标准)。它利用官方对词汇(如“解释”或“分析”)的定义,以确保它确切知道学生需要做什么。它还会检查官方的“等级描述符”(用于描述什么是“好”的答案,什么是“极好”的答案)。

    • 类比: 想象一位烹饪比赛的评委。评委不仅仅是说“味道不错”,而是有一份具体的清单:“是否使用了盐?是否烹调了10分钟?摆盘是否正确?”这个系统会自动为每一个问题构建这样一个清单。
  • 第三站:审计员(验证)
    在 AI 给出最终分数之前,它会进行自我检查。它会问自己:“我真的检查了正确的规则吗?我有遗漏什么吗?”它确保给出的分数是由官方文件支撑的,而不是基于 AI 的直觉。

3. 它如何处理错误和细微差别

论文将该系统与人类导师进行了对比测试。以下是他们的发现:

  • 分数: AI 给出的分数与人类导师非常接近。
  • “为什么”: 这是最大的区别。当人类导师说“你得了 3 分(满分 5 分)”时,他们可能只是写下一句简短的备注。而当这个 AI 系统说“你得了 3 分(满分 5 分)”时,它可以指向官方规则手册中的确切句子,解释为什么你丢掉了那两分。这就像一个 GPS,它不仅告诉你迷路了,还能显示出你错过的精确路线。

论文中的两个现实案例:

  1. 潦草字迹案例: 一名学生写出了很棒的答案,但拼写很糟糕。人类老师给了 0 分,因为看不懂且不想浪费时间去猜。然而,AI 尝试“读懂字里行间”,判断出学生理解了概念,并给了 1 分。AI 对凌乱的字迹更宽容,但在实际内容上非常严格。
  2. “讨论”案例: 一个问题要求学生“讨论”一个话题。官方规则手册规定,“讨论”意味着你必须从双方的角度来看待论点。一名学生只写了负面的一方,但写得非常好。人类老师给了 4/4(满分),因为答案非常出色。而 AI 给了 1/4,因为它严格遵循了那条规则——即“你缺少了另一方的观点”。这表明 AI 是一个严格的规则执行者,这有利于保持一致性,但可能会错过人类所能看到的“大局观”式的卓越表现。

4. 现实世界测试

团队将该系统投入到一个真实的在线学习平台中,该平台被数千名高中生使用。

  • 结果: 运行非常顺畅。在数千个被评分的答案中,只有大约 3% 被人工修改过。这意味着该系统足够可靠,以至于人类很少感到需要介入修复。
  • 安全性: 该系统还成功拦截了试图欺骗它(即通过“提示词注入”来尝试黑入 AI 以获取高分)的学生,并自动给出了零分。

核心结论

这篇论文并不是说 AI 是完美的,或者说它会永远取代老师。相反,它展示了如果你将 AI 构建为一个严格的、遵循规则的助手,并且不断地对照官方学校规则手册进行检查,那么它可以公平且一致地为考试评分。

它将 AI 的“黑盒”转化为了一个透明、可审计的流水线。你可以查看 AI 的工作成果,并看到它使用了哪条规则来给出分数,这使得它成为了一个值得信赖的工具,可以帮助学生为重大考试做准备。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →