在语言学习的高风险领域,一篇论文的优劣可能决定一名学生是能升入大学,还是继续滞留在预科班。几十年来,教育工作者一直依赖人类教师来阅读这些文章,并根据衡量从语法到论证逻辑流程度等各项指标的复杂评分标准进行评分。最近,一个新竞争者进入了这一领域:人工智能。大型语言模型——即那些能够创作故事或回答问题的强大计算机程序——正越来越多地被提议作为自动评分器。其承诺是诱人的:机器快速、不知疲倦且具有一致性。但在教育领域,速度是不够的。一个评分系统必须不仅仅是产生一个看似合理的平均分;它必须在每一份学生作品的具体细节上与人类专家达成一致,公平地应用规则,并识别出学生写出的完全不属于考试范畴的内容。问题不再是机器能否生成一个数字,而是这个数字是否值得被信任,从而对学习者的生活做出改变命运的决策。
一位研究人员致力于在现实环境中测试这种信任,其研究超越了简单的平均分比较,旨在观察机器与人类在单篇论文上的实际契合程度。他们收集了来自土耳其学生的七十二篇手写论文,这些学生正在参加一项旨在确定其是否具备学位课程就读能力的水平考试。这些学生撰写了关于各种主题的观点文章,从努力工作的价值到朋友与财产之间的平衡。随后,研究人员对这些论文进行了严格的端到端评估。首先,六位经验丰富的教师使用包含任务完成度、组织结构、词汇、语法和连贯性五个部分的评分标准,对每篇论文进行了两次评分。然后,三种不同的人工智能模型——具体为 Claude、GPT 和 Gemini 的版本——阅读了这些手写论文的扫描图像,并使用完全相同的指令进行评分。至关重要的是,这些机器并未针对这些特定的论文接受过专门训练;它们必须现场应用规则,就像一位新来的教师一样。
结果揭示了一个比“完美的自动化替代人类判断”的希望更为复杂的局面。虽然人工智能模型在自身内部表现得非常一致——这意味着如果你要求同一个模型对同一篇论文进行两次评分,它几乎总会给出完全相同的分数——但它们在与人类教师保持一致方面却表现挣扎。两名人类评分者之间的契合度很高,但当机器与人类平均值进行比较时,这种联系显著减弱。每一个模型都倾向于比人类评审团更严苛,在所有维度上都给出了较低的分数。这种严厉程度并非固定的数值;机器对优秀文章的惩罚比对较差文章的惩罚更重,这意味着简单的数学调整无法弥补这一差距。其中一个模型表现得尤为突出,它在重复自身决策方面近乎完美,但却是最严苛的一个,这表明一致性并不自动意味着公平或准确。
研究还揭示了这些模型如何处理考试的具体规则,特别是针对那些完全跑题的文章。评分标准明确规定,如果学生写的主题错误,则各维度的得分均应为零。人类教师毫无例外地遵循了这一规则。然而,机器却没有做到这一点。即使面对与题目完全无关的文章,模型仍然给出了部分分数,未能识别出这些内容是不具备评分资格的。这是一个关键的操作性失败,表明如果没有人类的监督,机器无法区分“糟糕的回答”与“无关的回答”。此外,当研究人员观察写作的具体特征(如词汇或语法)时,模型经常无法识别这些类别之间的差异,将它们视为模糊的一体,而非截然不同的技能。
最终,研究表明,在学生前途攸关的高风险考试中,这些人工智能工具尚未准备好取代人类评分员。机器并非坏掉了,只是还不够可靠,无法独立承担责任。它们的功能定位不应是独立的裁判,而应是能够标记差异或提供第二意见供人类复核的助手。研究结论指出,要使人工智能在教育领域发挥作用,它必须成为受监督的工作流的一部分,其中人类保持控制权,检查机器的工作,执行规则,并做出最终裁定。这项技术提供了一种扩展教育者影响力的强大方式,但它目前还无法取代确保每位学生都能获得公平且准确评分所需的细致判断力。
技术摘要:超越平均分:人类与生成式人工智能评分者在 EFL 写作评估中的个体与特质层面一致性
问题陈述
本研究旨在解决大规模语言模型(LLMs)在自动化作文评分(AES)验证方面的关键空白。尽管 LLMs 被越来越多地提议作为写作评估工具,但现有的比较往往依赖于群体平均值或相关性,这可能会掩盖个体脚本层面及特定分析特质上的显著分歧。本文认为,高相关性并不等同于一致性;一个模型可能在追踪基准的同时,表现出系统性的严苛性、范围限制或基于分数的偏差。此外,模型生成合理分数的能力并不能保证其在具有后果性决策(例如:升入学位课程)中的有效性,特别是在能否一致应用操作规则(如识别离题响应)方面。核心问题在于,AI 的判断能否被纳入一个有效的、可问责的评估系统中进行管理,而不仅仅是简单地取代人类评分者。
研究方法
本研究采用了重复测量、来源交叉设计,旨在评估三种生成式 AI 模型在后果性 EFL 熟练度考试背景下的端到端表现。
- 数据来源: 来自土耳其一所私立大学(2026 年 6 月)模块 4 熟练度考试的 72 份扫描手写观点文章。样本包括 67 篇主题相关的脚本和 5 篇完全离题的脚本。
- 评分来源:
- 人类: 六名 EFL 讲师使用五维分析性量表(任务完成度、大纲、词汇范围/准确性、语法/结构/准确性、连贯性)对脚本进行了两次盲评(第一轮和第二轮)。
- AI 模型: Claude Fable 5, GPT 5.6, 以及 Gemini 3.1 Flash。
- 流程:
- 零样本应用(Zero-Shot Application): 模型接收了精确的量表和指令,未进行校准文章或少样本(few-shot)示例的引导。
- 输入: 高质量扫描 PDF(手写体),评估过程包含了对手写识别系统的性能评估,而非仅仅是孤立的评分判断。
- 约束条件: 无模型特定的微调;采用禁用记忆的新会话以确保独立性。
- 分析方法:
- 一致性指标: 双向绝对一致性单测组内相关系数(ICC(A,1))、平均偏差、平均绝对误差(MAE)以及容差率(±1 总分)。
- 统计检验: 配对自助法比较(5,000 次重采样)用于 ICC 差异分析、Bland–Altman 分析用于一致性界限和比例偏差、Friedman 检验用于严苛性分析、以及特质分离分析(维度间相关性)。
- 离题处理: 对五篇离题脚本进行描述性检查,以测试规则执行情况(全零分规则)。
关键结果
重复性 vs. 一致性:
- 人类双重评分显示出较强的重复性(ICC = .891)。
- AI 模型在稳定性方面差异显著:Claude Fable 5 几乎是完美稳定的(ICC = .998),而 GPT 5.6 (.817) 和 Gemini 3.1 Flash (.778) 的重复性低于人类基准。
- 关键发现: 高重复性并不意味着与人类对齐。Claude Fable 5 是最稳定的来源,但也是最严苛的。
个体层面一致性:
- 三个模型在绝对一致性方面均显著低于人类基准。
- ICC 分数: GPT 5.6 (.676) > Claude Fable 5 (.595) > Gemini 3.1 Flash (.566)。所有模型均显著低于人类基准 (.891)。
- 容差率: 仅有 55.2% 的人类双重评分落在 ±1 分范围内。相比之下,AI 模型实现此目标的比例仅为:Fable (10.4%)、GPT (26.9%) 和 Gemini (29.9%)。
严苛性与偏差:
- 每个模型的评分都比人类平均水平更严苛(Claude: -2.53 分;GPT: -1.58;Gemini: -1.38)。
- 比例偏差: 这种低分现象并非恒定;随着脚本质量的提高,低分现象愈发严重(差值-均值回归呈现负斜率)。这表明简单的加法修正是不恰当的,并且可能会导致接近晋升阈值的学生被误分类。
特质层面分析:
- 一致性因维度而异。例如,Claude Fable 5 在语法维度的一致性最低(ICC = .422),而 GPT 和 Gemini 在大纲维度表现最差。
- 特质分离: Gemini 表现出高度的分数冗余(维度间相关性 .968),表明其分析剖面缺乏独立的变异性。Claude 显示出较低的相关性 (.760),这可能意味着更好的区分度或增加了噪声。
规则执行(离题脚本):
- 在测试的零样本程序下,没有任何模型对五篇离题脚本执行了强制性的全零分规则。
- 虽然人类评分者在所有维度上均给出了 0 分,但这些脚本的模型平均分在 2.5 到 12.0 之间。这代表在来源平均水平上,模型对离题规则的敏感度为 0%。
主要贡献
本文贡献了一种层级化的操作验证方法,区分了 AI 支持评估的五个不同要求:
- 重复性: 来源能否复现其自身的决策?
- 人类对齐: 对于个体学习者而言,其决策是否可以与人类基准互换?
- 构念表征: 分析性量表是否能产生差异化的特质信息?
- 严苛性控制: 误差在分数范围内是否稳定?
- 规则执行: 类别性政策(如离题排除)是否得到正确执行?
研究表明,一个模型可能在某一层面(如重复性)表现出色,但在其他层面(如严苛性或规则执行)却表现不佳,因此反对仅凭单一指标进行模型选择。
意义与主张
本文谨慎地提出,其研究结果不支持在具有后果性的 EFL 写作评估中自主替代人类评分者。相反,它为受监督的、由差异触发的 AI 使用模式提供了证据。
- 操作现实: 研究强调“AI”不能被视为单一的评分类型;其表现高度依赖于具体的模型和程序。
- 有效性论证: 有效性需要各层面的证据;仅有技术准确性(重复性)在缺乏构念表征和规则执行证据的情况下是不够的。
- 建议的工作流: 作者建议采用一种基于证据的工作流,即 AI 作为“第二意见”或“差异标记器”,对于被标记的响应、高分段脚本以及离题检测,需由人类进行最终裁定。
- 局限性: 作者承认,基于扫描的设计将手写识别与评分判断混淆在一起,且研究受限于单一机构、单一任务族系及特定的模型版本。作者明确指出,其发现描述的是在这些特定条件下的操作表现,而非关于所有 LLMs 的普遍真理。
总之,研究断言,在 AI 支持的评分能够增强教育决策之前,必须通过这些特定层面进行验证,并将其整合进一个具备人类监督的系统中,而不是将其作为独立的评分引擎。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。