← 最新论文
💻 computer science

Beyond Mean Scores: Individual- and Trait-Level Agreement Between Human and Generative AI Raters in EFL Writing Assessment

本研究表明,尽管当前的生成式人工智能模型表现出较高的内部稳定性,但与人类评分者相比,它们在一致性、系统性严重程度偏差以及应用特定评分准则方面表现较低,这表明与人类双重评分相比,它们更适合作为受监督且由差异触发的辅助手段,而非在具有后果性的英语作为外语(EFL)写作评估中进行自主替代。

原作者: Savaş Okyay

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Savaş Okyay

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在语言学习的高风险领域,一篇论文的优劣可能决定一名学生是能升入大学,还是继续滞留在预科班。几十年来,教育工作者一直依赖人类教师来阅读这些文章,并根据衡量从语法到论证逻辑流程度等各项指标的复杂评分标准进行评分。最近,一个新竞争者进入了这一领域:人工智能。大型语言模型——即那些能够创作故事或回答问题的强大计算机程序——正越来越多地被提议作为自动评分器。其承诺是诱人的:机器快速、不知疲倦且具有一致性。但在教育领域,速度是不够的。一个评分系统必须不仅仅是产生一个看似合理的平均分;它必须在每一份学生作品的具体细节上与人类专家达成一致,公平地应用规则,并识别出学生写出的完全不属于考试范畴的内容。问题不再是机器能否生成一个数字,而是这个数字是否值得被信任,从而对学习者的生活做出改变命运的决策。

一位研究人员致力于在现实环境中测试这种信任,其研究超越了简单的平均分比较,旨在观察机器与人类在单篇论文上的实际契合程度。他们收集了来自土耳其学生的七十二篇手写论文,这些学生正在参加一项旨在确定其是否具备学位课程就读能力的水平考试。这些学生撰写了关于各种主题的观点文章,从努力工作的价值到朋友与财产之间的平衡。随后,研究人员对这些论文进行了严格的端到端评估。首先,六位经验丰富的教师使用包含任务完成度、组织结构、词汇、语法和连贯性五个部分的评分标准,对每篇论文进行了两次评分。然后,三种不同的人工智能模型——具体为 Claude、GPT 和 Gemini 的版本——阅读了这些手写论文的扫描图像,并使用完全相同的指令进行评分。至关重要的是,这些机器并未针对这些特定的论文接受过专门训练;它们必须现场应用规则,就像一位新来的教师一样。

结果揭示了一个比“完美的自动化替代人类判断”的希望更为复杂的局面。虽然人工智能模型在自身内部表现得非常一致——这意味着如果你要求同一个模型对同一篇论文进行两次评分,它几乎总会给出完全相同的分数——但它们在与人类教师保持一致方面却表现挣扎。两名人类评分者之间的契合度很高,但当机器与人类平均值进行比较时,这种联系显著减弱。每一个模型都倾向于比人类评审团更严苛,在所有维度上都给出了较低的分数。这种严厉程度并非固定的数值;机器对优秀文章的惩罚比对较差文章的惩罚更重,这意味着简单的数学调整无法弥补这一差距。其中一个模型表现得尤为突出,它在重复自身决策方面近乎完美,但却是最严苛的一个,这表明一致性并不自动意味着公平或准确。

研究还揭示了这些模型如何处理考试的具体规则,特别是针对那些完全跑题的文章。评分标准明确规定,如果学生写的主题错误,则各维度的得分均应为零。人类教师毫无例外地遵循了这一规则。然而,机器却没有做到这一点。即使面对与题目完全无关的文章,模型仍然给出了部分分数,未能识别出这些内容是不具备评分资格的。这是一个关键的操作性失败,表明如果没有人类的监督,机器无法区分“糟糕的回答”与“无关的回答”。此外,当研究人员观察写作的具体特征(如词汇或语法)时,模型经常无法识别这些类别之间的差异,将它们视为模糊的一体,而非截然不同的技能。

最终,研究表明,在学生前途攸关的高风险考试中,这些人工智能工具尚未准备好取代人类评分员。机器并非坏掉了,只是还不够可靠,无法独立承担责任。它们的功能定位不应是独立的裁判,而应是能够标记差异或提供第二意见供人类复核的助手。研究结论指出,要使人工智能在教育领域发挥作用,它必须成为受监督的工作流的一部分,其中人类保持控制权,检查机器的工作,执行规则,并做出最终裁定。这项技术提供了一种扩展教育者影响力的强大方式,但它目前还无法取代确保每位学生都能获得公平且准确评分所需的细致判断力。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →