← 最新论文
💬 NLP

Enhancing Automated Essay Scoring With Three Techniques: Two-Stage Fine-Tuning, Score Alignment, and Self-Training

本文提出了一种通过将两阶段微调、分数对齐和不确定性感知自训练这三种关键技术集成到 DualBERT 模型中,从而在有限数据和全量数据设置下提升自动作文评分性能的新颖方法,并在包括 ASAP++ 在内的多个数据集上取得了最先进的结果。

原作者: Hongseok Choi, Serynn Kim, Wencke Liermann, Jin Seong, Jin-Xia Huang

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Hongseok Choi, Serynn Kim, Wencke Liermann, Jin Seong, Jin-Xia Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个疲惫不堪的老师每周不得不批改数百篇作文的世界。这是一项巨大的工作,而且要做到公平公正需要时间和精力。为了提供帮助,科学家们开发了“自动作文评分”(Automated Essay Scoring, AES)系统——这些程序可以阅读学生的文章并给出评分,就像人类一样。把这些程序想象成数字助教。长期以来,这些助教就像是聪明但笨拙的机器人;它们需要阅读数以千计的范例才能变得擅长评分。如果老师只有几篇作文要改,机器人就会感到困惑并给出错误的评分。这是一个大问题,因为在现实世界中,老师通常并没有成千上万篇作文来训练计算机;他们手里往往只有自己班级的一叠纸。

挑战在于,教计算机理解写作是非常困难的。这不仅仅是关于统计词数或检查语法;它关乎对思想流向、语调和结构的理解。虽然已经存在庞大且强大的AI模型(比如那些能写故事或与你聊天的模型),但除非给予海量的数据,否则它们在处理这项特定任务时往往表现挣扎。因此,研究人员面临的一个大问题是:我们如何让一个即使在没见过多少例子的情况下,也能聪明且公平的计算机评分器?

这篇论文介绍了一种巧妙的新方法来训练这些数字评分器,特别是在学习样本非常少的情况下。研究人员使用了一个名为 DualBERT 的模型(它像是一个既能理解单个句子又能理解整篇文章的聪明读者),开发了三种特殊的技巧来提升性能。

首先,他们使用了一种叫做**带有 LoRA 的两阶段微调(Two-Stage Fine-Tuning with LoRA)**的方法。想象一下,你正在教一个已经掌握英语基础的学生。与其让他们从头开始重新学习所有内容,不如给你一些特殊的“荧光笔”(LoRA),让其能够专注于特定的、棘手的任务部分,而不会破坏他们已经掌握的知识。研究人员让模型使用这些“笔”进行两轮练习,尝试不同的方式来权衡不同作文特质(如内容与组织结构)的重要性,直到找到完美的平衡点。

其次,他们引入了分数对齐(Score Alignment)。有时,即使是聪明的评分器也会因为紧张而表现得过于保守。如果一个学生写了一篇完美的文章,计算机可能会因为害怕给出满分而给出一个 9.8 分(总分 10 分)。如果文章很糟糕,它可能会给 0.2 分而不是 0 分。这种技术就像是一个“校准工具”。研究人员观察计算机对一小组练习性文章的评分情况,看看它在哪里表现得过于胆怯或过于大胆,然后应用一个简单的数学调整来修正实际测试中的分数。这就像调音,确保每一个音符都能达到正确的音高。

第三,他们使用了基于不确定性的自我训练(Uncertainty-Aware Self-Training)。这是指计算机在尚未被评分的文章上进行练习。计算机阅读这些未评分的文章并给出一个“虚拟”分数。但关键在于,如果计算机对自己给出的分数感到不确定(即“不确定性”较高),它就会丢弃那篇文章。它只保留那些它感到有把握的文章,将其作为额外的练习材料。通过这种方式,计算机可以在不误学自身错误的前提下,从更多的例子中学习。

当研究人员将这三种技巧结合在一起,并在一个名为 ASAP++ 的数据集上进行测试时,结果令人印象深刻。在计算机仅有 32 篇作文可供学习(极少量数据)的情景下,这种新方法显著提高了评分准确度。它的表现达到了经过约 1,000 篇作文训练的模型性能水平的 91.2%。简单来说,凭借极少的数据和这三个聪明技巧,计算机的表现几乎可以媲美读过整个图书馆规模文章的模型。

更有趣的是,当计算机拥有充足的数据(“全数据”设置)时,仅靠“分数对齐”这一技巧就帮助它打破了所有纪录,取得了新的最佳成绩。研究人员还在其他包含不同类型作文的数据集上进行了测试,发现这些技巧同样有效,这表明这些方法具有鲁棒性,而不仅仅是针对某一个特定测试的偶然现象。

论文指出,这些技术是模块化的,这意味着它们可以与其他系统混合搭配使用。然而,作者也谨慎地指出,尽管结果很强,但仍面临局限性。例如,“自我训练”方法需要大量的未评分文章才能发挥作用,而这在某些学校可能并不总是能实现。此外,“两阶段”方法在最初训练计算机时会多花一点时间,但在随后的实际评分过程中并不会减慢速度。

最终,这项研究表明,我们并不总是需要海量的数据来构建优秀的 AI 工具。通过使用智能策略来微调模型、校准分数以及仔细筛选练习材料,我们可以创造出可靠的自动化评分器,即使在数据匮乏的情况下也是如此。这让我们离拥有为各地教师提供帮助、公平且高效的数字助教又近了一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →