← 最新论文
🤖 machine learning

Learning to Grade Efficiently: A Bandit-Driven Prompt-Selection Framework for Low-Cost LLM Essay Scoring

本文介绍了一种具备成本感知能力的多臂老虎机框架,该框架能够为自动作文评分自适应地选择最优提示策略,在实现与穷举网格搜索相当的准确度的同时,将大语言模型(LLM)的调用次数减少了 78.4%,并建立了该领域首个成本-可靠性学习曲线。

原作者: Olga Manakina, Igor Bogdanov

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Olga Manakina, Igor Bogdanov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在教育领域,批改一叠论文是一项沉重且耗时的任务。几十年来,计算机一直试图对此提供帮助,但它们往往难以匹配人类教师的细微差别。最近,被称为“大语言模型”的新一代强大计算机程序展现出了阅读和理解人类写作的卓越能力。这些系统可以被指示扮演考官的角色,根据特定的规则为学生的作品评分。然而,一个显著的问题仍然存在:运行这些程序的成本很高。给计算机提供的指令越详细,获取答案的成本就越高。此外,向计算机提问的最佳方式并不总是显而易见的;它会根据特定的论文或所使用的软件版本而变化。教育工作者和测试机构面临着一个艰难的选择:是支付高昂的价格,将每一篇论文都通过每一套可能的指令进行运行以寻找最佳方案,还是冒着使用更便宜、准确度较低的方法可能失准的风险。

卡尔顿大学的一个研究小组提出了一种解决这一困境的新方法。他们并没有试图预先猜测完美的指令集,而是构建了一个在工作过程中不断学习最佳方法的系统。他们将询问计算机如何评分的不同方式比作一组老虎机,每台机器都有不同的中奖概率。随着系统对论文进行评分,它会记录哪些方法产生的评分与人类教师最为接近,以及哪些方法效率最高。随着时间的推移,系统自然地停止了在低效方法上的精力浪费,转而几乎完全专注于那些效果最好的方法。这种方法使他们能够在使用比传统方法更少计算机资源的情况下,找到最有效的评分策略。

研究人员使用来自雅思(IELTS)写作考试(一项主要的国际英语水平测试)的 787 篇真实论文集对这一想法进行了测试。他们设置了四种不同的计算机评分方式。其中两种方法要求计算机立即给出一个总体的单一分数,而另外两种方法则要求计算机在计算最终分数之前,将论文分解为四个特定类别——例如作者对题目回答得如何以及思路是否组织有序。对于其中的一半方法,计算机还被展示了优秀和较差论文的范例,以帮助其理解观察重点;而对于另一半方法,它必须依靠自身的知识。随后,系统开始对论文进行评分,并使用一种学习算法来决定每篇新论文应使用哪种方法。

结果清晰且立竿见影。系统很快发现,最有效策略是那种将论文分解为特定类别并提供优劣范例的方法。这种方法产生的分数始终与人类考官的分数最为一致。相比之下,那些跳过范例或试图在不进行拆解的情况下直接给出单一分数的法,表现明显较差。该学习算法非常有效,在经过短暂的测试后,它几乎不再选择较弱的方法,而是将超过 7 0% 的精力投入到表现最好的方法中。

或许最令人惊讶的发现出现在研究人员观察这些指令的成本时。传统观念认为,向计算机提供更详细的规则和解释应该会带来更好的结果。然而,研究却发现了相反的情况。当研究人员从指令中移除关于评分规则的长篇详细描述时,计算机的表现反而变好了。这种依赖于计算机已有写作理解而非规则手册的简化指令,不仅带来了更准确的分数,还使用了更少的计算机资源。这表明,这些强大的计算机程序在训练过程中已经学习了学术写作的细微差别,因此不需要再次被告知每一个细节。

这种自适应方法的效率提升是巨大的。通过让系统在运行过程中自行选择最佳方法,研究人员与那种尝试在每篇论文上运行所有可能选项的传统方法相比,减少了近 79% 的计算机调用次数。这种计算机调用次数的大幅减少,直接转化为处理的总字数减少了 73%,以及实验估计成本降低了 70%。该系统达到了与详尽、昂贵的法同等的准确度,但所付出的努力仅为后者的一小部分。

这项工作代表了自动化评分处理方式的一种转变。研究人员表明,选择指令不应被视为一个必须在工作开始前决定的固定设置,而可以是一个随着过程推进而不断改进的动态过程。虽然这项研究局限于特定的论文集和一种类型的计算机程序,但其发现为教育技术提供了一条充满希望的路径。通过平衡准确性需求与运营成本的现实,这种方法为大规模测试项目实现高质量的自动化评分提供了一种可行方案。研究表明,自动化评估的未来不在于构建更复杂的指令,而在于构建更智能的系统,使其知道如何在当下学习哪些指令最为奏效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →