Cost-efficient generative AI summarization for scalable automated essay scoring in educational assessment
本研究提出了一种具有成本效益的混合生成式人工智能框架,该框架将基于 GPT-5 的文章摘要技术与手工构建的语言特征相结合,旨在克服 Transformer 的输入限制并增强可扩展的自动化作文评分,同时平衡评分可靠性、摘要保真度与计算成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一位正面临堆积如山的论文需要批改的老师。你想给每个学生提供有用的反馈,但阅读成千上万篇冗长且散乱的故事实在太耗时了。这就是**自动作文评分(Automated Essay Scoring, AES)**的世界——这是计算机科学的一个分支,研究如何让机器像人类一样学习阅读和评判写作。长期以来,这些计算机就像只能阅读短便条的学生;如果一篇论文太长,计算机就会直接切掉结尾,从而可能错过学生最精彩的论点。但现在,我们拥有了强大的“生成式人工智能(Generative AI)”工具——这些是能够编写和总结文本的超级智能计算机。研究人员提出的核心问题是:我们能否利用这些人工智能工具,先将长篇论文缩减为简短的摘要,以便评分计算机能够轻松阅读,同时又不丢失重要的部分?这有点像试图把一整部小说浓缩成一条推文:你需要保留情节和人物,但要删掉那些冗余的废话。如果我们能成功实现这一点,学校就可以瞬间完成论文评分,在学生还在思考想法时就给予反馈,而不是让他们等待数周直到老师批改完那堆论文。
这项研究深入探讨了那个确切的问题,测试了一种使用“先总结后评分”策略的新方法。研究人员使用了一个大规模的学生论文数据集,并利用三种不同版本的强大人工智能模型,将长篇论文重写为长度为 512 个 token 的短摘要。随后,他们将这些摘要连同一些关于写作的“手工制作”线索(例如句子长度和词汇量)一起输入到一个标准的评分计算机中,以观察其与人类教师评分的匹配程度。
结果有些令人惊讶。最昂贵、最强大的模型实际上生成了最好的摘要——它保留了最多的细节和意义。然而,说到最终的目标——准确评分,中等规模的模型才是冠军。它实现了最高的评分一致性,其**二次加权 Kappa 值(Quadratic Weighted Kappa, QWK)**达到了 0.8435,这是一种高级说法,意味着它比其他模型更符合人类的判断。最昂贵的模型得分 0.8350,而最小、最便宜的模型得分 0.8332。这表明对于这项特定的工作,你并不需要最大、最昂贵的引擎;“迷你版”提供了成本与性能之间的最佳平衡。
然而,研究还发现了一个棘手的模式:人工智能在处理优秀论文时表现得更为吃力。随着论文分数上升(从 1 分到 6 分),所有模型的摘要质量都有所下降。研究人员认为,这是因为高分论文自然而然地更长且更复杂,这使得它们在进行压缩而不丢失重要信息时变得更加困难。“迷你”模型虽然整体表现出色,但与全功能模型相比,它在处理这些复杂论文时的性能下降幅度更大。
作者谨慎地指出,这并不是适用于世界上每一所学校的最终、完美的解决方案。他们明确表示,这是一个“初步受控评估”,而不是针对每种可能方法的完整基准测试。他们没有测试每一种其他类型的 AI 或每一种可能的文本切割方式。相反,他们展示了使用生成式人工智能来总结论文是如何可以运作得很好且节省成本的,但他们也强调,我们需要更多的研究来确保系统不会在无意中惩罚那些撰写长篇、复杂、高质量论点的学生。这项研究表明,虽然我们可以利用人工智能使评分更快、更便宜,但我们在缩减文本时必须非常小心,以免在过程中丢失一篇优秀论文的灵魂。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。