Automated item evaluation: Predicting item acceptance and rejection using LLM-generated critiques
本研究表明,结合原始题目文本与大语言模型生成的评语的融合模型,能够有效预测标准化考试中题目的接受与拒绝,在数学和通用质量问题方面取得了强劲的表现,同时也凸显了在处理偏见和敏感性问题时持续进行人工审核的必要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一位每周都要批改数千份家庭作业的老师。有些作业非常精彩,有些让人困惑,而有些则纯粹是错的。通常情况下,你必须阅读每一份作业才能决定保留哪些、丢弃哪些。这既缓慢、昂贵又令人疲惫。现在,想象有一个超级聪明的机器人助手,它能阅读这些作业,并在你投入时间批改之前告诉你:“嘿,这个看起来有风险,也许不要使用它。”这就是**自动化题目评估(Automated Item Evaluation, AIE)**的世界。它是教育技术的一个分支,试图利用计算机来判断测试题目(称为“题目”)的质量,而无需人类专家阅读每一个题目,也不需要先在真实学生身上进行测试。一个核心问题是:我们能否教会计算机仅通过阅读文本就能识别出一个“坏”的测试题,从而避免我们在稍后才发现题目有问题时陷入麻烦?
这篇论文正是关于构建那个超级聪明的机器人助手的。研究人员 Hotaka Maeda 和 Yikai Lu 想要创建一个系统,该系统能够查看一个测试题并预测它是会被“接受”(合格)还是被“拒绝”(丢弃),其依据是一个来自大型标准化考试项目的、包含 52,759 个真实题目的庞大数据库。他们并没有只是将原始题目喂给计算机;他们尝试了一个巧妙的技巧。他们要求一个大型语言模型(一种可以写作和思考的 AI 类型)先为题目写一段简短的“评论”或审查,然后将原始题目和那段 AI 评论一起输入到他们的预测模型中。这就像是在你决定是否要亲自阅读整本书之前,先雇佣一名学生来写一份书籍的简要总结。
研究结果非常令人兴奋,但也带有重要的限制条件。这个“融合模型”(即同时观察原始题目和 AI 评论的模型)表现最好。它整体上的正确率达到了 75%。然而,它在数学题目方面表现得像个超级英雄(正确率达 73%),但在英语语言艺术(ELA)题目上却表现得稍显吃力(准确率仅为 51%)。研究人员发现,如果我们让机器人变得更“疑神疑鬼”一点——即告诉它去标记任何“可能”有问题的题目,而不是等到它“确定”有问题时再行动——它就能捕捉到 90% 的坏题目,尽管它也会误报一些好题目。
这是最重要的部分:机器人非常擅长发现那些难度过高、表述混乱或不符合课程标准的题目。但是,它在识别具有偏见、不公平或针对特定群体敏感性的题目方面表现得很糟糕。这篇论文表明,虽然计算机在检查测试题目的“机械结构”方面正变得越来越好,但它们仍然需要人类教师来检查题目的“灵魂”与公平性。因此,未来的目标不是取代人类,而是为人类提供一个强大的工具,让他们能够过滤掉明显的垃圾信息,从而把精力集中在那些复杂且重要的事务上。
“坏题检测器”的故事
问题所在:堆积如山的作业
创建标准化考试就像建造一座巨大的乐高城堡。你需要成千上 thousand 个独立的积木块(题目)来支撑起这座城堡。但并非所有的积木都是好的。有些是裂开的,有些颜色不对,有些则根本无法契合。传统上,专家必须拿起每一块积木进行检查,有时甚至要在学生群体中进行测试以观察其效果。这既耗时又昂贵。随着 AI 自动生成题目的兴起,积木的山堆正在日益壮大。我们需要一种方法,在不手动检查每一块的情况下,快速筛选出好的积木和坏的积木。
实验过程:双脑策略
研究人员决定训练一个计算机大脑(具体是一个名为 DeBERTaV3-large 的模型)来进行这种分类。他们拥有一个包含 52,759 个题目的庞大数据集。其中约 34% 被“拒绝”(因质量问题被永久移除),其余则被“接受”。
他们尝试了三种不同的方式来教导计算机:
- 纯文本阅读者: 他们只将题目的文本输入给计算机。
- 评论家: 他们要求另一个 AI(Qwen3)先为题目写一段两句话的评论,然后将该评论输入给计算机。
- 融合模型: 他们将两者结合!他们将原始题目和 AI 的评论一起输入给计算机。
结果:聪明但有缺陷的助手
“融合模型”是明显的赢家。它的准确率为 0.75(意味着它在 75% 的情况下是正确的),F1 分数为 0.64。
- 数学 vs. 英语: 该模型是一个数学天才,对于数学题目的 F1 分数为 0.73。但在英语语言艺术(ELA)方面,它的表现却有些踉跄,F1 分数仅为 0.51。作者认为这可能是因为英语题目通常依赖于长篇阅读文章,而研究人员因为文章太长而在数据中将其剔除了。
- “偏执”设置: 研究人员注意到,如果他们将“报警阈值”从 0.5 降低到 0.25,模型捕捉坏题目的能力会变得更强。它捕捉到了 90% 的被拒绝项(数学题目的灵敏度为 0.90,ELA 为 0.88)。代价是什么?它开始把太多好题目也标记为坏题目(特异度下降)。作者建议,这种“偏执”设置可能非常适合自动化题目生成场景,因为在那里生成题目很便宜,但审核题目却很昂贵。如果能在早期阶段就抓住 90% 的坏题,就能节省大量时间。
模型遗漏了什么:人类的触感
尽管取得了成功,该模型仍有一个盲点。它非常擅长发现难度过高或存在“心理测量学”(统计学问题)问题的题目。然而,它在检测涉及偏见、敏感性、公平性和无障碍性的问题方面表现得非常吃力。对于英语题目,它只能捕捉到 27% 的此类问题。作者解释说,这些是深刻的人类问题。计算机可以识别一个词是否难,但它可能意识不到某个特定的故事对某种文化或群体来说是否具有冒犯性。这表明,虽然 AI 可以承担繁重的过滤工作,但人类专家对于检查公平性仍然是绝对必要的。
总结
这篇论文表明,我们可以构建一个近乎全面的工具来自动评估测试题目。通过将题目的原始文本与 AI 生成的评论相结合,我们可以更准确地预测一个题目是合格还是不合格。它并不是解决一切问题的万能药——尤其是在涉及公平性和偏见时——但它是一个强大的新工具,可以为教育工作者和测试公司节省大量的时间和金钱。未来的测试模式可能涉及由机器人进行第一轮筛选,从而让位于人类专家,让他们专注于那些真正需要人类之心去评判的题目。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。