← 最新论文
💬 NLP

Estimating LLM Grading Ability and Response Difficulty in Automatic Short Answer Grading via Item Response Theory

本文引入项目反应理论(IRT)框架以评估基于大语言模型的自动简答题评分,揭示出聚合分数相似的模型在回答难度增加时表现出截然不同的稳健性特征,并识别出与评分错误相关的特定语言和语义特征。

原作者: Longwei Cong, Sonja Hahn, Sebastian Gombert, Leon Camus, Hendrik Drachsler, Ulf Kroehne

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Longwei Cong, Sonja Hahn, Sebastian Gombert, Leon Camus, Hendrik Drachsler, Ulf Kroehne

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名教师,正在批改一叠短文。有些答案显而易见:“天空是蓝色的”显然是正确的。而另一些则很棘手:学生写出的句子一半正确、一半错误,并且使用了令人困惑的词语。

长期以来,当研究人员测试人工智能(大语言模型或 LLM)能否自动批改这些文章时,他们只关注最终分数。他们会问:“人工智能的整体正确率是否达到了 80%?”这就像仅仅因为一名篮球运动员投进了 80% 的球,就断定他“很出色”,却忽略了他投进了所有简单的上篮,却投丢了每一个高难度的三分球。

本文认为,这种“平均分”方法掩盖了许多重要细节。相反,作者使用了一种来自心理学的工具,称为项目反应理论(IRT)。可以将 IRT 想象成一种特殊的显微镜,让你同时看到两件事:

  1. 批改者的技能水平(即人工智能)。
  2. 特定问题的难度(即学生的答案)。

以下是他们发现的内容,使用简单的类比进行分解:

1. “难度曲线”测试

研究人员在两组科学问题上测试了 17 种不同的人工智能模型。他们不仅统计了正确答案的总数,还根据学生答案的棘手程度,将其从“简单”到“困难”进行了排序。

发现: 即使两个人工智能的整体分数相同,当情况变得困难时,它们的表现也会截然不同。

  • 类比: 想象两名跑步者。跑步者 A 和跑步者 B 都以相同的总时间完成了 5 英里的比赛。但是,跑步者 A 在平地上跑得快,一到山坡就慢得像爬行;而跑步者 B 全程保持稳定的配速。
  • 结果: 有些人工智能就像跑步者 A。它们擅长批改简单的答案,但一旦学生的答案令人困惑或模棱两可,它们就会彻底崩溃。其他人工智能则更像跑步者 B;它们在简单任务上可能不是绝对最快的,但即使答案变得困难,它们也能保持稳定和可靠。

2. “安全中间”陷阱

当人工智能模型遇到非常困难的答案时,它们并没有开始随机猜测。相反,它们养成了一种特定的坏习惯。

发现: 当答案难以理解时,人工智能倾向于默认使用一个称为“部分正确但不完整”的“中间立场”标签。

  • 类比: 想象法庭上的一位法官。当证据令人困惑且律师的论点杂乱无章时,法官没有说“有罪”或“无罪”,而是不断说:“嗯,这有点两者兼有,我们称之为‘可能有罪’吧。”
  • 结果: 人工智能不再做出明确的区分。它将所有令人困惑的答案都归入这个单一的“安全”中间类别。它变得过于乐观,认为杂乱的 answers 是“部分正确”,而实际上它们可能是错误的或无关的。

3. 为什么有些答案如此困难?

作者还研究了什么因素使答案难以被人工智能批改。他们分析了学生回答中的词汇和含义。

发现: 困难的答案通常具有三个具体特征:

  • 它们与“教科书”答案不匹配: 其含义与正确的参考答案相去甚远。
  • 它们包含矛盾: 学生所说的内容相互冲突,或与事实相悖。
  • 它们是“孤立的”: 在语言世界中,这些答案就像岛屿。它们看起来不像其他常见的答案。它们以某种独特或怪异的方式存在,令人工智能感到困惑。

主要结论

该论文得出结论:我们不应该只问“哪个人工智能是最好的批改者?”,而应该问“当答案变得杂乱无章时,哪个人工智能能保持冷静和准确?”

通过使用这种新的“显微镜”(IRT),我们可以看到,有些人工智能是脆弱的——它们在压力下会崩溃;而另一些则具有稳健性。这有助于我们理解,批改不仅仅是为了得到正确的数字,而是要理解人工智能在哪里以及为什么可能会失败,尤其是在处理学生实际写出的那些棘手、现实世界的答案时。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →