← 最新论文
💻 computer science

Estimating Exam Item Difficulty with LLMs: A Benchmark on Brazil's ENEM Corpus

本论文通过将十种大语言模型与巴西国家中学教育考试(ENEM)进行基准测试,揭示了虽然它们能够适度对题目难度进行排序,但系统性地低估了题目的难度,在处理多模态内容方面表现挣扎,且缺乏个性化评估所需的上下文可塑性,从而表明它们最适合作为经过校准的筛选工具,而非权威的生成工具。

原作者: Thiago Brant, Julien Kühn, Jun Pang

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Thiago Brant, Julien Kühn, Jun Pang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一位正在编写新数学测试卷的老师。你有一个超级聪明的机器人助手(AI)可以帮你编写题目。但在你把测试卷交给学生之前,你需要知道:这道题是太简单了?还是太难了?

传统上,老师通过先将测试卷交给数千名学生进行测试,根据他们的成绩并进行复杂的数学计算,来确定难度。这既耗时又费钱。

这篇论文提出了一个简单的问题:我们能不能直接问 AI,“这道题有多难?”,并且信任它的回答?

研究人员使用巴西大规模国家高中考试(ENEM)测试了这个想法,该考试拥有 1,000 多道真实的题目。他们要求十种不同的 AI 模型去猜测这些题目的难度,并将它们的猜测与人类专家计算出的“官方”难度分数进行了对比。

以下是研究结果,通过一些日常类比进行了说明:

1. “擅长排序,但不擅长数值”的问题

这些 AI 模型就像是一个非常擅长按大小排列书籍,但却完全不会用尺子测量长度的学生。

  • 好消息: 如果你要求 AI 将 10 道题按“从易到难”进行排序,它做得还算不错。它能分辨出题目 A 比题目 B 更难。
  • 坏消息: 如果你问 AI,“在 1 到 10 的范围内,这道题有多难?”,它总是错的。它几乎总是认为题目比实际情况更容易。这就像一个人觉得马拉松只是一次“轻快的慢跑”,因为他从未跑过马拉松一样。

2. “盲目”效应(视觉 vs. 文本)

许多考试题目包含图片、图表或图形。由于有些 AI 无法“看到”图像,研究人员不得不通过文字来描述这些图片(就像盲人向朋友描述一幅画作一样)。

  • 结果: 当 AI 必须仅根据图片的文字描述来猜测难度时,它会感到困惑。它在处理这类题目时的表现远不如纯文本题目。
  • 类比: 想象一下,如果你只能通过阅读对零件的描述,而不是亲眼看一眼拼图,来猜测这个拼图有多难。你可能会错过关键的线索,导致拼图看起来比实际更简单或更难。

3. “一刀切”的陷阱(学生背景)

研究人员想看看 AI 是否可以根据在参加考试来调整其答案。他们问 AI:“对于来自芬兰的学生来说,这道题有多难?”对比“对于来自巴西的学生来说,这道题有多难?”

  • 结果: AI 几乎没有改变自己的看法。它对这些变化表现得相当“听觉迟钝”。
  • 类比: 想象一位厨师在煮汤。如果你问,“这碗汤对婴儿来说会不会太咸了?”或者“对健身爱好者来说会不会太咸了?”,厨师只是耸耸肩说,“这就是同样的汤。”AI 并没有真正理解不同的学生拥有不同的背景和知识水平。它无法根据不同的人来调整它的“难度计”。

4. “提示词”的游戏(提问方式很重要)

研究人员尝试以不同的方式询问 AI。有时他们只是说“评价一下”。有时他们会说“扮演一名数学老师,一步步思考,然后评价这个”。

  • 结果: 提问的方式显著改变了 AI 的回答。虽然某些“思考型”提示词有助于 AI 提高排序的准确性,但它们并不能解决 AI 认为所有题目都太容易的问题。
  • 类比: 这就像向朋友征求电影推荐。如果你问“有什么好电影吗?”,他可能会推荐喜剧片。如果你问“在下雨的周二晚上有什么好电影?”,他可能会推荐惊悚片。AI 的回答取决于你如何组织问题。

核心结论:作为“筛选”工具

论文的结论是,我们不应该把这些 AI 模型视为**“神谕”(提供完美答案、无所不知的神),而应该把它们视为“筛选器”**(第一层过滤器)。

  • 建议: 使用 AI 快速扫描一大堆新题目,并让它指出:“嘿,这道题看起来可能太简单了,而那道题看起来可能太难了。”
  • 注意点: 你不能信任 AI 给出的精确数字。你必须修正它的“偏差”(教会它不要低估难度),并且必须由人类来检查那些带有图片的题目。

简而言之: AI 是一个有用的助手,可以帮助你把“容易”的题目和“困难”的题目区分开来,但它还没有准备好成为判断一道题确切难度的最终裁判,也还没准备好理解不同类型学生的特定需求。我们需要对其进行校准,并保持人工参与。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →