Every Wrong Answer Counts: Option-Level Psychometrics for LLM Multiple-Choice Benchmarks
本文介绍了大语言模型标称响应模型(LLM-NRM),这是一种心理测量学框架,它利用包括错误选项在内的完整答案分布,来更准确地估计大语言模型的能力和题目特征,证明了干扰项偏好提供了显著的测量价值,并能够实现比传统二元评分更高效的基准测试。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你是一名正在批改选择题的老师。在传统的做法中,你只关心最终的分数:对了一个勾,错了一个叉。如果学生答错了,你只看到一个红色的“X”。你并不知道他们为什么错。是因为随机猜测?是因为被一个陷阱词迷惑了?还是因为他们单纯讨厌字母“B”这个选项?长期以来,研究人工智能(AI)的科学家们一直在做同样的事情。他们让 AI 模型做选择题,并且只统计正确答案的数量。这就像是仅仅根据一道菜是否能吃来评判一位厨师,却忽略了他是盐放多了、忘了放胡椒,还是不小心用叉子盛了汤。
这篇论文进入了心理测量学(psychometrics)的世界——即测量人类(以及现在的机器)能力的科学。它建立在一个被称为“项目反应理论”(Item Response Theory)的巧妙概念之上,这基本上是一种高级说法,意指一个测试题目不仅仅是“难”或“易”;它拥有自己的“个性”。有些问题会误导聪明人,而有些问题则会误导初学者。这篇论文提出的核心问题是:如果我们不再把每一个错误答案都视为简单的失败,我们能否学到新的东西?作者们提出,AI 选择的具体错误答案实际上是一个信息宝库,它揭示了 AI 如何思考、它在哪里产生了混淆,以及即使在出错时它的信心程度如何。
这篇论文的核心思想:为什么错误答案其实是正确的
由 Xiao Fei 及其同事领导的研究团队引入了一个新工具,称为 LLM-NRM(LLM 名义反应模型)。可以把它想象成将评分系统从简单的“及格/不及格”表升级为详细的“法医鉴定报告”。
在旧的方法中,如果问 AI:“太阳系中哪种天体被小行星带环绕?”而它选择了“土星”而不是正确的“太阳”,系统只会记录为一个错误。但新模型观察得更细致。它意识到,选择“土星”与选择“冥王星”或“月球”是不同的。也许 AI 知道土星有光环,所以产生了混淆;或者它只是单纯喜欢“土星”这个词的发音。通过分析 AI 选择了哪个错误答案,该模型可以比以往仅靠计数正确答案更准确地绘制出 AI 的“大脑”图谱。
团队在大规模范围内进行了测试:189 个不同的 AI 模型和来自 14 个不同基准测试的 31,554 个问题。他们发现,这种新方法取得了巨大的进步。当他们尝试预测 AI 对未见过的问题的回答时,该模型比传统的二元(对/错)方法要准确得多。
秘诀所在:是什么让 LLM-NRM 特别?
论文指出,AI 模型不仅仅是“聪明”或“愚笨”;它们拥有旧测试所忽略的特定怪癖。新模型考虑了 AI 在进行测试时发生的三种奇特行为:
- 信心与知识(校准锐度): 有时 AI 即使在错误时也非常确定自己是对的。有时即使是对的,它也显得犹豫不决。旧的测试无法区分这两者。新模型有一个“锐度”调节盘,用于衡量 AI 在答案之间分配赌注时的信心程度。
- “B”偏好(位置偏好): 人类和 AI 有时会有一种奇怪的习惯,仅仅因为某个选项在页面上的位置,就倾向于选择第一个或最后一个选项,而不是基于其内容。新模型能够识别这种偏差并将其扣除,从而不会让 AI 看起来比实际能力更强。
- “猜测”回退机制: 当问题太难时,AI 可能会放弃并根据某种随机规则(例如“总是选最长的单词”)来选择答案。新模型可以检测到 AI 是否在进行这种“回退”行为,并将此行为与其实际知识分离。
重大发现:错误答案是金矿
最令人兴奋的发现是,错误答案携带的信息量比你想象的要大得多。 作者计算出,观察选择了哪个错误答案,比仅仅知道它是对还是错,每道题能多提供约 101% 的有用信息。
为了证明这一点,他们做了一个很酷的实验。他们尝试仅利用 AI 答错的问题来预测该 AI 的整体技能水平。令人惊讶的是,仅仅通过观察错误的模式,他们就能以 0.943 的相关性(这是一个非常高的分数,1.0 为完美)来估算 AI 的能力。这意味着你甚至不需要看到正确答案,就能理解这个 AI 有多聪明;错误本身就讲述了整个故事。
让测试变得更聪明、更高效
由于这种新模型能从每一个问题中获取如此多的信息,它可以让测试变得极其高效。
- 所需问题更少: 通常,要准确排名 AI 模型,你需要数百个问题。作者发现,使用他们的新方法,你只需挑选 41 个最具信息量的问题,就能几乎完美地匹配完整测试的排名。这实现了 770 倍的减量!
- 所需模型更少: 通常,你需要数千个 AI 模型来“校准”一个测试(即确定问题的难度)。这种新方法仅需使用 5 个 AI 模型即可完成测试校准并获得良好的结果,而旧方法在模型数量如此之少时会变得混乱且不可靠。
这对未来意味着什么
论文总结道,我们一直以来通过将每个错误答案视为同一种情况,从而丢弃了海量的数据。通过倾听 AI 是如何犯错的,我们能得到一个更清晰、更公平、更快速的图像,展现它实际能做什么。这就像是意识到一个学生的错误答案不仅仅是一次失败,而是一张地图,标示出了他们的理解在哪里停止,以及他们的困惑从哪里开始。作者建议,这种方法可以帮助我们构建更好的测试,并比通过简单的成绩单更深入地理解 AI 的行为。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。