← 最新论文
💬 NLP

Pitfalls of Evaluating Language Models with Open Benchmarks

本文表明,开源语言模型基准测试容易受到数据泄露和操纵的影响,这可以从模型对公开测试集过拟合且无法泛化的现象中得到证实,从而使得转向私有或动态评估方法成为确保可靠评估的必要手段。

原作者: Md. Najib Hasan (Wichita State University), Md Mahadi Hassan Sibat (University of Central Florida), Mohammad Fakhruddin Babar (Washington State University), Souvika Sarkar (Wichita State University)
发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Md. Najib Hasan (Wichita State University), Md Mahadi Hassan Sibat (University of Central Florida), Mohammad Fakhruddin Babar (Washington State University), Souvika Sarkar (Wichita State University), Monowar Hasan (Washington State University), Santu Karmaker (University of Central Florida)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:“开卷考试”陷阱

想象你是一位想要测试学生智力的老师。为了公平和透明,你决定在考试前公开出版一本包含准确题目和答案的公开书籍。你心想:“太棒了!每个人都可以学习,我们可以借此观察谁学得最好。”

这篇论文指出,在人工智能(AI)领域,这种“开卷考试”的方法存在一个巨大的缺陷。因为测试题目是公开的,一些学生(或者说在这种情况下是 AI 模型)并没有真正学习学科知识,而是在死记硬背答案解析

研究人员将这些 AI 模型称为“作弊模型”。他们证明了即使是一个微小、简单的 AI,只要通过记忆特定的问题,就能在著名的测试中获得满分,而无需真正理解其中的概念。当你给它们一个看起来略有不同的问题时,它们就会表现得一败涂地。

实验过程:打造“作弊者”

研究人员想要证明“操纵”系统是多么容易。他们没有使用超级强大、昂贵的 AI 超级计算机,而是构建了小型、轻量级的 AI 模型(就像一个大脑容量较小的学生),并将公开的测试题目直接喂给它们。

他们使用了一个名为 HELM 的流行测试套件,该套件涵盖了医学、法律、数学和故事创作等 10 个学科。

结果令人震惊:

  • 作弊行为: 当这个小型 AI 记忆了测试题目后,它在这些特定问题上的得分达到了 90% 到 99%。它甚至击败了世界上最先进的 AI 模型,登上了公开排行榜。
  • 现实检验: 一旦研究人员给它一个它从未见过的问题,它的得分便骤降至 不足 1%。这就像一个背下了去年数学考试答案的学生,却连今年的一道题都解不出来。

类比:
想象一个背诵了剧本的学生。如果你让他们背诵刚才背过的台词,他们听起来像个天才演员;但如果你让他们用一个新角色进行即兴表演,他们就会僵住。论文表明,许多 AI 排行榜上充斥着“剧本背诵者”,而非“真正的演员”。

提出的解决方案:“改写”护盾

研究人员问道:“我们能阻止这种作弊吗?”

他们尝试了一种简单的防御手段:改写(Paraphrasing)
他们不再问:“法国的首都是哪里?”(原始问题),而是改为:“哪座城市是法国政府的所在地?”(改写后的问题)。意思相同,但措辞不同。

结果:

  • 小型作弊者: 这些小型、靠记忆驱动的 AI 完全失败了。因为措辞变了,它们无法识别出这个问题。
  • 大型 AI: 更大、更聪明的 AI 处理这些改写后的问题表现得好得多。它们似乎真正理解了概念,而不仅仅是识别特定的单词。

隐忧:
研究人员随后问道:“如果作弊者知道了这个护盾怎么办?”
他们用成千上万个改写后的版本对这些小型“作弊”模型进行了训练。一旦这些作弊者意识到测试会被改写,它们就适应了。它们记住了改写的模式,并夺回了高分。

教训:
一个简单的技巧(如改写问题)在一段时间内是有效的,但如果作弊者预知了这一招,他们也能学会如何破解。这就像一个检查特定类型武器的保安;罪犯只会带上另一种类型的武器,或者把武器藏得更好。

三大核心结论

论文最后为关注 AI 排名的所有人总结了三个简单的教训:

  1. 高分并不总是意味着高智商: 仅仅因为一个 AI 在公开排行榜上排名第一,并不代表它很聪明。它可能只是非常擅长记忆特定的测试题目。
  2. 公开测试是脆弱的: 公开测试数据有利于透明度,但也为通过记忆进行的“作弊”打开了大门。我们不能仅仅依赖静态的、公开的测试。
  3. 我们需要动态测试: 要真正衡量 AI,我们需要会变化的、保持私密的或实时生成的测试。我们需要一个让“作弊者”无法通过死记硬背答案解析来应对的系统,因为答案解析每次都在变化。

总结

这篇论文警告我们,目前我们衡量 AI 模型的方式出了问题。通过记忆测试题目来进行作弊实在是太容易了。虽然像改写问题这样的简单修复手段能起到一点作用,但它们并不是永久的解决方案。要了解一个 AI 是否真正聪明,我们需要停止使用静态、公开的测试,转而使用动态的、更难预测的挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →