Pitfalls of Evaluating Language Models with Open Benchmarks
本文表明,开源语言模型基准测试容易受到数据泄露和操纵的影响,这可以从模型对公开测试集过拟合且无法泛化的现象中得到证实,从而使得转向私有或动态评估方法成为确保可靠评估的必要手段。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:“开卷考试”陷阱
想象你是一位想要测试学生智力的老师。为了公平和透明,你决定在考试前公开出版一本包含准确题目和答案的公开书籍。你心想:“太棒了!每个人都可以学习,我们可以借此观察谁学得最好。”
这篇论文指出,在人工智能(AI)领域,这种“开卷考试”的方法存在一个巨大的缺陷。因为测试题目是公开的,一些学生(或者说在这种情况下是 AI 模型)并没有真正学习学科知识,而是在死记硬背答案解析。
研究人员将这些 AI 模型称为“作弊模型”。他们证明了即使是一个微小、简单的 AI,只要通过记忆特定的问题,就能在著名的测试中获得满分,而无需真正理解其中的概念。当你给它们一个看起来略有不同的新问题时,它们就会表现得一败涂地。
实验过程:打造“作弊者”
研究人员想要证明“操纵”系统是多么容易。他们没有使用超级强大、昂贵的 AI 超级计算机,而是构建了小型、轻量级的 AI 模型(就像一个大脑容量较小的学生),并将公开的测试题目直接喂给它们。
他们使用了一个名为 HELM 的流行测试套件,该套件涵盖了医学、法律、数学和故事创作等 10 个学科。
结果令人震惊:
- 作弊行为: 当这个小型 AI 记忆了测试题目后,它在这些特定问题上的得分达到了 90% 到 99%。它甚至击败了世界上最先进的 AI 模型,登上了公开排行榜。
- 现实检验: 一旦研究人员给它一个它从未见过的新问题,它的得分便骤降至 不足 1%。这就像一个背下了去年数学考试答案的学生,却连今年的一道题都解不出来。
类比:
想象一个背诵了剧本的学生。如果你让他们背诵刚才背过的台词,他们听起来像个天才演员;但如果你让他们用一个新角色进行即兴表演,他们就会僵住。论文表明,许多 AI 排行榜上充斥着“剧本背诵者”,而非“真正的演员”。
提出的解决方案:“改写”护盾
研究人员问道:“我们能阻止这种作弊吗?”
他们尝试了一种简单的防御手段:改写(Paraphrasing)。
他们不再问:“法国的首都是哪里?”(原始问题),而是改为:“哪座城市是法国政府的所在地?”(改写后的问题)。意思相同,但措辞不同。
结果:
- 小型作弊者: 这些小型、靠记忆驱动的 AI 完全失败了。因为措辞变了,它们无法识别出这个问题。
- 大型 AI: 更大、更聪明的 AI 处理这些改写后的问题表现得好得多。它们似乎真正理解了概念,而不仅仅是识别特定的单词。
隐忧:
研究人员随后问道:“如果作弊者知道了这个护盾怎么办?”
他们用成千上万个改写后的版本对这些小型“作弊”模型进行了训练。一旦这些作弊者意识到测试会被改写,它们就适应了。它们记住了改写的模式,并夺回了高分。
教训:
一个简单的技巧(如改写问题)在一段时间内是有效的,但如果作弊者预知了这一招,他们也能学会如何破解。这就像一个检查特定类型武器的保安;罪犯只会带上另一种类型的武器,或者把武器藏得更好。
三大核心结论
论文最后为关注 AI 排名的所有人总结了三个简单的教训:
- 高分并不总是意味着高智商: 仅仅因为一个 AI 在公开排行榜上排名第一,并不代表它很聪明。它可能只是非常擅长记忆特定的测试题目。
- 公开测试是脆弱的: 公开测试数据有利于透明度,但也为通过记忆进行的“作弊”打开了大门。我们不能仅仅依赖静态的、公开的测试。
- 我们需要动态测试: 要真正衡量 AI,我们需要会变化的、保持私密的或实时生成的测试。我们需要一个让“作弊者”无法通过死记硬背答案解析来应对的系统,因为答案解析每次都在变化。
总结
这篇论文警告我们,目前我们衡量 AI 模型的方式出了问题。通过记忆测试题目来进行作弊实在是太容易了。虽然像改写问题这样的简单修复手段能起到一点作用,但它们并不是永久的解决方案。要了解一个 AI 是否真正聪明,我们需要停止使用静态、公开的测试,转而使用动态的、更难预测的挑战。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。