How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework
本文介绍了 ArxivRoll,这是一个受一次性密码本加密启发的动态评估框架,它利用基于近期 ArXiv 论文生成的半年度自动化基准,以量化并缓解由数据污染和训练偏差导致的语言模型高估问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗语言和日常类比对论文《大型语言模型在评估中作弊的程度有多大?》的解释。
核心问题:“开卷考试”
想象你是一位老师,试图测试学生的聪明程度。你给他们一份标准的数学试卷。但是,学生们偷偷从网上找到了一份包含该特定试卷答案的复习指南,并背了下来。
当他们参加测试时,在那些背下来的题目上得了满分。但如果你问他们一道新的、从未见过的数学题,他们可能会不及格。
这正是大型语言模型(LLMs)(就像你正在对话的 AI)所发生的情况。
- 作弊行为:许多 AI 模型是在包含流行测试(基准测试)答案的数据上进行训练的,这些测试用于衡量它们的智能。
- 结果:它们实际上并没有在“学习”或“推理”;它们只是在复述以前见过的答案。这使它们看起来比实际更聪明,导致不同 AI 公司之间的比较变得不公平。
解决方案:ArxivRoll(“一次性密码本”测试)
来自香港理工大学的研究人员创建了一个名为ArxivRoll的新系统来揪出这些作弊者。他们的灵感来自密码学中的一个概念,即**“一次性密码本”**。
类比:一次性秘密密钥
在密码学中,“一次性密码本”是用于加密消息的秘密密钥。规则是:使用一次,然后丢弃。 如果你使用同一个密钥两次,秘密就会泄露。
ArxivRoll 将这一规则应用于测试:
- 新鲜素材:他们不再使用旧的、静态的测试题,而是利用ArXiv(科学家发布最新未发表工作的网站)上的全新研究论文,每六个月生成新的测试。
- “未见”测试:因为这些论文非常新,没有任何 AI 在训练过程中见过它们。这就像给学生出一份基于昨天刚印刷的书籍的试卷。
- 用完即弃:测试结束后,答案会公开以便大家核查,但具体的测试题目会被标记为“已过期”,永不再用。这确保了未来的 AI 无法背下它们。
测试如何运作:“填空题”游戏
为了自动生成这些测试(无需人类撰写成千上万道题目),他们使用了一种称为SCP(排序、完形填空和预测)的方法。这可以看作是高级版的“疯狂填词”或拼图游戏:
- 排序(Sequencing):AI 会收到一段打乱顺序的段落,就像一副洗乱的牌。它必须将句子按正确顺序排列。
- 完形填空(Cloze):AI 会收到一段缺失了一些句子的段落(被遮盖)。它必须从选项列表中选出正确的句子来填补空白。
- 预测(Prediction):AI 阅读一个故事,然后必须猜出下一句话是什么,从四个不同的选项中进行选择。
由于这些问题是从新鲜文本中随机生成的,AI 无法仅仅“记忆”模式;它必须真正理解逻辑。
成绩单:“抗干扰分数”
这篇论文提出了一种评估这些模型的新方法,称为抗干扰分数(Rugged Scores, RS)。想象你在评判一名跑步者:
- 公开分数:他们在练习过的跑道上跑得多快(旧的、被污染的测试)。
- 私有分数:他们在一条全新的、未知的山路上跑得多快(ArxivRoll 测试)。
抗干扰分数衡量的是这两者之间的差距。
- 低抗干扰分数:跑步者在两条跑道上的表现相似。他们确实身体素质很好。
- 高抗干扰分数:跑步者在练习跑道上跑得飞快,但在新山路上却跑得慢。这意味着他们通过记忆练习跑道在“作弊”。
他们的发现
研究人员使用这个新系统测试了许多流行的 AI 模型(如 Llama、Qwen、GPT 和 Claude)。
- “高估”是真实的:许多在公开排行榜上看起来像天才的模型,在新鲜、私有的 ArxivRoll 测试中排名显著下降。
- 部分模型“过度训练”:他们发现,有些模型是专门针对特定类型的问题(如数学或金融)进行微调以取得高分的,但在其他问题上却惨败。这就像一个只复习了历史期末考试的学生,却在科学测验中不及格。
- 差距巨大:对于某些模型,其“公开分数”和“私有分数”之间的差异非常巨大,证明其报告的智能中很大一部分实际上只是记忆。
总结
该论文认为,我们一直被 AI 基准测试所误导。通过使用一个不断用全新的、未见过的研究(ArxivRoll)刷新其问题的系统,并衡量新旧测试之间的差距(抗干扰分数),他们可以看出 AI 的“智能”有多少是真实的,有多少只是作弊。这是一种确保当我们说 AI 很聪明时,它确实是聪明的,而不仅仅是擅长记忆测试题的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。