LLM Benchmark Datasets Should Be Contamination-Resistant
本文主张,必须重新设计大语言模型基准数据集,使其具备抗污染能力——即利用架构不对称性和数学进展,确保在训练过程中无法被学习但在推理过程中仍可求解,从而保障模型评估的可靠性与可复现性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和创意类比对这篇论文的解释。
问题:期末考试作弊
想象你是一位老师,试图测试学生的聪明程度。你给他们安排了一场期末考试。但 unbeknownst 你(即你并不知情),学生们已经背下了考试问题的确切答案,因为这些题目意外地包含在他们的学习教科书(即“预训练数据”)中。
当学生们参加考试时,他们得了满分。但你无法判断他们究竟是真的很聪明,还是仅仅记住了考试本身。这就是基准污染问题。在人工智能领域,“基准”是用来衡量大语言模型(LLM)表现好坏的测试。由于这些测试是公开的,AI 开发者经常(有意或无意地)将测试题目输入到 AI 的训练数据中。于是,AI 通过死记硬背答案而不是学习如何解决问题来“作弊”。
提出的解决方案:“魔法信封”
这篇论文的作者提出了一种向 AI 模型进行测试的新方法,使其无法作弊。他们称之为抗污染数据集(CRDs)。
将标准基准想象成一张打印好的试卷。如果你把这张试卷给 AI,它可以阅读试卷,背下题目,并将其存入“大脑”中。
作者建议将测试改造成一个魔法信封。
- 对于 AI(推理): AI 可以打开信封,看到“答案密钥”(即解决问题所需的逻辑),而无需看到实际的题目文本。它仍然可以参加考试并获得分数。
- 对于 AI 的“大脑”(训练): 如果 AI 试图研究信封的内容以为未来的考试做准备,它会发现没有任何有用的东西。信封中的“题目”部分已被打乱成一种 AI 无法阅读或记忆的代码。这就像试图通过阅读一本用你不懂的语言写成的字典来学习一门语言。
魔法是如何运作的?(不对称性)
这篇论文依赖于现代 AI 模型(称为 Transformer)工作方式中的一个特定怪癖。作者指出了 AI 架构中的一条“单行道”:
- 训练(学习): 为了学习,AI 需要从头到尾看到整个“故事”。它需要题目的原始文本才能理解上下文。
- 推理(参加考试): 为了回答问题,AI 不需要再次看到整个故事。它只需要特定的上下文“快照”(称为KV 缓存)以及答案之前的最终思维状态(即倒数第二个状态)。
作者提议以这种“快照”格式发布测试数据。
- 类比: 想象一部电影。要学习剧情,你需要观看整部电影。但要预测下一个场景,你只需要知道最后几帧和当前的情绪。作者说:“让我们只给 AI 最后几帧和情绪。它可以预测下一个场景(参加考试),但它无法重看整部电影来背诵剧情(从测试中学习)。”
魔法信封的三条规则
为了使该系统生效,新的测试数据必须遵循三条规则:
- 不可逆性(锁): 你必须能够将信封锁得如此紧密,以至于无人能将其强行打开以查看原始题目。即使他们试图逆向工程代码,这也应该太难或成本太高而无法实现。
- 等价性(公平性): AI 在“魔法信封”测试中获得的分数必须与在原始纸质测试中获得的分数相同。如果信封使测试变得太难或太容易,结果就毫无用处。
- 互操作性(通用适配器): 不同的 AI 模型使用不同的“语言”(它们具有不同的内部结构)。该系统需要一种方法,将“魔法信封”从一个模型的语言翻译成另一个模型的语言,以便每个人都能参加同一场测试,而无需为每个单独的 AI 准备独特的版本。
我们如何在模型之间进行翻译?
由于不同的 AI 模型构建方式不同,作者提出了两种翻译这些“魔法信封”的方法:
- “锚点”方法(短期): 选择一个流行的 AI 模型作为“标准翻译器”。所有人首先将测试数据转换为该模型的语言。然后,其他模型使用数学“适配器”将该标准语言翻译成自己的语言。
- “相对”方法(长期): 不使用一个模型作为标准,而是使用一组通用的“路标”(如指南针)。你根据这些路标测量测试数据的位置。这将创建一个通用的坐标系,任何模型无论其内部设计如何都能理解。
缺点是什么?
论文承认存在一些障碍:
- 存储: 这些“魔法信封”(快照)比纯文本占用更多的计算机存储空间。然而,作者表明,通过压缩数据(如压缩文件),存储成本变得可控。
- 复杂性: 这仅适用于基于"Transformer"架构构建的模型(大多数当前的 AI 都使用此架构)。它不适用于旧式或完全不同类型的 AI。
- 信任: 由于测试题目被隐藏,研究人员无法阅读它们以验证其公平性。论文建议使用“验证协议”(如检查 AI 的行为是否一致)来建立信任。
结论
这篇论文认为,我们需要停止试图隐藏测试题目(这是不可能的,因为互联网会复制一切),并开始改变我们发布测试的方式。通过以允许 AI参加考试但阻止其研习考题的格式发布数据,我们可以获得对这些模型真实聪明程度的准确衡量。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。