CleanScore: Black-Box Benchmark Audits with Negative Controls and Sensitivity Bounds
CleanScore 是一个采用负控制和敏感性边界的黑盒审计框架,用于区分真正的模型技能与先前的训练数据暴露,它揭示了标准的基于改写(paraphrase)的审计会显著低估训练数据污染的影响,同时证明了公共基准测试中的表面形式膨胀(surface-form inflation)是极小的。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在构建更智能机器的竞赛中,研究人员依赖标准测试来衡量人工智能解决问题的能力。这些测试就像学校考试:一套带有已知答案的问题,模型必须解决这些问题才能获得分数。分数越高,该机器被认为就越强大。然而,阴影已经笼罩了这些结果。由于这些测试发布在网上,问题和答案通常在机器学习的互联网上是公开可见的。人们日益担心,高分并不总是证明机器很聪明;它可能仅仅证明机器在训练期间记住了测试题。如果机器之前见过完全相同的问题,其分数就会被虚报,不同模型的排名就会变成一场记忆力的竞赛,而非推理能力的竞赛。
这为任何试图公平评判这些机器的人制造了一个难题。大多数强大的模型都是“黑盒”,这意味着它们的内部训练数据是保密的。审计员无法直接观察机器内部,以查看它是否记住了某个特定问题。他们只能看到最终得分。多年来,检查记忆化程度的最佳方法是重写问题。如果一台机器真正理解了问题背后的数学或科学原理,它应该能像解决原始版本一样出色地解决改写后的版本。如果它在改写版本上失败了,那么它很可能只是记住了原始版本。但这种方法有一个隐藏的缺陷:它假设如果机器答对了改写后的问题,就说明它理解了概念。如果机器仅仅因为记住了答案解析而答对了改写后的问题,那么测试就无法捕捉到这种记忆化行为。
一个研究小组致力于开发一种更好的方法,在无需查看黑盒内部的情况下审计这些分数。他们开发了一种名为 CleanScore 的方法,该方法将每个测试问题视为一个拥有三个孩子的“父母”:原始的公开问题,以及两个保留了相同数字和事实但使用了不同措辞的新编写版本。研究人员要求五个不同的开源模型解决来自两个主要基准测试(一个侧重于数学,另一个侧重于科学)的 200 个问题。对于每个问题,他们比较了模型在原始公开版本与两个新鲜编写版本上的表现。如果模型在公开版本上的得分始终更高,则表明它们记住了测试内容。
审计发现没有证据表明存在这种记忆化现象。在所有五个模型和两个基准测试中,公开问题的得分并不显著高于新鲜编写的问题得分。研究人员计算出,由于看到公开措辞而获得的任何优势可能都小于五个百分点。即使在团队修复了一个初始设置中的技术错误(即某些模型在完成回答前被截断)后,这一结果依然成立。该研究还包括了一个“负对照组”,即模型从未见过且不可能通过记忆获取的一组问题,以确保重写过程本身没有使问题变得更难或更容易。结果显示,重写过程是公平的,且得分差距的缺失是一个真实的发现,而非测试设计的产物。
然而,这项研究中最引人注目的部分来自于一系列旨在观察审计会遗漏什么的实验。研究人员刻意针对 100 个测试问题的精确措辞对四种不同的模型进行了训练。随后,他们运行了相同的审计程序,以观察是否能捕捉到这种记忆化。在数学基准测试中,那些记住了问题的模型在记忆措辞下的准确率提高了 26 个百分点。但是,当测试那些相同问题的崭新编写版本时,它们的准确率也提高了 20 个百分点。审计程序——即仅观察原始版本与改写版本之间的差异——检测到的差距仅约为 6 个百分点。换句话说,审计仅检测到了极小部分的记忆化。绝大部分的优势——即来自于理解问题而非仅仅记住文字的部分——对测试而言是不可见的。
这种盲目性在科学基准测试中更为极端。在一项实验中,研究人员针对 100 个科学问题训练了一个模型,然后测试了其改写版本。该模型在记忆的问题上准确率提升了 49 个百分点。由于改写版本保持了多项选择题的选项完全一致,该模型通过识别它所记忆的正确字符串,在改写问题上也取得了完美表现。审计计算出的差距为负 2 个百分点,实际上并未察觉到任何记忆化。模型学习了答案,但由于测试设计保留了固定的选项,这种知识得以隐匿在众目睽睽之下。
研究人员得出结论,虽然他们的方法成功测量了模型是否依赖于问题的特定表面措辞,但它无法测量记忆化的总量。一个模型可能在某个数据集上经过了大量训练,但如果测试问题在保留核心答案的方式上进行了改写,它看起来仍会是“干净”的。研究表明,对于他们审计的这五个模型而言,没有强有力的证据表明它们记住了测试问题的特定措辞。但也证明了,“干净”的分数并不能保证模型没有接触过相关材料;它只能保证模型没有依赖于精确的措辞。审计成功界定了表面层面的通胀,但它无法排除模型以一种能够经受住改写过程的方式学习了相关材料的可能性。
该研究还强调了审计规模之小的局限性。研究人员发现,为了可靠地检测出显著的优势,审计需要测试至少 200 个问题。如果问题数量较少,统计上的不确定性就会非常大,以至于测试无法区分真实优势与随机噪声。他们还表明,虽然使用较少的问题问题进行正确排序是可能的,但要确定性能的具体顺序则需要更大的样本量。这项工作作为一个严谨的、已注册的实验,为如何讨论 AI 测试中的不确定性树立了新标准。它并未宣布这些模型在所有记忆化方面都是清白的,但它提供了一个关于在仅能获取最终得分的情况下,数据所能展示及不能展示的内容的清晰且诚实的陈述。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。