Certifying Compressed Language Models: An Audit and a Statistical Toolkit
本文批判了当前在将压缩语言模型认证为与其原模型等效时对净准确度增量(net accuracy deltas)的依赖,揭示了此类指标掩盖了显著的项目级差异,并提出了一套严谨的统计工具包,其特征在于采用带有声明边际的配对等效性检验以及逐项输出发布,以确保证据的充分性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,大型语言模型是驱动从写作助手到复杂推理工具等一切应用的核心引擎。这些引擎规模宏大,通常需要庞大的计算机才能运行。为了让它们能在笔记本电脑或手机等日常设备上使用,研究人员使用了一种称为“压缩”的过程。这类似于将一个沉重的行李箱缩小以放入登机箱中。其目标是在不损失回答问题能力的前提下,使模型变得更小、更快。多年来,证明压缩模型成功的标准方法是观察其在测试中的总体得分。如果压缩版本的得分与原始版本几乎相同,那么结论便是两者实际上是等同的,任何质量上的损失都是微不足道的。
佐治亚理工学院的一位研究人员对这一长期存在的做法提出了挑战。他们认为,仅仅观察最终得分就像仅凭最高时速来评判汽车性能一样,忽略了刹车是否有效或引擎是否熄火。他们的研究表明,两个模型的总体得分可能几乎完全一致,但在处理单个问题时的表现却可能截然不同。通过深入研究这些模型如何回答特定项目,该研究人员发现,通常用来证明“近乎完美”压缩的证据往往过于薄弱,不足以支持所做的声明。他们提出了一套新的、更严格的报告标准,要求研究人员必须逐项展示其工作过程,并提前声明他们愿意接受多少误差。
研究人员首先通过检查大量的公开测试结果,观察了超过 1,700 对模型和任务。他们发现了一个隐藏的模式:虽然压缩模型的总体得分通常与原始模型非常接近,但单个答案却经常出现分歧。在许多情况下,压缩模型答对了原始模型答错的问题,反之亦然。这些相反的变化在最终平均值中相互抵消,创造了一个看起来完美的净得分。然而,底层的行为实际上已经发生了显著变化。研究人员发现,单个答案从正确变为错误的变化率,大约是最终得分微小差异的五倍。这意味着,当一份报告称一个模型是“等效”时,它可能只是在一个微小的净数值背后隐藏了大量的内部波动。
为了观察在比较两种不同的压缩方法本身(而非与原始模型相比)时,这个问题是否会更加严重,研究人员进行了一项受控实验。他们将两种流行的压缩技术应用于相同的模型,并使用相同的设置,通过在起始数据上进行轻微变化的多次运行来执行测试。在八个特定测试案例中的五个案例中,胜者会根据所使用的变量而改变。有时一种方法更好,有时则是另一种。这表明,两个压缩模型之间的选择往往是不稳定的,甚至会被计算机计算中的随机种子这类微小因素所逆转。证据在从业者最需要做出选择的地方——即决定使用哪个压缩版本时——显得最为薄弱。
研究人员随后审计了近期 17 项科学论文、官方模型卡片及供应商文档中的声明,这些声明均声称其压缩模型与原始模型等效。他们发现,这些声明中没有一个在测试开始前声明过具体的数值误差范围。相反,它们只是在事后报告结果。此外,这些来源都没有发布进行外部验证所需的详细的、逐项的答案。如果没有这些个体输出,就无法检查这些模型是否真正可以互换,或者这些结果是否仅仅是统计上的偶然现象。有五个声明由于缺乏样本量或基准得分等基本信息而无法被评估。审计结论指出,该领域目前缺乏验证其自身最重要的断言所需的工具。
为了解决这个问题,研究人员提出了一个由五个清晰步骤组成的全新报告标准。首先,作者必须在运行任何测试之前声明一个特定的误差范围,明确说明他们认为多少差异是可以接受的。其次,他们必须进行配对统计检验,在相同的具体问题上对模型进行比较。第三,他们不仅要报告最终得分的差异,还要报告单个答案发生变化的速率,研究人员称之为“波动率”(churn)。第四,他们必须证明自己测试了足够多的项目,以得出可靠的结论,并使用研究人员创建的一套新表格,根据观察到的波动率来计算必要的样本量。最后,他们必须发布每个问题的个体答案,以便任何人都可以核查计算过程。
研究人员强调,他们的发现并非证明任何特定的压缩模型是有缺陷的,也不是说审计论文的作者是错误的。相反,他们表明目前提供的证据不足以证明等效性。一个模型可能是完全正常的,但如果没有正确的数据类型和预先声明的标准,就无法确定。新标准将重点从单纯报告一个数字转向提供一份可验证的质量证书。通过要求透明度和严谨的规划,该领域可以从发布模糊的“性能损耗极小”的承诺,转向提供压缩模型确实已准备好投入使用的具体证明。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。