Beyond Coverage: An Empirical Study of Mutation-Score Proxies for Deep Neural Network Testing
本文通过实证研究表明,尽管传统的和非结构化的测试充分性指标与变异分数之间表现出弱相关或无相关性,但潜空间类离散度(LSCD)相比于基于马哈拉诺比斯距离的惊喜覆盖度(Surprise Coverage),在评估深度神经网络测试数据集质量方面,是一个显著更强且计算效率更高的代理指标。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能的世界里,深度神经网络充当着从自动驾驶汽车到医疗诊断工具等一切事物背后的“大脑”。这些系统通过学习海量的示例库(例如数百万张照片)来进行学习,直到它们能够自主识别模式并做出预测。然而,就像一个只针对特定考试进行学习的学生一样,当面对从未见过的场景时,人工智能可能会遭遇惨痛的失败。为了确保这些系统的安全性和可靠性,工程师必须使用高质量的数据对其进行测试,这些数据不仅要涵盖常见场景,还要涵盖被称为“极端情况”(corner cases)的罕见且棘手的状况。挑战在于,如何知道哪些测试数据才是真正优质的。传统上,研究人员试图通过计算AI内部有多少个部件被激活,或者检查一张新图像相对于机器已学习内容的“惊奇程度”来衡量这一点。然而,目前还没有确凿的证据表明这些标准测量方法能真正预测测试集是否能发现系统中的隐藏错误。
为了解决这个问题,来自慕尼黑工业大学和英飞凌科技(Infinevin Technologies)的研究小组致力于寻找一种更好的判断测试数据的方法。他们以被称为“变异得分”(mutation score)的金标准作为质量基准。想象一下,你拿出一个正在运行的AI,并在其训练过程中故意引入微小的、真实的错误,从而创造出一些略微损坏的原型版本。一个高质量的测试集应该能够成功识别出这些错误,从而揭示该AI已不再正常工作。这种方法极其准确,但也极其昂贵且缓慢,因为它需要为了创建这些损坏的版本而对AI进行数百次重新训练。研究人员希望找到一种更快、更便宜的方法来获得同样的结果。他们将各种现有的测量工具与这一金标准进行了对比,测试了涵盖从简单的手写数字到复杂的交通标志及多样化物体的四种不同图像数据集。
研究首先对最常用的工具进行了测试。这些方法包括统计AI内部神经元触发数量的方法,以及测量新图像在数学空间中距离训练数据有多远的方法。结果是明确且令人失望的。那些统计内部激活情况的方法与变异得分之间没有表现出真正的联系;它们无法区分一个好的测试集和一个坏的测试集。同样,基于简单距离或概率来衡量“惊奇度”的工具,在发现故障的能力方面也仅表现出微弱的联系。简而言之,传统的检查测试质量的方法并不能可靠地预测AI是否会在其损坏版本中发现错误。
随后,研究人员将注意力转向了一种不同的方法:观察测试图像在AI对世界的内部理解中是如何分布的。他们比较了两种特定的测量分布方式。一种被称为“基于马氏距离的惊奇覆盖度”(Mahalanobis Distance-based Surprise Coverage)的方法,试图考虑数据簇的形状和方向,这是一种需要大量存储空间的复杂计算。另一种则是他们开发的新指标——“潜空间类别离散度”(Latent Space Class Dispersion),它仅仅测量测试图像与其各自组中心之间的距离,而不必担心数据的复杂形状。研究结果令人瞩目。这种更简单的、新的指标与变异得分表现出了极强的相关性。它能够比他们尝试过的任何其他方法更准确地预测测试集发现故障的能力。
除了准确性之外,研究还考察了速度。研究人员测量了在数百个不同的AI模型和数据集上计算每种指标所需的时间。传统的结构化方法由于需要查看AI的内部代码,因此速度较慢,对于复杂模型尤其如此。旧有的“惊奇度”方法甚至更慢,在处理大型数据集时有时需要运行数天。相比之下,这种新的离散度指标速度极快。在处理最复杂的数据集时,它完成计算仅需不到一小时,这大约是现有最佳结构化方法的十倍,也是最快的传统惊奇度方法的近八十倍。由于不需要存储复杂的数据统计图谱,它所需的计算机内存也更少。
为了确保结果不会受到不良数据的干扰,团队还检查了他们生成的“极端情况”的质量。这些图像是由计算机程序自动生成的,通过应用诸如雾气、模糊或噪声等现实变化来寻找棘手情况。通过使用自动验证器,他们确认了超过99%的生成图像在人类眼中仍是可识别的,这证明了这些困难的测试数据是真实的,而非随机噪声。这种验证使他们确信,他们发现的新指标与变运算符得分之间的强关联性是真实可靠的。
论文总结道,虽然旧的测量测试质量的方法仍有其用途,但它们并不是预测测试集能否捕捉到真实故障的可靠指标。这种新的指标——即简单地测量测试数据在AI学习到的类别周围的扩散程度——提供了一个强大的替代方案。它快速、易于计算,并且与发现错误的能力具有强相关性。这表明,工程师现在可以评估其测试数据的质量,而无需承担生成和测试数百个损坏AI模型的巨大成本。通过使用这种更简单的测量方法,他们可以确保其系统具有鲁棒性并能应对现实世界,在保持高安全标准的同时节省时间和资源。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。