Detecting Backdoors in Object Detection via Pre-NMS Prediction Distribution Shift
该论文介绍了 DistScan,这是一个针对目标检测模型的后门检测框架,它通过测量干净输入在非 NMS(非极大值抑制)预测中的类别分布偏差来识别场景级攻击,在不需要触发器知识或模型访问权限的情况下,实现了比现有方法显著更高的准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代世界中,摄像头与计算机协同工作以观察物理世界。它们实时识别汽车、行人及标志,这项技术正引导着自动驾驶车辆并监控公共安全。这些系统依赖于经过训练以识别特定目标的人工智能模型。然而,这些模型在投入使用之前就可能被秘密破坏。恶意行为者可以污染训练过程,隐藏一个触发器,使得模型在看到特定模式(如一个小贴纸或某种特定颜色)时表现异常。在正常日子里,系统运行完美,但一旦隐藏的触发器出现,它可能会无法识别行人,或者在不存在物体的地方凭空创造出一个虚假物体。这就是后门攻击。其危险之处在于,直到触发器出现之前,模型看起来和表现得都完全正常,这使得通过标准测试几乎无法发现它。
研究人员长期以来一直致力于寻找这些隐藏缺陷,尤其是在同时检测多个目标的复杂系统中。现有的方法通常试图逆向工程隐藏的触发器,或者寻找软件构建过程中的特定异常,但当攻击影响的是整个场景而非仅仅是一个物体时,这些方法往往会失效。一项新研究引入了一种不同的观察视角。研究人员不再去搜寻隐藏的触发器本身,而是检查模型的内部习惯。他们发现,当一个模型被秘密投毒时,即使在观察完全干净且没有触发器的图像时,其内部预测也会发生背离其训练特征的偏移。
由王龙天(Longtian Wang)和赵振宇(Zhengyu Zhao)领导的团队开发了一种名为 DistScan 的方法来捕捉这些受损的模型。他们的方法基于对这些计算机视觉系统学习方式的一个简单观察。当一个模型在大量图像上进行训练时,它不仅学习物体长什么样,还学习每个物体出现的频率有多高。如果一个数据集中有很多汽车的照片而自行车很少,模型自然会预期看到更多的汽车。这种预期成为了模型内部逻辑的一部分。研究人员发现,当攻击者注入后门时,这种内部平衡会被打破。即使在观察正常的、安全的图像时,模型也会开始预测某些物体出现的频率高于或低于应有的水平。
为了测试这一点,研究人员不需要知道隐藏触发器的样子,也不需要看到原始训练数据或访问模型的内部代码。他们只需将少量的干净图像输入模型,并观察模型在做出最终决策前的预测情况。他们统计了模型猜测每种物体类型的次数。在健康的模型中,这些猜测与现实世界中发现物体的自然频率相匹配。而在被投毒的模型中,猜测会发生偏差,显示出一种不属于原有的明显失衡。通过将模型的预测与已知训练数据的统计数据进行对比,该系统如果发现数字对不上,就能将该模型标记为危险。
研究人员在两种主要的检测系统类型以及科学家们广泛使用的两个大型标准数据集上测试了这种方法。他们创建了数百个模型,其中一些是干净的,另一些则被三种不同类型的攻击进行了秘密投毒。这些攻击包括让物体消失的诡计、让模型看到不存在之物的诡计,以及改变物体名称的诡计。新的方法 DistScan 成功识别了这些被投毒的模型,平均准确率接近 97%。相比之下,现有的最佳方法在许多此类场景下完全失效,表现往往并不比随机猜测好多少。研究表明,DistScan 在不同类型的模型架构上同样有效,证明了预测模式的偏移是后门攻击的一种普遍特征。
其中一个最重要的发现是,即使攻击旨在避开传统的检测工具,该方法依然有效。一些现代攻击是“场景级”的,这意味着单个隐藏触发器会导致模型在整个图像范围内表现异常,从而影响它看到的每一个物体。之前的工具在此类场景下会失败,因为它们是为寻找影响单个物体的局部触发器而设计的。DistScan 之所以成功,是因为它观察的是大局:即模型认为它所见之物的整体分布。研究人员将这些差异可视化,发现被投毒模型的预测形成了一个远离健康模型预测的独特簇,产生了一个易于测量的清晰分离。
研究还探讨了如何通过调整图像呈现方式来使测试最有效。他们发现,对于某些类型的系统,输入完整的图像效果最好;而对于另一些系统,展示单个物体的裁剪图像则更可靠。这确保了测试方式与模型最初学习观察世界的方式相匹配。他们还确定了过滤掉微弱猜测的合适置信度水平,以确保只统计有意义的预测。通过这些精细的调整,该方法在所有测试场景中都保持了稳健性和准确性。
这项工作为任何需要在投入使用前验证目标检测系统安全性的人员提供了一个实用的工具。它不需要特殊的专业知识,不需要访问模型的内部权重,也不需要额外的训练时间。通过简单地检查模型的内部预期是否与它所接受训练的数据现实相符,DistScan 提供了一种可靠的方法来发现隐藏的危险。研究人员希望这种方法能将安全研究的重心转向这些分布信号,为应对日益增长的后门攻击威胁(特别是在安全至上的应用领域)提供一种更广泛且更具原则性的防御手段。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。