Capacity Overflow: A Blind Spot for Backdoor Attacks in Vision MoE
本文识别了一种针对视觉混合专家(MoE)模型的创新供应链后门攻击,该攻击利用批次相关的容量溢出,在小批量安全审计期间保持休眠状态,而在大规模部署期间激活高成功率的攻击,从而有效地规避现有的检测方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能的世界中,计算机通过处理庞大的数字网络来学习如何“看”图像。这些网络通常构建得像工厂车间一样,其中不同的专业化单元(被称为“专家”)负责处理特定部分的任务。为了使这些系统快速且高效,工程师们使用了一种方法:计算机仅将每条信息发送给最适合处理它的专家,从而让其他专家处于闲置状态。这种被称为“混合专家模型”(Mixture of Experts)的方法,使得模型能够变得极其庞大且功能强大,却不会降低运行速度。然而,这种效率依赖于一条严格的规则:每个专家一次只能处理一定数量的项目。如果同时到达的项目过多,系统必须丢弃其中的一些,以保持平稳运行。这条规则旨在防止计算机崩溃,但也创造了一个安全研究人员才刚刚开始理解的隐藏漏洞。
一组研究人员发现,这种用于管理工作负载的规则本身就可以被转化为恶意攻击的秘密开关。他们展示了用于视觉任务(例如识别自动驾驶汽车的交通标志)的计算机模型是如何被植入一个隐藏陷阱的。这个陷阱在模型于正常、低压条件下进行测试时是完全隐形的。然而,一旦模型在需要同时处理大量图像的繁忙现实场景中投入工作,陷阱就会被触发。研究人员将此称为“容量溢出”(Capacity Overflow)攻击。这是一种隐蔽的破坏手段,它利用了模型应对压力的方式,在安全检查期间保持休眠,仅在系统高负荷运行时激活。
这种攻击利用了模型的内部流量控制机制。在标准设置中,当一批图像被发送到模型时,一个路由器会决定哪个专家处理每张图像。为了确保系统不会过载,每个专家处理图像的数量都有一个上限。如果批处理量较小,每张图像都会得到处理,模型表现正常。但如果批处理量很大,专家会达到极限,系统被迫丢弃多余的图像,直接将它们发送到最终输出,而不进行进一步分析。研究人员发现,他们可以训练模型将这种丢弃机制作为触发器。他们在网络的早期层注入了一条隐藏指令,导致模型犯错,例如将停止标志误认为限速标志。为了隐藏这条指令,他们在模型内部添加了第二层防御,即一个“中和器”,用于在系统正常运行时抵消掉这个错误。
这种攻击的精妙之处在于它操纵了中和器发挥作用的条件。中和器经过训练,仅在批处理中的每一张图像都被处理时才发挥作用。如果批处理量很小,中和器能看到所有图像,执行其任务,模型保持安全。然而,如果批处理量很大,系统就会触及容量限制并开始丢弃图像。由于中和器未针对信息缺失的情况进行训练,它无法抵消隐藏的指令。结果是,模型会突然开始做出恶意的错误判断,但这种情况仅发生在处理大量图像的同时。这创造了一种场景:安全审计员在使用小批量图像测试模型时,看到的是一个完美的安全系统;而处理持续交通流的城市中的自动驾驶汽车,则会被诱导产生危险行为。
为了证明这是可能的,研究人员在两个不同类型的视觉模型上使用标准图像数据集测试了他们的方法。他们成功创建了能够在批处理量大时,以 76% 到 87% 的成功率被触发进行错误分类的模型。相比之下,当相同的模型使用小批量进行测试时,攻击几乎完全失效,成功率低于 9%。这些模型也保持了正确识别正常图像的能力,这意味着攻击并没有以一种会暴露身份的方式降低系统的整体性能。研究人员表明,这种攻击可以绕过现有的几种旨在寻找隐藏陷阱的安全工具,因为这些工具通常只在低负载条件下测试模型,而此时陷阱处于非活跃状态。
这一发现揭示了我们在保护人工智能方面的一个根本性盲点。目前的安全性检查通常假设模型的行为在处理一张图像或一千张图像时是一致的。研究人员发现,对于这类特定的模型,这一假设是错误的。系统的行为取决于负载,而这种变化是可以被武器化的。这种攻击不需要任何特殊的硬件或复杂的外部信号;它仅仅依赖于系统在现实世界部署时自然发生的流量增加。通过在高速运行期间配置模型以降低其容量限制,攻击者可以确保中和器失效,从而让恶意行为接管。
这一发现的影响是重大的,对于任何依赖大规模视觉模型的行业(尤其是自动驾驶领域)而言皆是如此。一辆自动驾驶汽车可能在实验室通过了每一项安全检查(因为实验室每次只测试几张图像),但在必须处理快速视觉数据的高速公路上却可能发生灾难性的失败。研究人员建议,安全评估需要发生改变,以反映这些现实世界的条件。审计必须在重负载和变化的批处理大小下测试模型,以确保系统在实际使用时依然安全。如果不进行这些改变,那些旨在让这些模型更高效、更具扩展性的机制,可能会成为它们安全链中最薄弱的一环,导致隐藏的威胁在为时已晚之前都无法被察觉。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。