RMF: A Risk Measurement Framework for Machine Learning Models
本文提出并评估了一种用于评估自动驾驶汽车中机器学习模型安全性的风险测量框架(RMF),该框架利用基于 ISO/IEC 27004:2016 的风险指标,通过四个不同的数值而非单一风险指标来衡量潜在损害和攻击者成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
技术摘要:RMF:机器学习模型的风险度量框架
问题陈述
机器学习(ML)模型,特别是深度学习系统,正越来越多地应用于自动驾驶和医疗诊断等安全及保障关键型应用中。这种普及引入了来自对抗性机器学习的显著风险,即神经网络(NN)可能受到恶意影响。具体而言,本文探讨了量化投毒攻击(后门攻击的一个子集)所带来的风险挑战,这类攻击会导致神经网络在推理阶段发生图像标签误分类。虽然这些威胁的存在已得到充分证实,但目前仍缺乏标准化的方法来衡量攻击造成的损害程度以及执行攻击所需的成本/努力(effort)。作者认为,如果没有这些度量手段,很难客观地评估机器学习系统的安全性表现或得出有意义的风险值。
方法论
本文提出了一个基于 ISO/IEC 27004:2016 信息安全风险度量标准的风险度量框架(RMF)。该方法遵循一个结构化流程:
属性定义: 框架定义了用于衡量风险的具体属性,并将其分为两大类:
- 攻击者努力程度(Attacker's Effort): 包括攻击者知识(白盒 vs 黑盒)、攻击者目标(实现目标的步骤)、攻击特异性(针对特定标签或随机标签的步骤)、攻击时间(训练和推理时长)以及计算资源(CPU/GPU 使用情况)。
- 损害程度(Extent of Damage): 使用标准的机器学习指标进行衡量,包括准确率(Accuracy)、F1 分数(F1-Score)、平均精度(Average Precision)和平均召回率(Average Recall)。
度量过程:
- 数据收集: 框架利用**对抗性鲁棒性工具箱(ART)**对目标神经网络执行后门攻击。
- 基础度量(Base Measures): 系统在攻击过程中记录原始数据,如训练时间、硬件资源消耗以及攻击者采取的程序步骤总数。
- 派生度量(Derived Measures): 度量函数对这些基础度量进行聚合。
- 损害计算: 为了量化损害,框架会对机器学习指标进行反转(例如,如果准确率降至 0.06,则将其转换为 0.94)。这种反转确保了较低的原始指标(即更高的损害)会产生较高的损害得分。这些反转后的数值随后被整合以形成一个综合的“损害程度”。
- 努力程度计算: 框架通过聚合攻击时间、计算资源和总步骤数(源自知识、目标和特异性)来形成一个综合的“攻击者努力程度”。
风险解释: 框架并未将损害与努力程度合并为一个单一的标量风险值。相反,它将它们视为四个不同的值(损害、时间、资源、步骤),必须分别进行解释。作者指出,由于单位的多样性(秒、MB、自然数)以及缺乏不同攻击类型的可比基准数据,目前实现努力程度的标准化尚是不可能的。
案例研究与结果
该框架通过一个涉及使用 133,000 张德国路标(70 个标签)训练的卷积神经网络(CNN)的案例研究进行了评估。
- 设置: 执行了一次洁净标签(clean-label)后门攻击,通过对 50% 的训练数据进行投毒,使图像被误分类为特定的目标标签(标签 10)。
- 硬件: 实验在 AMD Ryzen 7 5800X CPU 和 NVIDIA GeForce RTX 3060 Ti GPU 上运行。
- 发现:
- 损害: 攻击导致性能大幅下降。原始准确率从 0.94 降至 0.06。计算出的综合“损害程度”为 4.62。
- 努力程度: 攻击共需 21 个总步骤(结合了知识、目标和特异性),执行耗时 1037.23 秒,并消耗了 9% 的 CPU 和 8137.81 MB 的 GPU 显存。
- 风险分类: 根据欧洲电信标准协会(ETSI)的风险分类,结果被归类为关键风险(Critical Risk)。由于缺乏应对措施,攻击者能以相对较低的努力程度造成最大程度的损害。
核心贡献
本文做出了三个主要贡献:
- 属性提议: 提出了用于机器学习安全度量方法中的定量和定性属性集(包括计算资源和特定的攻击步骤)。
- 度量函数: 开发了用于计算代表损害程度和攻击者努力程度的具体函数,并遵循 ISO/IEC 27004:2016 指南。
- 评估与解释: 通过案例研究对这些计算值进行了评估,展示了如何在不提出具体应对措施的情况下解释最终的攻击风险。
意义与主张
作者将这项工作定位为一种提高安全性表现的工具,通过在神经网络部署前的开发阶段实现风险度量。论文明确指出,其并不提出应对措施;其唯一焦点在于风险的度量与评估。
RMF 的意义在于其能够:
- 以标准化方式量化对抗性攻击的潜在损害。
- 客观衡量攻击者必须投入的资源和步骤。
- 强调在没有应对措施的情况下,后门攻击可以导致关键风险(例如,在自动驾驶车辆中将停止标志误认为限速标志),且攻击者的努力程度相对较低。
作者谦虚地总结道,虽然该框架在受控环境中成功衡量了风险,但由于缺乏可比数据,目前衡量不同攻击之间的风险或创建全面风险矩阵的能力仍然有限。未来的工作需要通过测量更多攻击来建立数据集,从而实现更具体的应对措施开发和更好的风险标准化。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。