← 最新论文
📊 statistics

Statistically Undetectable Backdoors in Deep Neural Networks

本文表明,对抗性训练者可以在深度神经网络中嵌入统计学上无法检测的后门,从而创造出一种根本性的权力不对称,即他们能够生成特定的对抗样本,而用户在标准密码学假设下在计算上无法做到这一点。

原作者: Andrej Bogdanov, Alon Rosen, Neekon Vafa

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrej Bogdanov, Alon Rosen, Neekon Vafa

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

技术摘要:深度神经网络中统计不可检测的后门

1. 问题陈述

本文探讨了“机器学习即服务”(MLaaS)范式下的安全与信任问题。在该范式下,少数机构为大众训练深度神经网络(DNN)。核心问题在于:攻击者(模型训练者)是否可以在 DNN 中嵌入一个“后门”,使其能够获得对特定模型输出(具体而言,是生成对抗样本的能力)的排他性控制权,同时即使在用户拥有完整模型参数(白盒访问)的情况下,该后门在统计上仍与诚实训练的模型无法区分。

作者关注的是基于不变性的对抗样本,即通过对输入进行巨大的、经对抗性选择的改变,导致输出的变化异常之小(即对于 xxx \neq x'M(x)M(x)M(x) \approx M(x'))。其目标是证明存在一种权力不对称:后门持有者可以高效地生成此类碰撞,而任何不具备后门的多项式时间算法内的对手都无法做到。

2. 方法论与构建

2.1 模型约束

该构建适用于满足以下三个约束的特定类前馈 DNN:

  1. 冻结压缩首层: 第一层是一个随机的 m×nm \times n 高斯矩阵(m<nm < n),在训练过程中不进行更新。它作为一个随机特征映射。
  2. 双 Lipschitz 复合: 所有后续层的复合是双 Lipschitz 的(具有失真度 βupper\beta_{upper})。这确保了输入的微小变化不会导致输出产生任意大的变化,反之亦然。这通过使用双 Lipschitz 激活函数(如 Leaky ReLU)和良态权重矩阵来实现。
  3. 离散输入: 输入是来自有界范围(例如像素值)的整数。

2.2 后门机制

构建的核心在于将一个“后门”向量 z{±1}nz \in \{\pm 1\}^n 植入第一层的高斯矩阵 AA 中。

  • 生成: 训练者采样一个随机的 zz,然后采样 AA 的行,使得 Az\|Az\|_\infty 极小(具体为 κn\leq \kappa\sqrt{n})。这是通过拒绝采样过程(或直接条件采样)实现的,其中行 aia_i 是在给定 aizκn|a_i^\top z| \leq \kappa\sqrt{n} 条件下的高斯分布采样。
  • 激活: 对于任何输入 xx 生成对抗样本,训练者只需计算 x=x+zx' = x + z。由于第一层的线性性质,A(x+z)=Ax+AzAxA(x+z) = Ax + Az \approx Ax。由于后续层是双 Lipschitz 的,最终输出 M(x)M(x') 仍会保持接近 M(x)M(x)
  • 不可检测性: 作者证明,后门矩阵 AA 的分布在全变分(TV)距离上与标准 i.i.d. 高斯矩阵 N(0,1)m×nN(0, 1)^{m \times n} 在统计上是接近的。这种接近性是通过分析解的数量 N(A)N(A)(满足 Az\|Az\|_\infty 较小的 zz 的计数)的集中性来建立的。他们表明,N(A)N(A) 的二阶矩接近其一阶矩的平方,这意味着后门矩阵的密度与诚实高斯矩阵的差异仅为一个微小的乘性因子。

2.3 加密硬度

后门的安全性依赖于在仅给定矩阵 AA 的情况下寻找此类向量 zz' 的计算难度。这个问题等价于在格中寻找短向量,或解决**对称二元感知器(SBP)**问题。在标准加密假设下(特别是格问题如 LWE 的最坏情况硬度),任何多项式时间算法找到一个向量 zz' 使得 Az\|Az'\|_\infty 像植入的 az\|az\|_\infty 那样小的难度是计算上不可行的。

3. 核心贡献与结果

3.1 统计不可检测性

论文证明,对于任何产生满足所述约束的模型 MAM_A 的高效训练算法 AA,存在一个后门算法 BB 产生 MBM_B 和一个后门 zz,使得:

  • MAM_AMBM_B(包括所有权重)的描述之间的全变分距离为 ϵ=O~(m/n)\epsilon = \tilde{O}(\sqrt{m/n})
  • 没有任何算法(无论计算能力如何)能以大于 ϵ\epsilon 的优势区分 MAM_AMBM_B。这是一个统计学保证,比先前工作中发现的计算不可检测性(如 [GKVZ22])更强。

3.2 指数级权力不对称

论文将后门强度定义为对手能找到的最佳碰撞与后门持有者能找到的碰撞之间的比例。

  • 定理 7: 对于满足约束的模型,后门强度至少为 Ω~(2n/mnmβupper)\tilde{\Omega}\left(\frac{2^{n/m}}{\sqrt{nm} \cdot \beta_{upper}}\right)
  • 这意味着后门持有者拥有指数级的优势(在压缩比 n/mn/m 方面)。虽然训练者可以生成距离为 δ02n/m\delta_0 \approx 2^{-n/m} 的碰撞,但任何多项式时间对手受限于距离为 δ1negl(n)\delta_1 \approx \text{negl}(n) 的碰撞(或根据硬度假设显著更大),这使得后门持有者的能力在指数级上更强。

3.3 认证机制

作者将这些后门解释为一种“内置”的身份认证机制。由于后门向量 zz 允许生成一个证明(一对 x,x+zx, x+z,其输出距离很小),且该证明对于他人来说在计算上是难以伪造的,因此训练者可以在不改变模型输入/输出行为的情况下,证明其对模型训练过程的所有权。

3.4 实证验证

论文包含了一个在 Fashion-MNIST 数据集上的概念验证实现:

  • 架构: 一个具有 256×784256 \times 784 冻结高斯第一层的 DNN,以及随后的双 Lipschitz 层。
  • 结果: 后门模型实现了 86.5%\approx 86.5\% 的准确率(由于输入缩放导致的分布偏移,略低于诚实模型)。
  • 碰撞强度: 实验表明,植入的解 zz 导致 Az1010\|Az\| \approx 10^{-10},而标准算法(包括 LLL 和启发式方法)找到的最佳解要大出好几个数量级(0.1\approx 0.1),展示了约 10910^9 的后门强度。
  • 不可检测性: 对后门矩阵的行进行的统计检验(D'Agostino-Pearson 检验)显示,其与正态分布没有显著偏差,支持了其理论上的不可检测性主张。

4. 重要性与主张

论文声称展示了在 DNN 背景下,模型训练者与用户之间存在根本性的权力不对称。

  • 理论突破: 它确立了自然的机器学习组件(特别是用于随机特征学习的随机高斯投影)本身就具有可以被利用来创建统计不可检测后门的加密硬度属性(与格问题相关)。
  • 白盒安全性: 不同于以往仅实现计算不可检测或需要黑盒访问的工作,这项工作实现了统计不可检测性,即使攻击者拥有对模型权重的完整白盒访问权限。
  • 局限性与谦逊: 作者承认其构建依赖于特定的架构约束(冻结首层、双 Lipschitz 后续层)。他们指出,虽然他们的理论界限在对数因子范围内是紧致的,但其实证结果表明,实际的后门强度可能比理论下界还要高,这可能是因为只有在计算测试失效的极小 κ\kappa 值处,统计距离才会变得不可忽略。他们并非声称打破了标准的加密原语,而是表明支撑这些原语的硬度假设自然地嵌入在某些 DNN 架构中。

论文总结道,如果这些约束在实践中很常见(如在随机特征学习和 Lipschitz 正则化网络中),那么这些 DNN 的鲁棒性无法完全针对能够植入此类后门的恶意训练者进行认证。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →