MeMark: Membrane-Space Watermarking for Spiking Neural Networks
MeMark 引入了一种鲁棒的脉冲神经网络水印技术,该技术将多比特标识符直接嵌入到神经元的内部膜电位状态中,从而即使在输出头替换、微调、剪枝和量化之后,也能实现可靠的所有权验证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,一种显著的转变正在发生:计算机大脑正朝着比传统模型更接近人类神经系统的方向演进。这些被称为脉冲神经网络(spiking neural networks)的系统,并不以持续的数字流形式处理信息。相反,它们通过短暂、离散的活动爆发进行通信,就像大脑中的神经元放电一样。在特定的信号触发之前,它们保持静默,这使得它们在能量利用上极其高效。由于训练这些先进系统需要海量的数据、强大的计算机和大量的时间,最终训练出的模型成为了珍贵的资产。公司和研究人员经常将这些模型作为预训练的起点发布,以便他人可以在其基础上构建新的任务。然而,这种做法也产生了一个漏洞:如果有人拿走一个发布的模型,对其进行微小的调整,并替换掉产生最终答案的部分,他们就能有效地抹除任何关于原作者构建了该系统核心部分的证据。
为了解决这个问题,一组研究人员开发了一种名为 MeMark 的新方法,它像是一个嵌入在这些脉冲网络内部运作深处的隐藏签名。与以往保护人工智能模型的方法不同(那些方法依赖于检查最终输出或可见结果),MeMark 将其证据隐藏在神经元本身之中。研究人员专注于一种维持内部电荷的特定类型神经元,即膜电位(membrane potential)。这种电荷随时间积累,直到达到一个临界极限,从而导致神经元发出信号并随后重置。团队意识到,他们可以将这种自然的放电阈值作为一把秘密锁。通过仔细调整训练过程,他们可以让特定的神经元在接收到秘密、隐藏的输入时,将电荷保持在略高于或略低于这个放电极限的状态。这创造了一种“放电”与“不放电”状态的模式,与一个秘密代码相对应,有效地将一个多位数的密码写入了网络的电学状态中。
这种方法的精妙之处在于其读取方式以及它如何抵御变化。为了验证模型的所有权,所有者不需要训练一个单独的解码器或学习一种新的数据解释方式。他们只需呈现秘密输入,并检查选定神经元的内部电荷。如果电荷高于极限,则计为 1;如果低于极限,则计为 0。由于阈值是神经元设计中内置的一部分,验证过程是即时的且不需要额外的学习。这种方法被证明具有极强的韧性。在涉及一个拥有超过 2 亿参数的大型语言模型的测试中,研究人员嵌入了二十个不同的秘密密钥。即使模型经过了大幅度的修改——例如移除 90% 的连接、压缩数据或完全替换生成文本的最终层——隐藏的签名依然完好无损。内部证据在这些剧烈的变化中幸存了下来,而旧方法中使用的可见输出标记则很容易被抹除。
研究人员还应对了一个不诚实索赔者可能尝试的聪明手段:通过检查模型,然后设计出一个恰好符合模型现有内部状态的伪造密钥。为了防止这种情况,该系统要求创建一个在模型发布之前生成的带有时间戳的记录。这一记录将秘密密钥与该时刻特定版本的模型绑定在一起。如果有人试图通过逆向工程构建密钥来声称所有权,他们无法提供这一先前的记录,从而证明其主张是虚假的。研究表明,如果允许攻击者在先期观察模型内部情况后,攻击者确实可以创建一个匹配模型的密钥,但他们无法绕过对原始时间戳承诺的要求。此外,系统针对数千个随机密钥进行了测试,没有任何一个密钥意外匹配了受保护的模型,确保了证据的特异性和可靠性。
这项工作表明,即使在模型被重新利用或修改时,复杂的智能人工智能的所有权也能得到保护。通过将证明直接嵌入神经元的基础电学行为中,而非最终输出,研究人员创造了一种难以在不破坏模型功能的情况下被移除的签名。该方法适用于不同的网络架构,从简单的重复结构到用于语言的复杂 Transformer 系统。虽然该系统非常稳健,但研究人员指出,如果攻击者知道确切的秘密输入和隐藏神经元的特定位置,他们有可能针对并移除它们。然而,在没有这些秘密知识的情况下,水印仍然是一种持久且可靠的证据形式,确保原作者即使在模型经过多次转手并被修改用于新用途后,仍能证明其作品。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。