Training Leaves Traces: Centered Residual Signatures for Language Model Lineage Verification
本文介绍了一种名为“中心残差签名”(Centered Residual Signatures)的无数据、白盒方法,该方法通过分析残差块中独特的结构痕迹来验证开源权重语言模型的谱系,从而无论经过微调、合并还是量化,都能实现对相关检查点与无关检查点的准确区分。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字景观中,人工智能模型很少是静态且孤立的创造物。它们是随着复杂的供应链不断演进的生命体。一个基于海量文本训练的基础模型,往往会在开发者之间流转。在此过程中,它会被微调以执行特定任务,被压缩以在更小的设备上运行,或者与其他模型结合以创造出全新的事物。这些操作改变了模型的内部数值,即其权重,但却极少留下清晰的纸质痕迹。一旦一个模型以新的名称发布,人们很难判断它是一个著名原型的真实后裔,还是仅仅是一个为了表现得相似而从头构建的仿制品。这种透明度的缺失在开源智能生态系统中造成了一个盲点,使得验证起源或保护知识产权变得困难。
核心挑战在于区分两种截然不同的场景。第一种情况,模型是另一个模型的真正子嗣,通过微调或合并过程继承了其特定的数学结构。第二种情况,模型是一个独立的创造物,只是恰好产生了相似的结果。传统的验证方法,例如检查数字指纹或观察其行为,在这里往往会失效。数字签名在单个数字发生变化时就会失效,而行为测试则无法区分共享的历史与共享的结果。研究人员需要一种方法来观察模型的“大脑”内部,并找到一个能在这些变换中存续的痕迹——一种无需原始训练数据或运行模型能力即可证明共享血缘关系的信号。
一个研究团队开发出了一种方法来解决这个问题,通过检查模型层中所留下的独特几何结构。他们专注于许多现代语言模型中常见的特定架构特征:残差块(residual block)。在这些结构中,信息流经一条主路径,同时也会跳过一条侧边路径,这使得模型能够学习微小的修正,而不是每次都从零开始。研究人员发现,当一个模型进行训练时,这些侧边路径中的数学运算会产生一种非常特定的、共享的对齐方式。这就像是模型学会了以某种特定的方式组织其内部组件,以实现高效的修正。然而,这种对齐方式非常普遍,几乎出现在任何经过训练的模型中,因此仅凭这一点无法证明血缘关系。
突破在于研究人员意识到,他们可以分离出那个对特定检查点(checkpoint)而言独特的结构部分。通过在数学上移除所有训练模型都具备的通用、共享的对齐方式,他们留下了一个“残差签名”。这个剩余的部分就像是一个独特的指纹,专门针对该模型训练的确切历史。它捕捉了模型内部数值在创建过程中被调整的具体方式。随后,团队创建了一个评分系统来比较两个不同模型的这些签名。如果模型拥有共同的父辈,它们的独特签名即使在一个模型经过大量修改、压缩或与其他模型合并后,也会紧密对齐。如果它们互不相关,那么在对比时,这些签名看起来就像随机噪声。
为了测试这一想法,研究人员使用不同规模和复杂度的模型进行了一系列严格的实验。他们提取基础模型,并使其经历常见的现实世界变换,例如在数据上进行微调、通过剪枝减少其规模,或通过压缩使其运行更快。他们还创建了从头开始训练以模仿原始模型行为的独立模型。结果令人震惊。新的评分方法成功识别出了每一个真正的后裔,无论该模型经过了多少种改变。它能以完美的准确度将它们与独立模型区分开来,即便那些独立模型在行为上设计得几乎完全一致。该方法适用于不同的语言模型家族,包括用于编程和通用对话的模型,证明了这种信号是这些网络学习过程中的一种基本属性。
研究人员还针对一种更具攻击性的场景测试了该方法,即在对手试图隐藏模型起源的情况下。他们尝试通过打乱模型的内部组件或重新缩放其数值,在保持模型功能的同时,破坏其在传统检测工具面前的外观。虽然旧的方法在这些条件下完全失效,但新的签名依然保持稳定。这是因为该方法并不依赖于组件的顺序或其绝对大小,而是依赖于它们之间的特定几何关系。研究人员发现,他们的这种方法比最接近的竞争技术要快得多,在处理大型模型时速度快了数十倍。这种速度优势,结合其无需任何训练数据或运行模型能力的特性,使其成为审计开源人工智能供应链的实用工具。
在一次现实世界的演示中,团队将该方法应用于一组声称与某个著名原创模型相关的公开语言模型。测试正确识别了三个真正的后裔,并赋予了它们高相似度评分。与此同时,它也正确地标记了另外七个虽然具有相同架构但经过独立训练的模型,并赋予了它们接近于零的评分。这证实了该方法可以区分真实的血缘关系与单纯的架构克隆。这项研究表明,这种被动的、无需数据的信号是验证开源权重模型历史的可靠方式。它提供了一种观察模型间不可见联系的方法,确保人工智能的谱系可以被追踪、验证和理解,即使在原始创造者已经离去之后。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。