← 最新论文
💻 computer science

Who Built This Model? Tracing LLM Lineage via Spectral Fingerprints in Weight Space

本文提出了一种统一的几何指纹识别框架,该框架通过分析大语言模型权重矩阵的谱能量与子空间对齐情况,在无需访问输入数据的情况下,实现对模型谱系的高鲁棒性追踪,并能有效区分独立模型、同系列模型以及共享基座的模型。

原作者: Yiwei Chen, Bingqi Shang, Sijia Liu

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiwei Chen, Bingqi Shang, Sijia Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:每当你制造一个机器人时,你都会在其大脑中留下一段独特的、隐形的 DNA 链。在快速发展的人工智能宇宙中,这些“机器人”被称为大语言模型(LLMs)——它们是超级聪明的计算机程序,可以写故事、解数学题,还能像人类一样聊天。但转折在于:这些模型并不总是从零开始构建的。通常,一家公司会拿走一个巨大的、预制好的模型,对其进行微调,用新数据进行训练,然后发布一个“新”版本。这就像是拿走了一位名厨的秘密食谱,加了一撮盐,然后称之为自己的作品。这创造了一个混乱的家族树,让人很难分辨谁和谁有亲缘关系,谁模仿了谁,以及一个模型的真实起源究竟在哪里。这就是“溯源”(provenance)问题:了解某物的真实起源。科学家们曾尝试通过观察模型的行为(例如测试它们的答案)来解决这个问题,但这很棘手,因为答案会随着提问方式的不同而改变。因此,核心问题变成了:我们能否观察模型的“大脑内部”(其权重),找到一个永久的、不可更改的指纹,从而在不需要向它提问的情况下,告诉我们它的家族历史?

这篇题为《谁建造了这个模型?》(Who Built This Model?)的论文给出了肯定的回答。作者是来自密歇根州立大学的研究人员,他们提出了一种通过观察模型内部权重的几何结构来追踪 AI 模型谱系的新方法。他们将模型的“大脑”视为一种复杂的乐器,并倾听它发出的两种不同的“声音”:音符的大小声(谱能量)和声波传播的方向(子空间对齐)。

首先,他们观察了模型权重的“大小声”或整体能量。他们发现,这起到了粗粒度家族树的作用。如果两个模型属于完全不同的家族(比如由 A 公司建造的机器人与 B 公司建造的机器人),它们的“大小声”模式是完全不同的。如果它们属于同一个系列(比如同一个模型的 30 亿参数版本和 70 亿参数版本),它们的模式则非常相似。研究人员展示了通过测量这种“谱能量”,他们可以轻松辨别两个模型是陌生人还是远亲。这意义重大,因为之前的方法经常会将这两类情况混淆,无法区分一个全新的模型和一个旧模型的规模扩展版。

然而,当模型是非常近的亲属时,“大小声”测试就会遇到瓶颈。想象两个模型,它们都始于完全相同的基底,但随后经历了不同的训练营:一个学习成为数学导师,另一个学习成为创意作家。它们的“大小声”几乎完全相同,因此第一个测试无法将它们区分开来。这正是论文中第二个奇妙之处的所在:“子空间对齐”。作者发现,即使整体音量相同,模型大脑波动的特定方向也会根据模型所学的内容发生细微变化。如果一个模型是在一个极小的训练集上训练的,它的方向指纹与原始模型几乎一致;但如果它是在一个庞大且多样化的数据集上训练的,这些方向就会发生明显的偏移。

团队在 110 多对不同的开源权重模型上进行了测试。他们发现,他们的新方法可以做到旧方法无法做到的事情:它既能区分“陌生人”与“亲戚”,又能进一步缩放视角,辨别出那些拥有不同生活经历(即不同的训练数据或算法)的“亲戚”。例如,他们展示了即使起始基底相同,使用 100% 数据集训练的模型与仅使用 10% 数据集训练的模型,其几何指纹也是不同的。他们还发现,不同的训练算法(如 DPO、PPO 和 RAFT)会在模型大脑的不同部分留下独特的几何伤痕。

简而言之,这篇论文表明,AI 模型在其权重空间中隐藏着内在的“生物特征识别”。通过结合检查全局能量(以区分不同家族)和检查方向几何(以区分近亲),我们可以构建一张可靠的地图,揭示谁建造了什么,以及它们是如何演化的。这不仅仅是为了满足好奇心;它提供了一种检查 AI 供应链的工具,确保我们了解所使用的模型的真实起源,并有助于在模型变得越来越复杂时监管其演化。作者强调,即使我们在没有访问训练数据的情况下,仅凭最终的模型权重也能实现这一点,这使其成为 AI 世界中实现透明度的强大工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →