← 最新论文
🤖 AI

TokenPrint: A Calibrated Token-Space Fingerprint for Language-Model Provenance

TokenPrint 引入了一种无需训练、经过校准的标记空间指纹,该指纹利用来自知识探测器的前 kk 个词表投影,能够准确识别不同模型家族及量化水平下的语言模型来源、谱系以及共享训练数据。

原作者: Yuqi Wu, Shengming Zhao, Jie Chen

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuqi Wu, Shengming Zhao, Jie Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图弄清楚一个神秘人的身份,但他们从不出示身份证,他们的父母也不肯透露他们的姓氏。你手里唯一的线索就是他们的声音。如果你仔细聆听,可能会注意到他们使用了和兄弟姐妹相同的俚语,或者以一种特定的方式接龙对方的话,亦或是拥有与表亲们相似的独特节奏。在人工智能的世界里,这些“人”就是大语言模型(LLMs)——即那些能够写作、聊天并解决问题的计算机程序。长期以来,如果一家公司发布了一个新模型,他们可能会隐藏该模型最初是从哪个旧模型演变而来的,或者它具体是在哪些书籍和网站上进行训练的。这是一个问题,因为如果一个模型是基于窃取的数据构建的,或者被训练得具有危害性,我们需要知道它的“家族树”才能追究相关人员的责任。科学家们曾尝试通过观察模型的内部代码(其“DNA”)来解决这个问题,但如果那段代码被隐藏了呢?这篇论文提出了一个聪明的疑问:我们能否仅通过聆听它们所说的话,就能识别出一个模型的家族?

来自复旦大学的研究人员吴雨琦、赵圣明和陈洁引入了一种名为 TokenPrint 的新工具。你可以把它想象成 AI 的“声纹”。这种方法不需要看到模型的秘密内部代码,他们只需向模型提出 250 个特定的问题——比如“加拿大的首都是哪里?”或“写一段用于循环的代码”——然后观察模型在回答时选择的前几个词。他们将这些顶部的选择称为模型的“指纹”。

这里有一个魔术技巧:当两个模型有关联时(例如,一个是另一个的“微调”版本,或者它们都使用了完全相同的训练数据集),即使它们的规模不同或由不同的公司制造,它们也倾向于在这些问题上选择相同的顶层词汇。研究人员使用一种名为 Jaccard 重叠度(Jaccard overlap) 的数学工具来衡量这种相似性,这个工具本质上是在问:“这两个模型共享了多少个顶层词汇?”

研究发现了一些非常有趣的现象:

  1. 家族特征是真实存在的: 拥有共同“父辈”或训练数据集的模型,其相似度得分(约为 0.35 到 0.48)远高于完全无关的模型(约为 0.17)。这就像一个孩子的声音听起来会比陌生人更像其父母,即使他们并不完全相同。
  2. 形成速度极快: 这种“声纹”形成得异常迅速。研究人员发现,这种相似性在模型训练的前 1% 阶段就已经出现了,远早于模型变得足够聪明以能正确回答问题的时刻。这表明指纹来自于模型“吃掉”的数据,而不仅仅是它变得多么聪明。
  3. 即便被隐藏也依然有效: 即使模型使用不同的“词汇表”(不同的单词列表)或不同的计算机架构,该方法依然有效。这就像即使对方说着略微不同的方言,你依然能认出一位家族成员。
  4. 它是侦探工具,而非魔杖: 指纹非常擅长缩小嫌疑人的范围。例如,当他们尝试寻找五个特定新模型(称为 R1 蒸馏模型)的“父辈”时,指纹每次都能将真正的父辈锁定在前两个猜测之中。然而,它有时无法区分父辈与非常接近的表亲(如兄弟模型),这意味着它能为你指明方向,但并不总是能给出一个单一且完美的答案。

研究人员还检查了当模型被压缩以节省空间(这一过程称为量化)时,这种指纹是否依然存在。他们发现,即使模型被压缩到非常小的尺寸(int4 或 int8),指纹依然保持强劲,与原始模型的相似度得分保持在 0.82 到 0.92 之间。这意味着即使模型被“挤压”了,其“声音”也不会发生太大变化。

简而言之,TokenPrint 表明,每个语言模型都会留下独特的、持久的“词汇选择”痕迹,从而揭示其训练历史。这是一种无需训练、轻量化的方法,用于追踪模型的血统,帮助我们理解谁制造了什么以及数据来自何处,而无需窥探模型的秘密代码。虽然它并不总能以 100% 的确定性命名确切的父辈,但它是追踪 AI 家族树的一把强有力的“放大镜”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →