← 最新论文
💬 NLP

Reading Between the Lines: Towards Reliable Black-box LLM Fingerprinting via Zeroth-order Gradient Estimation

本文介绍了 ZeroPrint,一种新颖的黑盒大语言模型指纹提取方法,该方法通过利用基于语义保持词替换的零阶梯度估计,来提取比现有基于输出的技术更具信息量且更鲁棒的模型特征签名。

原作者: Shuo Shao, Yiming Li, Hongwei Yao, Yifei Chen, Yuchen Yang, Zhan Qin

发布于 2026-01-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuo Shao, Yiming Li, Hongwei Yao, Yifei Chen, Yuchen Yang, Zhan Qin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:数字巨头的窃取

想象一下,大型语言模型(LLM)就像是规模宏大、定制打造的图书馆。建造这样一个图书馆需要耗费数百万美元并投入数年的心血。因为它们如此珍贵,不法分子可能会试图窃取它们。他们可能会拷贝一个图书馆,然后将其作为自己的产品进行销售,而不向原作者支付任何费用。

为了阻止这种行为,我们需要一种方法来证明:“这个图书馆属于我。”这被称为指纹识别(Fingerprinting)

旧方法 vs. 新思路

检查一个图书馆是否为抄袭品有两种方法:

  1. “白盒”方法(内部人员): 你可以走进图书馆内部,查看蓝图、书籍的具体排列方式以及书页上使用的特定墨水。这很容易证明所有权,但在现实世界中,图书馆所有者很少会让陌生人进入内部。
  2. “黑盒”方法(外部人员): 你只能从外部向图书馆提问,并阅读它们给出的答案。你无法看到内部情况。
    • 问题在于: 现有的黑盒方法就像是通过听声音来辨别一个人。如果他们低声细语或改变了语调,就很难辨认出他们是谁。由于模型用于表达的复杂过滤器,其“声音”(模型的输出)会丢失太多关于“大脑”(模型的内部参数)的细节。

“顿悟”时刻:倾听“变化”,而非仅仅倾听“答案”

这篇论文的作者提出了一个聪颖的问题:“除了观察‘声音’,我们是否还能从外部观察到其他能反映其‘大脑’的信息?”

他们使用了一个名为**费舍尔信息理论(Fisher Information Theory)**的数学概念,证明了一个令人惊讶的事实:

  • 输出(答案): 如果你问模型“2+2等于几?”,它回答“4”,这个答案非常通用。它并没有告诉关于模型是如何思考的太多信息。
  • 梯度(反应): 如果你问“2+2等于几?”,然后稍微调整问题为“2+2.001等于几?”,答案会如何变化

类比: 想象你正在试图识别一种特定类型的橡皮筋。

  • 观察静态的橡皮筋(输出): 你看到它是红色的,长度为5英寸。许多橡皮筋看起来都那样。
  • 拉动橡皮筋(梯度): 你轻轻拉动它。它是容易拉伸,还是瞬间回弹?它是感觉僵硬吗?这种对“拉动”的反应方式对于那根特定的橡皮筋来说是独一无二的,即使两根橡皮筋在静止时看起来一模一样。

论文在数学上证明了,通过观察模型如何对微小的变化做出反应(梯度),比仅仅听取它的最终答案,能揭示更多关于其独特“大脑”的信息。

解决方案:ZeroPrint

挑战在于,在“黑盒”场景下,你无法实际看到模型内部的数学逻辑来计算这些反应。你只能看到文本。

ZeroPrint 是一个绕过这一难题的巧妙技巧。其工作流程如下:

  1. “词汇替换”技巧: 由于你不能在句子中添加微小的数学“噪声”(你不能在单词上加上0.001),ZeroPrint 使用了语义词汇替换(Semantic Word Substitution)

    • 示例: 与其问“鸟会飞吗?”,不如问“鸟会翱翔吗?”或者“鸟会飞吗?”
    • 这些是微小的、保持原意的变化。对人类来说,它们是一样的。但对模型的内部数学逻辑来说,它们是略有不同的输入。
  2. “影子”计算:

    • 系统向模型提出原始问题和“替换后”的问题。
    • 记录它们的答案。
    • 然后,它使用一种名为**零阶估计(Zeroth-order Estimation)**的数学技术。这可以被看作是一个看不见嫌疑人指纹的侦探,但他可以通过观察脚印在移动时如何改变泥土的形状,来推断出脚印的模式。
    • 通过对比输入中的微小差异(词汇替换)与输出中的微小差异,ZeroPrint 构建了一个雅可比矩阵(Jacobian Matrix)
  3. 指纹: 这个雅可比矩阵就是模型的独特“反应签名”。它就像是一个数字DNA检测,证明:“这个模型的反应方式,与我拥有的原始模型对词汇替换的反应方式完全一致。”

结果:新的金标准

作者使用标准的基准测试(LeaFBench)将 ZeroPrint 与其他方法进行了对比测试。

  • 性能: ZeroPrint 是测试过的最佳“黑盒”方法。它在识别抄袭品方面的表现显著优于那些仅对比答案的旧方法。
  • 鲁棒性: 即使窃贼尝试通过更改系统提示词(System Prompts)或在答案中加入噪声来伪装模型,ZeroPrint 仍然能够识别出原始的“反应签名”。
  • 速度: 它足够快,足以投入实际应用,只需几分钟即可完成对一个模型的检查。

总结

简而言之,ZeroPrint 通过意识到模型如何改变想法比它说了什么更具唯一性,解决了AI模型被窃取的问题。通过使用巧妙的词汇替换来从外部“戳弄”模型,并测量其反应,ZeroPrint 创建了一个可靠的指纹,在无需查看模型秘密代码的情况下证明了所有权。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →