← 最新论文
🤖 machine learning

FLIPS: Instance-Fingerprinting for LLMs via Pseudo-random Sequences

本文介绍了 FLIPS,这是一种利用伪随机序列偏差来准确区分同一大语言模型不同配置的新型实例级指纹识别方法,从而通过实现对特定部署行为而非仅仅是模型来源的识别,填补了 AI 监管领域的一个关键空白。

原作者: Gurvan Richardeau, Gohar Dashyan, Erwan Le Merrer, Gilles Tredan

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Gurvan Richardeau, Gohar Dashyan, Erwan Le Merrer, Gilles Tredan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:不仅是引擎,还有驾驶员

想象你拥有一辆动力强劲的汽车(大语言模型,或称 LLM)。通常情况下,当警察或监管机构想要识别一辆车时,他们会查看其引擎(模型的权重)。如果引擎相同,他们就认为这是同一辆车。

但本文指出,这还不够。两辆拥有完全相同引擎的汽车,由于以下因素的不同,开起来可能会截然不同:

  • 谁在驾驶?(系统提示词/指令)。
  • 开得有多快?(温度设置/Temperature)。
  • 使用的是什么燃料?(量化或微调)。

一辆车在一位驾驶员手中可能表现得安全且礼貌,但在另一位驾驶员手中可能变得鲁莽且具有攻击性。目前的 AI 识别方法就像只看引擎;它们忽略了驾驶员和设置。本文引入了一种名为 FLIPS 的新方法,它就像一个车牌识别器。它不仅能识别汽车型号,还能识别该汽车在当前配置下的特定实例

问题所在:“鲁棒性”陷阱

现有的 AI 指纹识别工具旨在保护知识产权(例如抓捕窃取模型代码的行为)。为了实现这一目标,它们被设计得具有“鲁棒性”(Robustness)——即忽略细微的变化。它们的目标是说:“是的,这是 Llama-3 模型”,即使设置发生了变化。

监管者的困境:
监管者(如欧盟《人工智能法案》)并不关心原始代码,他们关心的是行为。如果一家公司声称其 AI 是“安全”的,但他们通过调整设置使其变得“不安全”,监管者需要能够抓住那个特定的、危险的版本。目前的工具对这些变化是“盲目”的,因为它们的设计初衷就是为了忽略这些变化。

解决方案:FLIPS(“随机性”测试)

作者创建了一个名为 FLIPS(通过伪随机序列进行 LLM 指纹识别)的工具。其工作原理如下,使用一个简单的类比:

类比:硬币投掷测试
想象你要求一个人抛掷 100 次硬币,并记录结果(正面/反面)。

  • 一个完美的随机硬币投掷会产生一种杂乱、不可预测的模式。
  • 一个试图“伪造”随机性的人往往会陷入微妙的模式中(例如,他们会避免连续出现三次“正面”,因为这感觉太不寻常了)。

FLIPS 如何工作:

  1. 提问: 监管者要求 AI 生成一段随机的二进制标记序列(例如“0”和“1”或“车”和“太阳”)。
  2. 缺陷: AI 模型在生成真正的随机性方面表现很差。它们拥有基于其特定权重、设置和指令的隐藏“偏见”或“习惯”。
  3. 指纹: FLIPS 将 AI 的输出通过一系列统计测试(称为 NIST 套件,这就像是一场针对随机性的严苛数学考试)。
  4. 结果: 尽管 AI 试图表现得随机,但它会在其错误中留下独特的“指纹”。
    • 示例: 模型 A 可能会在出现“1”之后意外地过多地出现“0”。模型 B 可能会避开“000”。
    • FLIPS 通过测量这些微小的、特定的偏差来识别正在对话的究竟是哪个版本的 AI。

实验结果:捕捉“坏”版本

研究人员在 25 种不同 AI 模型的 237 个不同版本上测试了该工具。他们改变了温度、指令,甚至移除了安全过滤器(这一过程称为“消融/abliteration”)。

  • 旧方法 (LLMmap): 当被要求区分同一个模型的“安全版本”和被篡改后的“不安全版本”时,旧方法表现极差。它认为它们是同一辆车(出错率高达 95%)。它过于“鲁棒”了。
  • FLIPS: 在封闭测试中(即已知所有选项的情况下),它能正确识别特定版本 96% 的时间;在开放测试中(即必须在不在数据库中时回答“我不知道这个版本”时),识别率为 90%

关键发现: FLIPS 仅需极少的提问(少至 8 次查询),就能分辨出安全 AI 与经过篡改的危险版本之间的区别。

为什么这对于监管至关重要

作者将 FLIPS 比作车牌

  • 车牌: 它们很容易伪造,但它们是警察识别道路上特定车辆的标准方式。他们不需要打开引擎盖就能知道一辆车是否超速或违规行驶。
  • FLIPS: 它允许监管者在无需获取公司私有代码(权重)的情况下,检查 AI 的“车牌”。

如果一家公司说,“我们正在运行安全版本的 AI,”监管者可以使用 FLIPS 通过几个随机问题进行检查。如果回答显示出“不安全的指纹”,监管者就知道该公司在撒谎或者更改了设置,而无需查看其内部代码。

总结

  • 问题: 现有的 AI 识别工具会忽略会改变 AI 行为的设置。
  • 解决方法: FLIPS 利用 AI 无法生成完美随机性的弱点,为每一个特定的配置创建一个独特的“指纹”。
  • 益处: 监管者可以快速验证部署的 AI 是经过批准的安全版本,还是被修改过的危险版本,且只需极少的提问,无需接触私有代码。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →