Fingerprinting Inference Systems of Large Language Models
本文揭示,由特定推理系统组件(如引擎、后端和硬件)引起的细微数值偏差会传播至大语言模型输出,从而使得一种新的指纹识别方法能够可靠地识别这些底层系统,并证明完全阻止此类识别在根本上是困难的。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用简单语言和日常类比对该论文的解读。
核心理念:计算机的“数字指纹”
想象你在三家不同的餐厅点了完全相同的菜肴。即使它们使用相同的食谱,食物的味道也可能略有不同。一位厨师切洋葱更细一点,另一位用的锅稍微热一点,第三位搅拌锅的顺序不同。对于普通食客来说,这顿饭看起来是一样的。但对于专业美食评论家来说,这些微小的差异能确切地揭示出是哪个厨房烹饪了这顿饭。
这篇论文认为,大型语言模型(LLMs) 的运作方式也是如此。
当你向人工智能(AI)提问时,答案不仅仅由“大脑”(模型)生成。它同时也受到烹饪发生的“厨房”(推理系统)的塑造。这个“厨房”包括:
- 引擎: 管理对话的软件(如 vLLM 或 SGLang)。
- 后端: 用于处理注意力机制的具体数学工具(如 FlashAttention)。
- 硬件: 物理计算机芯片(如 Nvidia A100 与 H100 GPU 的区别)。
尽管数学原理本应相同,但计算机并不总是以完全相同的顺序计算数字。因此,微小的、不可见的误差(称为数值偏差)会发生。论文表明,这些微小的误差是特定软件与硬件组合所独有的。
攻击是如何运作的:“侦探的测验”
研究人员创造了一种方法来“指纹识别”这些系统。他们就像一名侦探,无法进入厨房,只能向厨师提问并阅读菜单。
策略:
侦探使用四种特定的“陷阱”(提示词)来迫使计算机泄露其秘密:
- 稀有令牌陷阱: 要求 AI 回忆句子中隐藏的一个奇怪、生僻的符号。微小的数学误差可能导致 AI 猜错符号。
- 是/否陷阱: 提出一个只需要一步思考的简单问题。这能隔离计算机在回答前是如何读取问题的。
- 长故事陷阱: 给 AI 一段很长的文本,并要求找出其中的特定数字。这迫使计算机将工作分割成块,从而揭示其如何处理大型任务。
- 重复陷阱: 要求 AI 重复一句话 100 次。这用于检查计算机如何记忆它刚刚说过的话(使用“缓存”)。
通过向 AI 提供这些陷阱并分析答案中的微小差异,研究人员构建了一个分类器(一种智能排序机器),能够以高准确度断言:“这个答案是在使用 vLLM 引擎的 A100 芯片上烹饪的。”
他们的发现
研究人员在多种不同的软件和硬件组合上测试了这种方法。
- 完美准确率(“零温度”情况): 当 AI 被设置为非常严格且确定性(无随机性)时,指纹识别100% 有效。这就像完美的匹配。
- 良好准确率(“聊天”情况): 当允许 AI 稍微具有创造性(开启随机性)时,指纹识别仍然非常有效,正确率达到 76% 到 80%。
- 鲁棒性: 即使要求 AI 同时处理不同数量的数据,或者系统提示词(AI 的指令)发生轻微变化,该方法依然有效。
我们为什么要关心?(安全风险)
这篇论文强调了一个严重的安全问题。
想象一名黑客想要闯入银行。他们需要知道银行使用哪种特定的锁(特定的软件引擎),以便知道该用哪把钥匙去撬。
- 漏洞: 如果攻击者仅通过与 AI 对话就能识别出“厨房”(推理引擎和硬件),他们就可以查找该软件中已知的弱点(漏洞)。
- 结果: 随后他们可以发动针对性攻击。论文指出,在 vLLM 和 SGLang 等流行引擎中已经发现了关键漏洞。识别系统是将其利用的第一步。
我们能阻止它吗?
论文得出结论,阻止这种情况非常困难。
- 两难境地: 要阻止指纹识别,你必须让每台计算机无论硬件或软件如何,都以完全相同的方式计算数字。但这将破坏拥有不同、专用工具(如更快的芯片或优化的软件)所带来的好处。
- 权衡: 你可以在答案中添加“噪声”(随机性)来隐藏指纹,但这会使 AI 在需要完美精确度的任务(如编程或数学)中变得不可靠。
- 最佳防御: 最简单的防御手段仅仅是速率限制。如果你限制用户能提问的数量,黑客收集足够数据以构建指纹的过程就会变得过于缓慢且昂贵。
总结
这篇论文揭示,AI 烹饪其答案的“厨房”会在食物中留下独特且可检测的味道。通过分析这些微小的味道,攻击者可以确切识别 AI 运行的是何种硬件和软件,从而可能针对特定的安全弱点。虽然我们无法在不牺牲性能的情况下轻易解决根本原因,但我们可以让攻击者更难收集到他们所需的数据。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。