Stemma: Induced Decision Regions Reveal LLM Provenance
本文介绍了 Stemma,一种用于大语言模型(LLM)溯源测试的鲁棒黑盒方法,它通过将开放式输出映射到诱导决策区域来克服表面形式的变化,从而在多种模型变换和部署设置中实现了最先进的准确率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图弄清楚一本神秘的新书是否是由你喜爱的一部经典名著的同一位作者所写。在人工智能的世界里,这是一个巨大的难题。我们拥有被称为大语言模型(LLM)的庞大计算机大脑,它们能写故事、解数学题,还能与我们聊天。但这些模型经常会被微调、混合,或者为了在较小设备上运行而被缩小。有时,人们会拿走一个受保护的模型,对其进行轻微改动,然后将其作为自己的作品出售,而不经许可。为了抓住他们,我们需要证明这个模型的“家谱”——即它的来源(provenance)。
困难之处在于,这些 AI 模型就像变色龙一样。如果你用稍微不同的方式提问,或者如果该模型被微调以提高速度,它可能会给出完全不同的答案,即使其底层的“大脑”是同一个。以往的方法试图通过观察它们选择的具体词汇来捕捉这些模型,但这就像仅仅通过一件衣服来识别一个人;如果他们换了衣服,你可能就认不出来了。科学家们需要一种方法,能够透过表面现象,看到模型思考的深层且不变的结构。
这就是牛津大学的一个团队提出一个聪明新想法——Stemma 的契机。你可以把它想象成一个侦探,不再问:“你今天穿了什么?”而是开始问:“如果我给你一份包含四个选项的菜单,你会选哪一个?”研究人员意识到,即使一个 AI 改变了它的性格或措辞,当面对特定的选择时,它仍然倾向于选择相同的“类别”。他们将这些隐藏的偏好称为“诱导决策区域”(induced decision regions)。
该团队通过建立一个指纹系统来测试这一点,这个系统不在意 AI 使用了多么华丽的辞藻,而是关注它所做的选择。他们发现,如果两个模型是相关的(比如父子关系),那么即使选项的顺序被打乱,或者模型在完全不同的环境下部署,它们几乎总是会选择相同的选项。而不相关的模型则往往会选择不同的选项。通过在数百个不同模型和数千个问题上测试这种“选择一致性”,Stemma 证明了自己在识别家族联系方面表现得极其出色。在测试中,它正确识别相关模型的准确率高达 96.7%,并且即使在只有 1% 误报率的情况下也能捕捉到相关模型。这是一种稳健的方法,可以明确指出:“是的,这个可疑的新模型确实与那个原始模型有关联”,而无需看到模型的秘密代码。
侦探的新放大镜
那么,这究竟是如何运作的呢?论文引入了一个概念:诱导决策区域。想象你有一个巨大的、混乱的房间,里面充满了无限的可能性(这正是 AI 通常的工作方式)。如果人们只是在里面闲逛,很难判断他们是否在同一个房间里。但,如果我们把房间中间放一道篱笆,并要求每个人选一边,会发生什么?突然间,你就得到了一个清晰的“决策区域”。
研究人员意识到,虽然 AI 模型在面对开放式问题时可能难以预测,但在被迫在特定选项之间做出选择(例如多项选择题)时,它们却表现得惊人地一致。他们将模型一致选择某个特定答案的区域称为其“诱导决策区域”。
论文指出,以往的方法过于关注“表面形式”(surface form),即 AI 输出的具体词汇。如果你问一个 AI “写一首关于猫的诗”,然后再问它“创作一段关于猫科动物的诗句”,相关的模型可能会给你两首非常不同的诗,使它们看起来互不相关。但如果你问这两个模型:“答案是 A、B、C 还是 D?”它们很可能会指向同一个字母,即使它们的解释方式不同。Stemma 忽略了诗意,只看字母。
游戏的三条规则
为了构建他们的指纹,团队并不仅仅是随机挑选问题。他们必须非常聪明。他们创建了一个根据三条严格规则来筛选问题的系统,称之为稳定性(Stability)、鲁棒性(Robustness)和特异性(Specificity)。
- 稳定性: 想象你有一个包含 A、B、C、D 四个答案的问题。如果你打乱顺序变成 D、C、B、A,一个稳定的模型应该仍然选择相同的“概念”,即使字母变了。Stemma 只使用那些无论如何打乱顺序,模型都能保持一致性的问题。
- 鲁棒性: 这关乎你对选择的确定程度。如果一个模型正徘徊在两个答案的边缘,系统的微小变化可能会让它发生反转。Stemma 寻找的是那些模型在决策室的角落里表现得非常“自信”的问题,远离墙壁。
- 特异性: 这是最重要的部分。你不想使用那种所有模型都会选出相同答案的问题(比如“天空是蓝色的吗?”)。那不是指纹,那只是常识。Stemma 寻找的是这样的问题:原始模型选择了一个特定的答案,而其他不相关的模型通常会选错。如果一个嫌疑模型也选择了那个罕见的、特定的答案,那就说明它们有很强的关联性。
大规模测试
研究人员通过一项大规模实验对 Stemma 进行了测试。他们收集了 56 个不同的公开 AI 模型(作为“源模型”),并创建了 770 对嫌疑模型对。其中一些嫌疑模型是直接副本,一些是微调版本,一些是与其他模型合并的版本,还有一些是完全不同的模型。他们还测试了 1,260 对在不同部署方式下的模型对,例如改变温度设置或添加角色扮演指令。
结果令人瞩目。Stemma 实现了 0.967 的 AUC(得分范围为 0 到 1.0,1.0 为完美),并且能在保持误报率仅为 1% 的情况下,87.8% 地识别出相关模型。当他们在各种现实世界设置下测试模型(例如添加“安全”提示或改变其逐步思考的方式)时,得分甚至更高,达到了 0.995 AUC。
将此结果与他们测试的其他方法(如 LLMmap、LLMPrint 等)进行对比。那些方法在模型被微调或部署方式改变时表现挣扎,往往表现得不比随机猜测好多少。论文表明,这些旧方法过度依赖 AI 生成的具体词汇,而这些词汇很容易改变。Stemma 通过关注底层的决策区域,保持了稳定性。
这意味着什么(以及不意味着什么)
论文非常明确地界定了 Stemma 是什么以及它不是什么。它是一种**黑盒(black-box)**方法,这意味着你不需要看到模型的内部代码或权重;你只需要向它提问并观察它的选择。这使得它在现实世界的审计中具有实用性。
然而,作者也谨慎地指出,这并不是万能灵药。他们指出,Stemma 提供的是统计证据,而非绝对证明。这就像是一项 DNA 检测,它会说“这两者有 99% 的概率相关”,但它本身不能作为法庭判决。他们还警告说,如果攻击者知道 Stessa 使用的具体问题,他们有可能训练自己的模型来针对这些特定问题进行欺骗。但由于 Stemma 使用了庞大的问题池,并能即时筛选出最佳问题,因此这种做法很难实现。
论文还强调了一个局限性:Stemma 目前依赖于多项选择题。如果一个模型弱到无法理解多项选择格式,那么这种方法可能就不起作用。但对于目前绝大多数功能强大的模型来说,这种将开放式的混沌映射到有限决策空间的新方法,似乎是解锁 AI 模型真实家谱的关键。
最后,Stemma 提醒我们,尽管 AI 模型可以戴上许多面具,变换许多声音,但它们的核心逻辑留下的指纹是极难抹去的。通过提出正确的问题并看透表面,我们终于可以开始看清谁才是真正的代码编写者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。