What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models
本文揭示了当前的合规检测器存在“规则盲视”问题,即无法真正依赖既定的监管规则而非表面特征,并证明了即使是所提出的无需训练的内部合规评分(ICS)也缺乏针对平凡基准线和自适应攻击的鲁棒性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数字世界中,大型语言模型充当着生成文本的强大引擎,从起草电子邮件到回答复杂问题。然而,当这些工具被用于金融、医疗或法律等受监管领域时,它们必须遵循严格的书面规则。例如,银行可能会有一项政策,规定个人数据必须在九十天内删除。为了确保 AI 遵守这一规定,公司通常会部署“护卫模型”(guard models)——即专门训练的分类器,用于扫描 AI 的输出并标记任何违规行为。人们希望这些护卫能够阅读提供的特定规则,并检查 AI 的答案是否符合该规则。如果护卫工作正常,它应该只在特定规则被违反时才标记违规,而不是仅仅因为话题听起来有风险。
来自 Lexsi Labs 的一个研究小组致力于测试这些合规监控器是否真的理解它们应该执行的规则。他们调查了一种他们称之为“规则盲性”(rule blindness)的现象。这种情况发生于检测器无论其应当检查哪条规则,都会给出相同的判定。想象一下,博物馆的一名保安因为看到游客提着红色的包就拦截他们,并不是因为禁止携带红色的包,而是因为保安仅仅是将红色与危险联系在了一起。如果博物馆将规则改为禁止蓝色包,一个具有规则盲性的保安仍会拦截红色的包,而忽略蓝色的包,完全错过了新的指令。研究人员想知道,保护我们数据的数字护卫是否也正遭受着同样的问题。
该团队首先测试了各种现有的护卫模型和激活探针(activation probes)——即一种窥视 AI 内部运作机制以猜测其意图的工具。他们使用了一种反事实测试(counterfactual testing)的方法,这种方法通过以特定方式改变输入来观察系统的反应。在实验中,他们选取了一个数据保存了四百天的场景,这显然违反了九十天的规则。随后,他们将那条九十天的规则替换为完全无关的其他规则,甚至直接删除了规则。令人惊讶的是,即使在规则不存在或被更改的情况下,护卫模型标记违规的频率和置信度依然保持不变。这些检测器追踪的是场景本身——即数据保存时间过长这一事实——而不是使之成为违规行为的具体规则。这种失败并不局限于某一种类型的模型;它出现在那些根本看不到规则的固定安全性分类器中,也出现在专门设计用于阅读并遵循自定义规则的复杂“策略调节型”(policy-conditioned)护卫中。其中一个护卫能正确引用规则在文本中的位置达 91% 到 95% 的时间,但当规则被替换为一个允许该行为的宽松规则时,其最终判定几乎没有变化。
为了理解这些系统究竟在阅读什么,研究人员构建了一个全新的、专门设计的基准测试。他们创建了一个测试,其答案完全取决于特定规则与特定场景之间的相互作用,从而确保规则文本或场景文本本身都无法预测结果。例如,一条规则可能规定银行可以简化金额在不足一千美元账户的检查,而另一条规则则将限额设为五千美元。如果一个场景描述的是一个拥有两千美元的账户,那么判定结果完全取决于哪条规则处于激活状态。当他们在这种消除干扰的基准测试上运行测试时,他们尝试过的每一个高效检测器(包括他们自己的新工具)的表现都不比随机猜测好。唯一成功的系统是一个被允许进行逐步推理、在给出答案前先分解问题的大型语言模型。这表明,那些快速、自动化的检测器并不是在将规则与场景进行组合,而是在根据文本的表面特征识别一种广泛的“违规”信号。
随后,研究人员引入了一种新的、无需训练的工具,称为“内部合规评分”(Internal Compliance Score)。这种方法直接读取 AI 的内部激活信号,仅需十对示例即可完成校准。它极其廉价且快速,不需要重新训练,也不需要额外的处理步骤。他们发现,该工具在对候选响应进行排序方面表现出色,有助于从一系列选项中选出最合规的答案。在测试中,它将指令遵循任务的通过率提高了五个百分点。然而,困扰其他护卫的同一种规则盲性也影响了这个新评分。当规则被删除或更换时,该评分保持不变。该工具实际上是在测量一种普遍的风险感,而非对特定书面规则的遵循。此外,研究人员发现这种优势是脆弱的;一个聪明且具有适应性的攻击可以通过在响应末尾添加几个特定的词汇,轻易地让评分降至随机水平。
这项研究还揭示了当前衡量合规性时存在的深层问题。研究人员审计了七个用于测试这些系统的公开基准测试,发现其中四个是“词汇退化”(lexically degenerate)的。这意味着,关于响应是否合规的标签本身就内置在文本中,通常是通过场景的编写方式或判定的叙述方式实现的。一个仅仅通过计数单词、而不理解任何规则的简单计算机程序,就能以极高的准确率解决这些基准测试。这意味着,以往许多关于模型遵循规则能力的说法,实际上只是关于其识别特定单词或句子结构的能力。研究人员得出结论:虽然这些检测器对于排序和筛选响应是有用的,但不能依靠它们来进行基于特定规则的法律或审计决策。它们提供了规则特定性保障的假象,但实际上,它们对于其旨在执行的规则是盲目的。论文最后发布了用于这些测试的工具和协议,以便他人可以在这些系统投入实际应用之前,检查其是否存在同样的盲性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。