← 最新论文
🤖 machine learning

Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA

本文通过引入“宪制元 STPA”(Constitutional Meta-STPA)来解决分析用于安全分析的 AI 工具这一关键空白,该框架是一种自我验证框架,它将系统理论过程分析(STPA)应用于其自身以推导并执行治理宪法,从而确保受大语言模型(LLM)辅助的分析器经过严格审计,以防止幻觉和不可验证的约束。

原作者: Samuel Tetteh, Udip Shrestha, Joshua R. Waite, Cody Fleming

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Samuel Tetteh, Udip Shrestha, Joshua R. Waite, Cody Fleming

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你制造了一个超级聪明的机器人助手,它的工作是检查其他机器是否存在安全缺陷。它非常擅长发现汽车里的破碎齿轮或泵里的漏气阀门。但问题在于:从来没有人问过,“谁来检查这个机器人?”

这篇论文正是提出了这样一个问题:谁来分析分析器?

作者们意识到,虽然大家都在信任这些用于编写安全报告的 AI 工具,但这些工具本身可能会出现故障。它们可能会捏造虚假的安全规则,忘记记录工作内容,或者给出看似自信实则荒谬的答案。这就像雇佣了一名从不记录线索、有时还会伪造证据的侦探。

自我检查的机器人

为了解决这个问题,团队构建了一个特殊版本的安全工具,让它将显微镜转向自身。他们使用了一种称为 STPA(一种寻找安全风险的严谨方法)的方法,来分析该 AI 工具自身的设计。

这就像是一个机器人构建了自己大脑的地图,找到了薄弱环节,然后根据这些发现为自己编写了一本规则手册。他们并没有仅仅靠猜测来制定规则;而是让工具通过对自身的“安全分析”来生成规则。

两部分的规则手册

该工具最终生成了一份由两个截然不同的层面组成的“宪法”(规则手册):

  1. “工具原则”(行为层): 这些是关于 AI 在执行任务时应如何行动的 21 条规则。例如,“不要捏造安全标准”、“明确说明你无法做到的事情”以及“始终检查你的工作”。
  2. “元安全原则”(治理层): 这些是关于运行 AI 的机器应如何表现的 8 条规则。其中包括“对每一个问题和答案保留永久日志”、“锁定所使用的特定版本的大脑以确保任务中途不发生变化”以及“在通过严格清单检查前,不得让 AI 导出报告”。

大惊喜:它不是魔法,而是肌肉

作者通过让不同的 AI 模型来分析该工具本身进行了测试。以下是他们的发现:

  • 强力模型: 当他们使用最先进的 AI 模型(一个由两个顶尖模型组成的“前沿集成”)时,该工具仅通过观察其自身设计,就成功找到了 21 条行为规则中的 18 条 以及 全部 8 条治理规则
  • 弱力模型: 当使用较弱、较便宜的模型时,它们仅找到了 21 条行为规则中的 12 条 以及 8 条治理规则中的 3 条

核心结论: 问题不在于规则本身,而在于进行分析的那个“大脑”。“宪法”确实有效,但前提是 AI 必须足够聪明,能够发现自身的漏洞。

究竟是什么让 AI 更安全?

团队进行了一项棘手的测试,使用了 20 个“对抗性探测器”——这些是旨在诱导 AI 变得不安全或撒谎的陷阱问题。他们测试了带有不同版本规则手册的 AI:

  • 无规则: AI 的平均安全得分仅为 1.03
  • 通用规则: 添加通用的“保持乐于助人且诚实”的列表完全没有帮助(得分:1.05)。
  • 21 条工具原则: 当他们添加了这 21 条具体的行为规则时,安全得分跃升至 1.85。这是一个 79% 的提升,且具有显著的统计学意义。
  • 8 条治理规则: 添加 8 条治理规则(如日志记录和版本锁定等内容)并未改变这些特定陷阱问题的得分。

教训: 具体的行为规则(即 21 条工具原则)才是防止 AI 在回答中出错的关键。治理规则(即 8 条元安全原则)对于系统(如保留审计追踪)至关重要,但它们本身并不能神奇地让 AI 的文本回答变得更安全。

关于“覆盖率”

作者还研究了 AI 安全领域的一个常见观点:“如果我们只是让 AI 检查更多的项,它就会更安全。”他们测量了 AI 在其分析中“覆盖”了多少规则。

他们发现了一些奇怪的现象:在提示词中加入更多规则并不总是意味着更高的安全覆盖率。

  • 当他们在标准硬件机器(如汽车刹车)上进行测试时,“元安全”规则(关于审计日志和版本的规则)得分是 0/8。AI 没有提到它们,因为汽车本身没有审计日志。
  • 当 AI 分析自身时,得分跳升至 6/8

这证明了“覆盖率”并不是一个可以随意调高的魔法旋钮。它是一个检测器。它告诉你正在观察的是什么样的系统。如果 AI 在谈论审计日志,它正在分析一个 AI 工具;如果它对日志保持沉默,它正在分析一台机器。你不能仅仅通过强迫 AI 说“我检查了日志”来让它变得更安全;日志必须真实存在。

“失误”时刻

作者对他们犯的一个错误也非常坦诚。早些时候,他们认为增加规则会让 AI 发现更多安全问题,呈现出一种线性增长关系(就像服用药物的剂量一样)。但当他们使用严格的固定设置重新进行测试时,这种“剂量反应”的概念消失了。他们发现,随着规则的增加,发现的问题数量实际上是下降或持平的。他们公开了这一“失败”的结果,表明有时 AI 只是变得更加专注,从而停止了胡言乱语,而不是发现了更多问题。

底线

这篇论文并不声称已经“解决”了 AI 安全问题。相反,它构建了一个工具,该工具:

  1. 通过分析自身设计来编写自己的规则手册
  2. 证明了具体的行为规则(21 条工具原则)能让 AI 的回答安全得多(79% 的提升)。
  3. 展示了通用的“保持友善”类规则并无实效。
  4. 开源了所有内容:代码、规则手册和日志,以便任何人都可以重现完全相同的实验。

作者得出结论:如果你正在构建一个 AI 安全工具,你需要具体的行为规则来阻止 AI 产生幻觉,需要治理规则来保留纸质追踪。但你首先需要一个真正聪明的 AI 模型来开展工作。如果没有一个有能力的“大脑”,即使是最完美的规则手册也救不了你。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →