← 最新论文
🤖 AI

SAGE: Safety-First Defense-in-Depth Guardrails for Verified Lifecycle Control of High-Impact Generative AI

本文介绍了 SAGE,一种面向高影响力生成式人工智能的、以安全为先且授权分离的架构,该架构通过形式化验证和全面的深度防御框架优先考虑缓解灾难性风险,并通过一项多模型研究进行了验证,该研究展示了较低的有害合规率以及领先 AI 快照之间的特定性能对比。

原作者: Mahdi Eslamimehr

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Mahdi Eslamimehr

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

跳跃前的安全网

想象一下,你正在构建一个能够编写代码、提供医疗建议或解释复杂科学知识的机器人。这就是生成式人工智能(Generative AI)的世界——这项技术创造的是全新的内容,而非仅仅搜索旧有的答案。但问题在于:如果这个机器人变得过于“有创意”,它可能会在无意中协助某人制造炸弹、入侵银行或传播危险的谎言。这不仅仅是关于机器人是否“没礼貌”的问题,而是为了防止灾难性伤害

为了阻止这种情况,科学家们使用了护栏(Guardrails)。你可以把这些护栏想象成机器人的交通规则。通常情况下,护栏就像是夜店门口检查身份证的保镖:如果你看起来很可疑,你就进不去。但如果保镖漏掉了什么呢?如果机器人找到了后门怎么办?这就是**深度防御(Defense-in-Depth)**的概念。与其只依赖一个保镖,不如建立一道围栏、一条护城河、一只看门狗和第二层保镖。你通过层层叠加安全措施,确保即使其中一层失效,下一层也能拦截问题。

大家都在问一个大问题:哪种机器人才是真正最安全的? 是那个经常说“不”的机器人最好,还是那个会对坏事说“不”但仍能对好事提供帮助的机器人更好?我们需要一种方法来测试这些机器人,不仅要看它们遵循规则的能力,还要看它们如何处理从构建到使用的整个生命周期,确保安全性是重中之重,甚至高于速度或利润。


SAGE 系统:安全至上的超结构

由此诞生了 SAGE(面向验证生命周期控制的安全优先深度防御护栏)。请不要仅仅把 SAGE 看作是一份规则清单,而要把它看作是一个高科技、不可破解的 AI 安全保险库。作者们(来自 Quandary Peak Research 的研究人员)认为,安全性不应是事后才考虑的补救措施或简单的过滤器,相反,它必须成为“掌控者”。

想象一下,你正在进行一项非常严肃的科学实验。在启动机器之前,你必须签署一份发布清单(Release Manifest)。这就像一份神奇且不可篡改的合同,上面写着:“我们已经检查过这台机器,我们已经针对坏人进行了测试,并保证它不会爆炸。”如果机器发生哪怕极其微小的变化,这份合同就会失效,机器也会随之关闭。SAGE 使用这些经过签名的清单,以确保只有安全的 AI 版本才能运行。

一旦 AI 开始运行,SAGE 就会扮演像拥有超能力的交警的角色。它不仅观察你提出的问题,还会观察答案背后的风险

  • 安全闸门(The Safety Gate): 如果 AI 认为某个答案可能会帮助某人进行可怕的行为(如网络攻击或化学武器制造),它就会猛地关上闸门。无论这个答案多么有用或快速,只要它具有危险性,结果就是坚决的“不”。
  • 安全网(The Safety Net): 如果 AI 不确定,它不会瞎猜。它会切换到“安全模式”,给出一个平庸但安全的答案,或者请求人类先进行检查。
  • 时光机(The Time Machine): 如果 AI 在工作过程中出了问题,SAGE 拥有一个**回滚(Rollback)**按钮。它就像电子游戏中的“撤销”功能,能瞬间将系统恢复到出错发生前那个已知安全的稳定状态。

机器人大战:研究发现

为了观察这个系统在现实世界中的表现,研究人员设置了一个大规模的模拟测试。他们没有只问机器人一个问题,而是向 10 个不同的 AI 快照(来自 OpenAI、Anthropic 和 Google 的不同版本模型)发送了 84 个特定的、棘手的案例。他们对每个机器人采取了完全相同的对待方式,就像一场公平的比赛,所有人都在同一条赛道上同时奔跑。

以下是他们的发现:

  1. “不”并不是唯一的衡量标准: 许多人认为最安全的 AI 是那些拒绝回答一切问题的 AI。但研究发现,真正的“最安全”机器人实际上是那些既能对坏请求说“不”,又能对有益且无害的请求说“是”的机器人。
  2. 获胜者: 表现最好的模型是 Claude Haiku 4.5Claude Sonnet 4.6 以及两个版本的 Gemini。这些模型在识别并拒绝危险方面表现得极其出色,同时在处理普通问题时也非常乐于助人。它们的“平衡护栏得分”(一个结合了安全性与帮助性的评分)接近完美,约为 0.99 到 1.00
  3. 挣扎者: GPT-5 miniGPT-5 nano 模型仍然非常安全(它们很少给出危险的答案),但它们显得有些笨拙。它们更频繁地拒绝回答无害的问题,而且在尝试提供安全的替代方案时,效果也不尽如人意。它们的得分较低,约为 0.84 到 0.86
  4. 令人惊讶的发现: 获胜者与失败者之间最大的区别不在于失败者是否危险——事实上,失败者也相当安全!区别在于,获胜者更有用,并且更擅长将话题引导至安全领域

论文的内容(以及未涉及的内容)

研究人员非常谨慎,并未宣布最终的胜利。他们发现,虽然在这次特定的测试中,某些机器人的表现明显优于其他机器人,但就实际防止伤害而言,这种差异并不巨大。事实上,对于最危险的问题,几乎所有的机器人都能很好地做到说“不”。

然而,论文明确排除了以下几种情况:

  • 这不是最终排名: 你不能永远说“OpenAI 最差”或“Anthropic 最好”。这些只是特定版本在特定日期的快照。
  • 这不是一种保证: 该研究对每个机器人只提出了一个问题。在现实世界中,恶意行为者可能会尝试成千上上万种诡计。论文承认,在他们的测试中,“有害合规性”(即机器人实际做出坏事的频率)非常低,但这并不意味着机器人不可能在更复杂的现实场景中失败。
  • 这不是魔力护盾: SAGE 系统是一个蓝图。它是一套关于如何构建安全 AI 的指令集,但论文并未实际部署该系统去运行一家真实的商业公司。它是一个设计方案,而非一个成品。

核心结论

主要的启示是,安全性不仅仅是做一个拒绝一切请求的“暴躁机器人”。最好的安全系统是一个分层的堡垒:它在 AI 开始运行前进行检查,在工作时进行监视,并在出错时拥有修复计划。

研究表明,最优秀的 AI 模型是那些能够在保持聪明且乐于助人的同时,又不具备危险性的模型。得分最高的机器人是那些能够分辨坏请求与好请求,既能坚定拒绝坏请求,又能对好请求保持友好与实用的机器人。论文总结道,我们需要持续测试,不断叠加安全网,并且永远不要假设仅仅因为一个机器人通过了一次测试,它就已准备好面对现实世界。安全性是一场旅程,而非终点。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →