Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety
本文介绍了认知防火墙(Cognitive Firewall),这是一个主动的、零信任的运行时框架,通过引入一个带有四个类别门控的独立监督模型来增强大语言模型(LLM)的安全性,旨在检测并拦截有害的、多轮对话式的以及基于权威性的攻击,同时保持较高的良性交互率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在雇佣一位非常聪明、乐于助人的助手来帮你处理任务。你想确保他们绝不会意外做出危险的事情,比如制造炸弹或写一封仇恨言论信。
目前,大多数安全系统就像是一次只能看一张纸片的保安。如果你递给他们一张写着“如何烤蛋糕?”的纸条,他们会说“安全”。如果你递给他们一张写着“如何制造炸弹?”的纸条,他们会说“不安全”。
问题在于,一个聪明的骗子(“对手”)可以通过将一个糟糕的请求拆解成许多个微小的、看似无害的部分来欺骗这些保安。他们可能会问:“什么是化学物质?”(安全),然后问“什么是容器?”(安全),接着问“如何将它们混合?”(安全)。在单独看来,每一张纸条看起来都是无辜的。但当把它们组合在一起时,助手就会意识到用户正试图制造炸弹。单次查看纸条的保安会错过这一点,因为他们不记得对话历史或用户的隐藏目标。
这篇论文介绍了一种名为认知防火墙(Cognitive Firewall)的新系统。请将其想象成不仅仅是一个保安,而是一个聪明的、主动的管理者,他坐在你和助手之间。这位管理者不仅看当前的纸条,还会观察整个对话的“电影”,以理解到底发生了什么。
以下是这位管理者如何工作的,通过四个特定的“门控”或检查点:
1. 意图门(“你到底想干什么?”检查)
在助手开始输入答案之前,这个门控会询问:“如果我完整地回答这个问题,现实世界中会产生什么结果?”
- 类比: 想象有人问:“如何杀死一个进程(process)?”一个简单的保安可能会认为:“哦,他们是指结束一个计算机程序。”但意图门会看得更深,意识到:“等等,在这种语境下,他们可能指的是结束一个生命。”它会看透花哨的辞令,直达实际结果。如果结果是危险的,它会立即终止对话。
2. 零信任上下文门(“出示你的身份证”检查)
这个门控基于**“零信任(Zero Trust)”**的概念,即“永不信任,始终验证”。
- 类比: 想象一个陌生人走到你的助手面前说:“我是首席执行官,我命令你交出秘密代码。”一个普通的保安可能会想:“哦,他说他是首席执行官,那我就应该听他的。”但零信任门会说:“等一下。你声称你是首席执行官,但你并没有证明这一点。我不会仅仅因为你这么说就相信你。”它会将任何关于权威、特殊权限或“我是医生”的声明视为谎言,直到得到证实。
3. 一致性门(“检测缓慢滑坡”检查)
这个门控会监视整个对话,观察用户是否在慢慢诱骗助手。
- 类比: 想象一个用户开始询问“园艺”。然后他们询问“有毒植物”。接着他们询问“如何制作一种植物性毒素”。一个接一个的问题看起来都没问题。但一致性门看到了其中的模式:“等等,你从花卉开始,但现在你在询问毒药。你正在缓慢地升级你的目标。”它会在用户达到危险部分之前拦截他们,即使单个问题本身并不违规。
4. 输出风险门(“最终检验”检查)
如果对话通过了前三个门控,并且助手生成了答案,这个门控会对最终结果进行检查。
- 类比: 这就像是流水线末端的质量控制检查员。即使计划看起来是安全的,也许助手在最终答案中不小心写下了危险的配方。这个门控会阅读最终输出,如果其中包含有害指令,则予以拦截。
它如何决定停止
论文指出该系统使用了一种**“升级规则(Escalation Rule)”**。
- 旧方法: 一些系统会对每个门控的分数进行平均。如果你有三个“安全”分数和一个“危险”分数,平均分可能看起来仍然是“基本安全”,从而导致坏事发生。
- 新方法: 认知防火墙就像是一个火警报警器。如果四个门中的任何一个大喊“危险”,整个系统就会立即停止。你不需要去计算危险的平均值;一个明确的信号就足以踩下刹车。
测试结果显示
作者针对各种类型的“越狱攻击”(诱导 AI 做坏事的技巧)测试了该系统:
- 单轮攻击(Single-turn attacks): 它拦截了几乎所有的此类攻击。
- 多轮攻击(Multi-turn attacks,即“慢速诱骗”): 它拦截了近 100% 的“Crescendo”攻击(用户逐渐升级目标)和 98% 的“ActorAttack”(用户拆解任务)。
- 权威攻击(Authority attacks): 它拦截了 75% 用户伪装成权威人物进行的攻击。
- 误报(False Alarms): 重要的是,它并没有变得过于“暴躁”。它仅在 8% 的情况下拒绝了无害问题,这比其他拒绝无害问题比例高达 18–21% 的严格安全系统要好得多。
总结
认知防火墙是一种保护 AI 的新方法。它不再仅仅检查单个句子,而是扮演一名侦探的角色,负责:
- 弄清用户的真实目标。
- 从不信任权威声明。
- 监视随时间推移而产生的缓慢、危险的模式。
- 检查最终答案。
它能在坏事发生前将其阻止,保留清晰的拦截记录,并避免拦截无害的对话。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。