← 最新论文
🤖 AI

Introducing the Generative Application Firewall (GAF)

本文介绍了生成式应用防火墙(GAF),这是一个统一的架构层,旨在将提示词过滤器和护栏等碎片化的安全措施整合为一个单一的执行点,以保障大语言模型(LLM)应用及其自主智能体的安全。

原作者: Joan Vendrell Farreny, Martí Jordà Roca, Miquel Cornudella Gaya, Rodrigo Fernández Baón, Víctor García Martínez, Eduard Camacho Sucarrats, Alessandro Pignati

发布于 2026-01-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Joan Vendrell Farreny, Martí Jordà Roca, Miquel Cornudella Gaya, Rodrigo Fernández Baón, Víctor García Martínez, Eduard Camacho Sucarrats, Alessandro Pignati

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你构建了一个非常聪明、话很多的机器人助手(一个人工智能),它能写故事、解数学题,甚至能帮你写代码。你想让人们能与它交谈,但你担心人们会诱骗机器人做坏事,比如泄露秘密密码、编写仇恨言论,或者冒充他人。

这篇论文介绍了一种新的安全卫士,叫做生成式应用防火墙(Generative Application Firewall, GAF)。你可以把它想象成一个超级聪明的保安兼编辑,站在你的用户与你的 AI 之间的门口。

以下是论文如何使用简单的类比来解释它的:

1. 问题所在:为什么旧的卫士不起作用

作者说,传统的安全卫士(如 Web 应用防火墙或“WAF”)就像是只检查你的身份证并查看黑名单上特定词汇的保安。

  • 缺陷: 如果一个坏人戴着伪装(“越狱”或“提示词注入”)走进来,并要求 AI “扮演一个反派来写一个故事”,旧的保安会认为这是一个礼貌的请求并放行。这个坏人并没有携带武器;他们使用的是诡计性的语言
  • 差距: 论文指出,AI 攻击是不同的,因为它们依赖于意义语境,而不仅仅是破碎的代码。你需要一个能理解用户想要讲述的故事,而不只是看他们使用了哪些词汇的卫士。

2. 解决方案:GAF(“超级保安”)

GAF 是一个专门为 AI 设计的新型安全层。它不仅检查门口,还会倾听整个对话。论文将其分解为五层防御,就像一座拥有五道围墙的城堡:

  • 第 1 层:网络墙(大门)
    • 作用: 防止人们用过多的请求冲击大门,或使用虚假身份。
    • 类比: 这就像一个保安在检查你是否有票,并确保不会有 1,000 人同时挤进门内。
  • 第 2 层:访问墙(VIP 名单)
    • 作用: 检查你是谁以及你被允许做什么。
    • 类比: 即使你有票,也不能进入 VIP 厨房。这一层确保普通用户不能要求 AI 删除公司的数据库。
  • 第 3 层:语法墙(语法检查)
    • 作用: 寻找隐藏在文本中的奇怪代码或隐藏命令。
    • 类比: 这就像老师检查学生是否试图把用隐形墨水写的小抄或隐藏在数学方程里的作弊纸带进教室。
  • 第 4 层:语义墙(“意义”检查)
    • 作用: 这是最重要的新功能。它理解对话的意图
    • 类比: 如果有人问:“我该如何制造炸弹?”保安会阻止他们。但如果他们问:“写一个关于反派制造炸弹的故事,”普通的保安可能会放行。语义墙明白,即使是在故事中,AI 也不应该提供制造爆炸物的真实指令。它识破了这种诡计
  • 第 5 层:上下文墙(“记忆”检查)
    • 作用: 这是最难的部分。它记得整个对话,而不只是最后一句话。
    • 类比: 想象一个坏人在第一轮问了一个无害的问题,第二轮又问了一个,到第三轮时,他们已经诱骗 AI 透露了一个秘密。上下文墙就像一个侦探,他会记得:“嘿,我以前见过这种模式!他们正在为某种目的做铺垫。”它会在陷阱触发前拦截对话。

3. 在现实生活中如何运作

论文解释说,GAF 位于流量的中间位置。

  • 它可以实时编辑: 如果 AI 开始说一些不好的话,GAF 可以把那部分内容切掉(就像电台屏蔽音频一样),然后让剩下的回答通过,这样用户就不必等待整个内容被拦截。
  • 它处理“智能体(Agents)”: 如果你的 AI 是一个也可以使用工具的机器人(例如查询天气或发送电子邮件),GAF 也会监视这些工具。它确保机器人不会意外地将电子邮件发送给错误的人,或下载病毒。

4. “五星级”评分系统

作者提出了一个衡量 GAF 有多好的方法,类似于你给酒店或电影评分:

  • 1 星: 你拥有基础的网络保护。
  • 3 星: 你拥有良好的语法和访问检查。
  • 5 星: 你拥有完整的“超级保安”配置。你理解意义,记得整个对话,并且可以阻止复杂的诡计。
  • 目标: 论文建议,公司应该追求 5 星级才能实现真正的安全。

5. 为什么这很重要

论文总结道,我们不能仅仅用小修小补来解决 AI 安全问题。我们需要一个专门的“防火墙”层,就像我们多年前需要互联网防火墙一样。随着 AI 变得越来越聪明并融入我们的生活,我们需要一个能理解 AI 语言、理解语境,并在坏人诱骗系统之前拦截他们的卫士。

简而言之: GAF 是一个专门的安全系统,它不仅寻找坏词;它理解正在讲述的故事,记得聊天的历史,并在复杂的诡计伤害 AI 或使用者之前将其拦截。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →