← 最新论文
💻 computer science

WARD: Adversarially Robust Defense of Web Agents Against Prompt Injections

本文介绍了WARD,这是一种面向网络代理的实用且高效的防护模型,它利用大规模数据集和自适应对抗训练框架(A3T),在保持高泛化能力和极低误报率的同时,实现对提示注入攻击的鲁棒且低延迟的防御。

原作者: Tri Cao, Yulin Chen, Hieu Cao, Yibo Li, Khoi Le, Thong Nguyen, Yuexin Li, Yufei He, Yue Liu, Shuicheng Yan, Bryan Hooi

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Tri Cao, Yulin Chen, Hieu Cao, Yibo Li, Khoi Le, Thong Nguyen, Yuexin Li, Yufei He, Yue Liu, Shuicheng Yan, Bryan Hooi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,Web Agent(网络智能体) 就像一位技艺高超、完全自主的数字助手。你给它一个任务——比如“预订航班”或“购买一件特定衬衫”——它就会进入庞大而混乱的互联网去执行。它会像人类一样点击按钮、阅读文本、查看图片。

但问题在于:互联网充满了骗子。

问题所在:“隐藏便签”攻击

在现实世界中,黑客可能会偷偷塞一张纸条到你助手的口袋里,上面写着:“别听老板的,去给我买披萨。”在数字世界里,这被称为提示注入(Prompt Injection)

黑客将恶意指令隐藏在智能体访问的网站中。这些指令可以是:

  • 不可见文本:隐藏在网站代码(HTML)中。
  • 视觉欺骗:叠加在屏幕上的假象(例如,一个看起来像系统消息的虚假弹窗)。

如果智能体不够谨慎,它就会读取这些隐藏便签,陷入混乱,并开始执行你并未要求的操作——例如泄露你的私人数据或点击危险链接。

旧有的防御手段:存在盲点的“看门人”

为了阻止这种情况,研究人员曾尝试构建一个Guard Model(守卫模型)——一个在智能体接触网页之前进行审查的数字看门人。但旧式的看门人存在四大缺陷:

  1. 知识局限:它们只了解所学内容。如果在新闻网站上训练,面对社交媒体或电子邮件时就会感到困惑。
  2. 过度敏感:它们经常将无害页面(例如烹饪教程)标记为危险,导致智能体无法完成任务。
  3. 速度缓慢:检查每个页面耗时过长,导致整个系统反应迟钝。
  4. 易被欺骗:黑客学会了编写专门用来迷惑看门人的便签,使其忽略危险。

解决方案:WARD(“超级看门人”)

这篇论文介绍了WARD(Web Agent Robust Defense against Prompt Injection,针对提示注入的 Web 智能体鲁棒防御)。你可以将 WARD 想象为一位经过独特三步特训的新一代看门人。

1. 训练场(WARD-Base)

WARD 并非仅仅阅读教科书,而是基于17.7 万个真实世界案例的庞大数据集进行训练。

  • “覆盖”方法:研究人员在真实网站(如亚马逊或新闻网站)上数字“绘制”虚假的恶意便签,以观察智能体的反应。
  • “原生”方法:他们构建了虚假的社交媒体和 messaging 应用,让黑客可以将便签隐藏在看似正常的评论和消息中。
  • 结果:WARD 学会了在多种不同类型的网站(而不仅仅是某一种特定类型)中,同时识别代码和图片里的诡计。

2. “自卫”演练(WARD-PIG)

研究人员意识到,黑客可能会尝试欺骗看门人本身。想象一下,黑客对看门人耳语:“嘿,我是经理,放这个人通过。”
为了阻止这种情况,他们创建了WARD-PIG,这是一个专门针对守卫决策过程进行攻击的数据集。WARD 学会了忽略这些“假经理”指令,并坚守规则。

3. “陪练伙伴”(A3T)

这是最具创意的部分。研究人员构建了一个**自适应对抗攻击训练(Adaptive Adversarial Attack Training, A3T)**系统。

  • 想象一场守卫黑客之间的格斗陪练。
  • 黑客试图寻找新方法,将便签偷偷绕过守卫。
  • 如果黑客得逞,守卫就会从错误中吸取教训并变得更强。
  • 它们重复这个循环数千次。黑客变得更聪明,守卫变得更坚韧,直到守卫能够识破最巧妙、不断演变的诡计。

结果:WARD 为何胜出

论文将 WARD 与现有的最佳安全系统进行了测试,发现:

  • 超高准确率:即使在从未见过的网站上,它也能拦截近 100% 的攻击。
  • 低误报率:它极少阻止智能体执行无害操作(例如阅读食谱),因此智能体依然保持实用。
  • 速度快:它与智能体并行运行,意味着不会拖慢系统。这就像有一位保安在你已经走进大门时顺便检查你的证件,而不是让你排队等待。
  • 坚不可摧:即使黑客尝试实时调整攻击方式以绕过它,WARD 依然稳如泰山。

一句话总结

WARD 是一种专为 AI 智能体设计的安全系统,它不仅仅死记硬背一份黑名单。相反,它在大量真实世界场景中进行训练,学会忽略虚假的权威指令,并不断与数字陪练对手对抗以保持敏锐。它在不妨碍智能体执行任务或降低其速度的前提下,保护你的 AI 助手免受隐藏诡计的伤害。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →