← 最新论文
💻 computer science

Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats

本文提出了一种统一的、以验证为中心的防御框架,该框架通过对用户提示意图和模型响应危害进行联合评估,以有效地检测并缓解对抗性攻击,并在多个威胁类别中展示出优于现有单侧防御的卓越性能。

原作者: Poojitha Thota, Yun Lei, Santhosh Thangaraj, Siddhartha Reddy Jonnalagadda, Shirin Nilizadeh

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Poojitha Thota, Yun Lei, Santhosh Thangaraj, Siddhartha Reddy Jonnalagadda, Shirin Nilizadeh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、乐于助人的机器人助手(一个大语言模型),你用它来写邮件、写代码或回答问题。为了确保这个机器人是安全的,你在门口安排了一名保安,负责检查人们提出的问题以及它给出的回答。

问题:“人格分裂”攻击
该论文指出,目前的“保安”是通过单向镜来看待对话的。他们要么只检查问题(提示词),要么只检查回答(响应),很少同时检查两者。

这产生了一个坏人可以利用的漏洞,作者称之为**“意图与伤害的分离”(Intent-Harm Separation)**。

把这想象成间谍试图将炸弹走私进一座安全建筑:

  • 旧方法(仅检查提示词的保安): 间谍走到保安面前说:“我是来参加关于如何制造炸弹的安全培训研讨会的。”保安查看了请求,发现其框架是“教育性质”的,于是放行了。保安从未看到炸弹,因为炸弹还没有被制造出来。
  • 旧方法(仅检查响应的保安): 间谍进入内部,机器人制造出了炸弹并递交过去。出口处的保安看到了炸弹并拦截了它。但此时损害已经造成;机器人已经完成了制造过程。
  • 真正的危险: 有时,请求看起来很无辜(“写一个关于反派的故事”),但机器人的回答实际上是关于如何实施犯罪的分步指南。或者,请求看起来很危险,但机器人的回答其实是对为什么该行为危险的无害解释。

目前的防御措施往往会错过这些情况,因为它们只观察对话的一侧。

解决方案:“三人陪审团”
作者提出了一种名为**“提示词-响应验证”(Prompt-Response Verification)**的新型安全系统。他们没有使用单个保安,而是使用了一个由三名专门的“分析师”组成的团队,像陪审团一样在机器人的回答展示给用户之前,决定对话是否安全。

以下是这个“三人陪审团”的工作方式:

  1. 任务分析师(“意图侦探”):

    • 职责: 查看用户的提问。
    • 问题: “这个人是在试图欺骗机器人吗?他们是在寻求帮助完成学校项目,还是在索要某些坏东西?”
    • 类比: 就像一名检查人员身份和陈述以查看其是否有隐藏动机的侦探。
  2. 安全分析师(“伤害检查员”):

    • 职责: 查看机器人的回答。
    • 问题: “这个回答是否包含炸弹、钓鱼邮件或病毒?它真的危险吗?”
    • 类比: 就像一名爆破小组技术人员正在检查机器人持有的包裹。
  3. 法官(“调解员”):

    • 职责: 倾听侦探和检查员的意见。
    • 问题: “侦探说这个故事很可疑,但检查员说包裹里是空的。或者,侦探说这是一个学校项目,但检查员说包裹里装满了炸药。我们该怎么办?”
    • 类比: 法官权衡双方的证据。如果包裹里装满了炸药,法官会拦截它,即使那个人的说法听起来很无辜。如果故事很可疑但包裹是空的,法官可能会让其通过。

他们如何交流(两轮对话机制)
这三个人不仅仅是表达观点,他们还有一套结构化的对话流程:

  • 第一轮: 侦探和检查员各自独立撰写报告。
  • 第二轮: 他们阅读彼此的报告。如果检查员说:“等等,这看起来像个炸弹,”侦探可能会意识到:“噢,我原以为这只是个故事,但也许他们正试图把炸弹藏在故事里。”随后他们会修正自己的观点。
  • 最终决定: 法官做出最终裁决,决定是允许(显示回答)还是拦截(停止回答)。

他们的研究发现
研究人员针对五种类型的恶意行为测试了该系统:

  1. 越狱(Jailbreaks): 试图诱导机器人忽略其规则。
  2. 提示词注入(Prompt Injection): 试图植入秘密指令。
  3. 网络钓鱼(Phishing): 试图制作虚假的邮件或网站来窃取密码。
  4. 恶意代码(Malicious Code): 要求机器人编写计算机病毒。
  5. 有害内容(Harmful Content): 仇恨言论、骚扰或危险指令。

结果:

  • 更高的捕捉率: 新的“三人陪审团”系统比旧有的“单保安”系统捕捉到了更多的坏人。他们将成功率从约 90% 提高到了 95%。
  • 更少的错误: 旧系统经常会拦截无害的内容(例如,一位老师为了向学生演示而询问钓鱼案例)。新系统能更好地分辨“坏请求”与“安全请求”之间的区别,将误报率降低了一半。
  • 更难被攻破: 即使坏人知道安全系统由三个人组成,并试图专门针对他们进行欺骗,这个“三人陪审团”仍然比旧系统更难被愚弄。

权衡(Trade-off)
论文承认,该系统需要更多的时间和计算资源(就像进行陪审团讨论而不是保安快速点头一样)。然而,对于安全至关重要的高风险场景,为了阻止危险内容的流出,投入这些额外的时间是值得的。

总结
这篇论文的核心观点是:“不要只检查问题,也不要只检查回答。要将整个对话结合起来进行检查,利用一个会对意图和伤害进行辩论的团队,以确保我们不会让危险的东西从缝隙中溜走。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →