← 最新论文
⚡ electrical engineering

Divergence-based Safety Measure for Large Language Models via Rational Inattention

本文提出了一种针对嵌入输入攻击下大语言模型的新型基于散度的安全性度量方法,该方法利用 Transformer 注意力与理性不注意之间的等价性,在确保隐蔽性的同时,量化最坏情况下的输出分布偏移。

原作者: Anh Tung Nguyen, Quanyan Zhu

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Anh Tung Nguyen, Quanyan Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、博学多才的机器人助手(一个大语言模型,简称 LLM)来帮助你做重要决策。你向它提问,它给你答案。但如果有一个狡猾的黑客,能通过向机器人的“耳朵”(输入数据)里低声传递极其微小、几乎不可察觉的变化,从而诱导它给出危险或错误的答案呢?

这篇论文提出了一种衡量机器人助手针对这类隐蔽手段的安全性程度的新方法。以下是使用简单类比进行的拆解:

1. 核心问题:“耳语”攻击

把机器人的大脑想象成一个文本图书馆。黑客不需要破门而入;他们只需要对机器人正在阅读的词汇进行极其微小、几乎无法察觉的改动。

  • 目标: 黑客希望改变机器人的答案(例如,从“门是开着的”变为“门是锁着的”),且不让你察觉。
  • 挑战: 我们如何知道一个机器人是否“安全”?我们需要一种方法来衡量最坏的情况:黑客能在我们发现之前,对机器人的想法进行多大的改变?

2. 新型“安全计:理性检查

作者创建了一个新的安全计。他们不仅观察最终答案,还观察机器人的思考方式

类比:过度劳累的经理
想象一位经理(机器人)必须阅读大量的邮件(输入文本)来做出决定。

  • 理性忽视(Rational Inattention): 人类无法完美地阅读每一封邮件中的每一个字。我们必须进行“理性忽视”。我们只略读最重要的部分,忽略其余部分,以节省精力。
  • 机器人的“注意力”: 机器人也做类似的事情。它使用一种被称为“Transformer 注意力机制”的方法,来决定句子中哪些词是最重要的。
  • 联系: 论文认为,机器人选择重要词汇的方式,在数学上与人类在疲惫或忙碌时决定关注点的行为是完全一致的。

测量计:
作者构建了一个“理性计”,用来检查:机器人的注意力是在以一种正常的、类人的方式运作,还是正在变得混乱?

  • 如果机器人的表现正常,测量计读数较低(安全)。
  • 如果机器人被误导了,它的注意力会变得分散,测量计数值就会上升。

3. “隐身”规则

该安全性测试有一个严格的规则:攻击必须具有隐蔽性。

  • 想象一个试图偷画的贼。如果他穿着一件霓虹色的亮色套装,会立刻被抓获。
  • “安全度量”问的是: 窃贼能在保持“伪装服”不触发理性计警报的前提下,对机器人的答案做出多大的改变?

论文计算了库尔贝克-莱布勒散度(Kullback–Leibler Divergence,简称 KL 散度)。简单来说,这是一个衡量机器人的“受骗后答案”与“正常答案”之间差异程度的分数。

  • 高分: 机器人的思想很容易被隐蔽攻击扭曲。(不安全!)
  • 低分: 机器人抵御了这种诱导,或者这种诱导过于明显,无法隐藏。(更安全!)

4. 实验:GPT-2 vs. GPT-Neo

作者在两个著名的机器人大脑 GPT-2GPT-Neo 上测试了这个安全计。

  • 他们给这两个机器人施加了相同的“耳语”攻击(即相同的隐形变化预算)。
  • 他们观察了机器人在试图躲避理性计检测的同时,其答案发生了多少变化。

结果:
两个机器人的反应不同。

  • GPT-2 更容易被误导。即使有“伪装”,它的答案也会发生显著偏移。它拥有一个“更易泄露”的安全剖面。
  • GPT-Neo 则更难被误导。即使受到攻击,它也能让自己的答案保持接近正常的状态。

总结

这篇论文不仅仅是在说“黑客很坏”。它构建了一个AI 安全性的温度计

  1. 它将 AI 的注意力机制视为人类有限注意力的体现。
  2. 它利用这一点创建了一个“测谎仪”,用于监测细微的混乱。
  3. 它衡量了在“测谎仪”报警之前,一个 AI 的思想可以被隐藏攻击扭曲到什么程度。
  4. 它证明了某些 AI 模型在面对这些隐蔽手段时,天生比其他模型更“强韧”。

最终目标是帮助工程师为重要工作挑选更安全的机器人,并针对未来的黑客构建更好的防御措施。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →