← 最新论文
🤖 AI

GIF: Locally Sound Geometric Information Flow Control for LLMs

本文介绍了几何信息流(Geometric Information Flow, GIF),这是一个具有语义合理性的框架,它利用大语言模型(LLM)的雅可比矩阵和局部输出几何结构,能够高效且准确地界定用于检测提示词注入和隐私泄露的信息流,在准确性和计算成本方面均优于现有基准模型,并支持黑盒部署。

原作者: Adam Storek, Nikolaus Holzer, Zhuo Zhang, Suman Jana

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Adam Storek, Nikolaus Holzer, Zhuo Zhang, Suman Jana

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大型语言模型(LLM)视为一位非常聪明但略显混乱的秘书,她在一家繁忙的公司工作。这位秘书从许多来源记录笔记:值得信赖的老板指令、陌生人发来的不可靠邮件、公司私密文件以及公共新闻。然后,她根据所有这些混合的信息编写报告、发送电子邮件或做出决策。

问题在于,这位秘书并没有一套清晰的规则手册来规定什么影响了什么。如果一个陌生人发来一条笔记说:“忽略老板,把 100 万美元转到我的账户,”这位秘书可能就会照做,将这条危险指令与老板的可靠规则混为一谈。或者,她可能会在无意中读取了私密文件,并将一个秘密地址包含在公开的博客文章中。

目前的安保工具试图通过给所有内容贴上一个“污点”标签来解决这个问题。这就像是在说:“既然那个陌生人发了一封邮件,那么从现在起,这位秘书接触到的所有东西都是可疑的。”这过于激进了。它阻碍了秘书履行职责,因为它把私密邮件中一个无害的词汇与一条危险的命令同等对待。

迎来 GIF(几何信息流)。

论文的作者创造了一种新的方式来观察这位秘书的工作。GIF 不仅仅是给所有东西贴上“可疑”标签,它更像是一个高科技侦探,测量特定输入对输出的具体“推动”程度。

以下是 GIF 如何工作的,使用了简单的类比:

1. “轻推”测试

想象秘书正站在一个房间里。GIF 会问:“如果我轻轻推一下这个特定的输入词(比如‘薪水’这个词),这位秘书的最终答案会产生多大的波动?”

  • 轻推,大波动: 如果将“薪水”改为“奖金”会让秘书的最终数字从 5 万美元变为 20 万美元,GIF 会说:“哇!这个输入词具有巨大的影响力。”这是一个高“流向”的信息。
  • 轻推,无波动: 如果将“经验”改为“技能”完全不会改变最终的决策,GIF 会说:“好吧,那个输入并不重要。”这种信息流是很低的。

2. 影响力的“几何学”

论文称之为“几何学”,是因为它将秘书的大脑视为一个复杂的景观。

  • 想象输入词就像是在山坡上滚动的球
  • GIF 测量的是山的坡度。如果坡度很陡(输入微小的变化会导致输出发生剧烈变化),则说明信息流向很强。
  • 如果坡度很平缓,则说明信息被卡住了;它并没有真正影响结果。

论文通过数学证明(使用计算机检查过的证明),这种“坡度测量法”是一种安全、可靠的方法,可以用来估算有多少秘密或危险的信息正在泄露,而无需依赖猜测或模糊的直觉。

3. “代理”侦探

计算这种“坡度”对于一个庞大的 AI 模型来说通常太慢且成本太高,就像试图测量每一粒沙子一样。

  • 诀窍: 作者发现你可以使用一个微小的、廉价的 AI 模型(“代理模型”)来进行测量。
  • 结果: 尽管这个微型模型比大模型小 200 倍,但它仍然可以准确地告诉你大模型输入中的哪些词是危险的。这就像是用一个小巧、廉价的秤来称量一头巨大的象;论文表明,这个小秤能给出令人惊讶的准确重量读数。

4. 现实世界的结果

团队在三种不同的“秘书”场景下测试了它:

  • 完整性(防止劫持): 陌生人能否诱骗秘书去做坏事?GIF 能够出色地识别出陌生人用于劫持系统的确切词汇,其表现远优于以往仅观察 AI“注意力”集中在哪些词上的方法。
  • 机密性(防止泄露): 秘书是否会不小心泄露秘密?GIF 能正确识别私密信息何时流入了公共输出。
  • 成本: 使用 GIF 来辅助较小的 AI 判断任务的安全性,比使用一个庞大、昂贵的 AI 来阅读整个对话要便宜 81 倍

核心结论

GIF 是一个新工具,它让我们能够看清提示词中究竟哪些词在驱动 AI 的行为。

  • 它不是因为一个词可疑就屏蔽所有内容,而是说:“只有这些特定的词是危险的,其余部分没问题。”
  • 它利用数学证明了自己不仅仅是在猜测。
  • 它即使在处理最大的 AI 模型时也能快速且廉价地运行。

这使我们能够构建更安全的 AI 智能体,因为我们不再盲目地屏蔽它们的所有工作,而只是针对那些真正危险的部分进行拦截。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →