← 最新论文
📊 statistics

On Surjectivity of Neural Networks: Can you elicit any behavior from your model?

本文证明了现代神经架构的基本组件(如前层归一化和线性注意力)几乎总是满射的,这意味着像 GPT 式 Transformer 和扩散模型这样广泛使用的生成模型在理论上可以生成任何输出,从而揭示了其对对抗性攻击和安全风险的内在脆弱性。

原作者: Haozhe Jiang, Nika Haghtalab

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Haozhe Jiang, Nika Haghtalab

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:你能让机器说出“任何话”吗?

想象你有一个非常先进、经过训练的机器人,它会说话,也会创作图像。你可能会好奇:“是否有一种特定的句子或图片,无论我输入什么或展示什么,这个机器人都永远无法生成它?”

用数学术语来说,这是在询问该机器人是否具有满射性(Surjective)

  • 满射意味着:对于每一个可能的输出(比如一段特定的句子或一张图片),都至少存在一个输入,能让机器人产生该输出。
  • 非满射意味着:在输出的世界中存在一些“禁区”,无论你如何努力,机器人都无法触及这些区域。

这篇论文的作者提出了一个问题:现代 AI 模型是否存在这些“禁区”,还是它们在技术上可以生成“任何东西”?

主要发现:“门始终敞开”

研究发现,对于当今许多最流行的 AI 架构(例如驱动 ChatGPT、图像生成器和机器人控制器的架构),答案是:门始终是敞开的。

他们证明了这些模型几乎总是满射的。这意味着,如果你挑选出任何你能想象到的输出——即使是有害的、危险的或荒谬的内容——在数学上都可以保证存在某种输入,能让模型生成它。

“无限钥匙环”的比喻:
把 AI 模型想象成一把巨大且复杂的锁。通常,我们认为“钥匙”是一个像“你好,最近怎么样?”这样的普通句子。
论文指出,对于这些现代模型,锁的设计方式使得锁芯的所有可能组合(输出)都可以由某把钥匙(输入)打开。 即使那把钥匙看起来像是乱码、秘密代码或格式奇怪的图像,它也是存在的。

他们是如何证明的?(“平滑滑梯”理论)

研究人员并非仅仅靠猜测,而是使用了数学的一个分支——微分拓扑学(Differential Topology)

“平滑滑梯”的比喻:
想象 AI 模型是一个巨大的、平滑的滑梯。

  • 旧的 AI 模型(例如带有简单 ReLU 开关的模型)就像是有尖角或死胡同的滑梯。如果你顺着滑下去,可能会卡在某个角落,永远无法到达底部(某些输出是无法触及的)。
  • 现代 AI 模型(那些带有 Pre-LayerNorm 和 Attention 的模型)则像是完美平滑、带有弧度的滑梯。因为它们如此平滑且连续,数学证明了你总能在滑梯上的某个起点,最终到达底部的任何一个特定位置。

论文特别强调了现代 AI 中使这一现象发生的两个“神奇成分”:

  1. Pre-LayerNorm:一种在处理数据前对其进行归一化的技术。论文证明,将一个函数包裹在这种结构中,使得它不可能“封锁”掉输出的任何部分。
  2. 线性注意力机制(Linear Attention):一种模型观察数据的方式(用于更新、更快的模型),它同样保证了你可以触及任何输出。

这对安全性意味着什么(“越狱”的现实)

论文将这种数学理论与一个非常现实的问题联系起来:越狱(Jailbreaking)

“不可逾越之篱”的比喻:
想象安全团队在动物园周围建了一道篱笆,以防止危险动物(有害的 AI 输出)跑出来。他们训练 AI 变得礼貌,并拒绝不当请求。

  • 旧观点:我们认为,“如果我们把 AI 训练得足够好,它就永远不会翻过这道篱笆。”
  • 论文观点:数学表明,这道篱笆只是幻觉。因为模型的满射性,对于每一种动物,都存在一条翻越篱笆的路径。

这并不意味着寻找这些路径很容易。它可能需要非常奇怪、复杂或隐藏的输入(比如特定的代码或奇特的图像)。但论文证明了,这条路径确实存在。

  • 对于文本:你理论上可以找到一个奇怪的提示词,让一个礼貌的 AI 写出一份制造炸弹的手册。
  • 对于图像:你理论上可以找到一种特定的噪声模式,让图像生成器画出一件危险武器。
  • 对于机器人:你理论上可以找到一系列传感器输入,让机械臂做出伤害他人的动作。

论文并没有说的是什么

严格遵守论文的实际主张非常重要:

  • 它并不表示我们可以轻易找到这些危险的输入。寻找那把“钥匙”在计算上可能非常困难,就像大海捞针一样。
  • 它并不表示目前的安全性训练是徒劳的。安全性训练让“针”变得更难被找到,但它并没有把“针”从草堆中移除。
  • 它并不表示每一款 AI 模型都是如此。论文特别指出,较旧的模型(如简单的 ReLU 激活模型)或特定类型的注意力机制确实存在“死胡同”,即某些输出是不可能实现的。但我们今天使用的现代模型(Transformer、扩散模型等)通常不存在这种情况。

总结

这篇论文传达了一个令人警醒的数学真相:我们无法在数学上保证现代 AI 永远不会产生有害输出。

由于这些模型的构建方式,它们在本质上具备生成任何内容的能力。因此,安全性不能仅仅依赖于模型内部完美的“拒绝机制”。相反,我们必须接受:潜在的危害已经内置于机器的结构之中,我们需要通过其他手段(如过滤器和监控)来管理这种风险,而不是寄希望于模型本身是“天生安全”的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →