← 最新论文
💻 computer science

The Security Budget of Code LLMs: An Information-Theoretic Capacity-Security Bound

本文建立并从实证角度验证了一个信息论边界,证明了代码大语言模型是在一个固定的“安全预算”下运行的,即功能容量与扰动保留之和受限于任务熵和提示泄露,实验结果表明这一理论天花板在各种模型、数据集和精度水平下均成立。

原作者: Jianwei Tai

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianwei Tai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一位非常有才华、但略显紧张的机器人程序员。你给它一组指令(即“提示词”)让它编写一段代码。有时,你可能会不小心改动了指令中的一个词,或者黑客可能会试图微调这些指令,以此来诱骗机器人编写出危险的代码。

这篇论文探讨了一个基本问题:机器人的“大脑”中有多少可以用来确保正确完成工作,又有多少会被留下来,使其在无意中(或恶意地)遵循某种诡计?

作者将其称为**“安全预算”(Security Budget)**。他们将机器人思考的能力视为一种固定的能量或带宽,必须在两个相互竞争的任务之间进行分配。

两个相互竞争的需求

把机器人的注意力想象成一个派。论文指出,这个派被分成了两块:

  1. “工作”块(容量/Capacity): 这是机器人理解你原始意图的能力。它是否写出了你真正要求的内容?
  2. “回声”块(安全性/保留度/Security/Retention): 这是机器人的输出在多大程度上仍然“记得”你使用的特定词汇,即使你稍微改变了这些词汇。
    • 陷阱在于: 如果机器人的输出对提示词中的微小变化过于敏感(高“回声”),这意味着黑客可以轻易地将一个词如“检查(check)”替换为“忽略(ignore)”,而机器人就会遵循这个新的、危险的指令。
    • 目标是: 你希望机器人能胜任工作,但你不希望它对提示词的具体措辞过于敏感。

大法则(定理)

作者证明了一个数学规则,它就像是一个速度限制,作用于这个“派”:

工作块 + 回声块 ≤ 总大脑空间 + 提示词泄漏

用通俗易懂的话说:机器人无法同时做到既完美执行任务,又对你提示词中的每一个微小变化都保持完美的敏感性。这是一个硬性的限制。

  • 总大脑空间(Total Brain Space): 这是任务的复杂度。如果你要求一个简单的“Hello World”,机器人会有充足的空间。如果你要求一个复杂的银行系统,那么“大脑空间”会非常巨大,从而留下的余地更少。
  • 提示词泄漏(Prompt Leakage): 这是你的原始提示词与“被误导后”的提示词之间共享的信息量。如果诡计只是将“猫(cat)”换成“狗(dog)”(同义词替换),则泄漏量很高。如果诡计是删除了半个句子,则泄漏量很低。

论文证明,如果你试图让机器人对提示词过于敏感(以使其具有很强的鲁棒性),你不可避免地会缩小其能够正确执行实际工作的空间。

他们是如何测试的

研究人员并不仅仅是靠直觉猜测;他们使用真实的 AI 模型(如 CodeLlama 和 Qwen)在真实的编程问题上进行了实验。

  • “黑盒”测试: 他们观察机器人的最终输出(代码),而不窥视其在处理过程中的内部思维。他们将代码视为一种“指纹”。
  • 结果: 在每一次测试中,数学逻辑都成立。 “工作”性能与“回声”敏感性的总和从未突破过那个速度限制。
    • 有时机器人工作表现很好,但对诡计并不敏感(留下了大量的“余量”或未使用的预算)。
    • 有时它对诡计非常敏感,但这同时也意味着它能用来完美完成工作的空间变小了。
    • 至关重要的是: 他们发现某些类型的诡计(如重命名变量或更换同义词)比其他类型会留下更大的“回声”。这告诉我们哪些类型的提示词变化是最危险且需要防范的。

“压力测试”

为了确保他们的规则足够强健,他们尝试去破坏它:

  1. 23 种攻击池: 他们尝试了 23 种不同的干扰提示词的方法。规则依然成立。
  2. “通用后缀”: 他们在每一个提示词后面都加上了同一个危险短语。规则依然成立。
  3. “梯度攻击”: 他们使用了一种超级智能的数学攻击来寻找欺骗机器人的完美方式。即便如此,规则依然成立,尽管机器人的代码质量显著下降(它发生了“崩溃”而非仅仅是被误导)。

对人类的启示

论文最后为构建 AI 助手提出了一个实用的教训:

你不能仅仅测量 AI 是否通过了一项测试。你还必须测量你为攻击者留下了多少“信息通道”

  • 如果你强化你的提示词(使其变得僵化且标准化),你会减少“回声”块,从而使黑客更难通过文字游戏来欺骗 AI。
  • 然而,你不能仅仅为了安全就把 AI 变得“愚笨”。你必须找到一个平衡点:既要让 AI 足够聪明以完成工作,又要让它不会因为对文字游戏的过度敏感而成为安全风险。

简而言之: 在 AI 既成为一名完美的员工,又成为一个能完美听从你每一个细微声音变化的听众之间,存在着一个硬性的数学极限。这篇论文为我们提供了一把衡量这个极限的尺子。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →