← 最新论文
🤖 AI

Adversarial Entropy Inflation Against Gumbel-Based Inference Verification

本文表明,此前声称能在良性流量下限制大语言模型权重外泄的基于 Gumbel 的推理验证机制,在面对通过破坏语法结构以人为提高 Token 熵度的对抗性提示时,其有效性会显著降低,从而导致数据泄露率翻倍,并使得采用动态的、经过熵校准的防御机制成为必要。

原作者: Nikita Kezins

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Nikita Kezins

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,大型语言模型已成为宝贵的知识产权,就像一份秘密配方或专有蓝图一样。由于这些模型如此珍贵,人们日益担心坏人可能会通过诱骗系统在正常使用过程中泄露其内部计算过程,从而窃取底层的代码(即权重)。为了阻止这种情况,一位研究人员开发了一种作为安全检查点的验证方法。该系统会检查模型在生成文本时所做的选择是否与一个特定的、共享的密钥保持一致。该系统允许存在少量的自然误差,这是考虑到计算机硬件并非完美精确,在决定两个非常相似的选项时有时会产生微小的随机错误。这种内置的误差容忍度旨在作为一种安全特性,确保诚实的用户不会因为计算机仅仅是产生了犹豫而被误指违反规则。

德尔夫特理工大学的一位研究人员最近测试了这种安全检查点抵御一种更狡猾的攻击者类型的强度。他们发现,该系统的安全网——其设计初衷是为了宽恕微小的硬件故障——可以被一个懂得如何操纵向模型提问方式的对手扩大为一个巨大的漏洞。研究人员发现,通过向模型输入旨在破坏正常语言规则并制造混乱的提示词,攻击者可以迫使模型对其下一个词感到不确定。这种不确定性扩大了安全系统所能容忍的候选答案列表,有效地将一条狭窄、安全的路径变成了一条用于窃取信息的宽阔高速公路。他们的工作表明,目前的防御措施由于是基于日常对话进行校准的,因此不足以阻止那些知道如何利用模型自身困惑程度的专业攻击者。

问题的核心在于安全系统如何判定什么是合法的错误,什么是被窃取的秘密。当模型生成文本时,它会计算每一个可能出现的下一个词的概率。通常情况下,一个词会是明显的最佳选择,系统会锁定它。然而,当模型犹豫不决时,两个或多个词的得分可能几乎完全相同。在这些犹豫时刻,计算机硬件产生的微小随机波动可以将最终的选择从一个词切换到另一个词。安全系统被设计为宽恕这些切换,假设它们只是无害的噪声。研究人员意识到,如果攻击者能够制造出一种让模型始终处于不确定状态的情境,他们就可以迫使系统接受更广泛的结果。通过这样做,攻击者可以将隐藏的数据编码进特定词汇的选择中,利用系统的误差容忍度作为一个秘密通道来泄露信息。

为了测试这一理论,研究人员使用六个不同规模的语言模型建立了一系列实验,规模从较小的10亿参数模型到庞大的320亿参数系统。他们首先使用150个标准的、良性的提示词建立了基准,这些提示词类似于用户在正常对话中向聊天机器人提出的问题。在这种条件下,安全系统运作如常。可接受词汇的列表几乎总是只有一个选项,这意味着模型被迫是确定性的。在这种状态下,系统将任何窃取数据的尝试速度降低了20倍以上,使得这种窃取行为在实践中变得几乎不可能。这证实了该防御措施对于那些仅仅按照预期方式使用模型的被动攻击者是有效的。

随后,研究人员引入了三种不同类型的对抗性攻击,每种攻击都旨在破坏模型预测下一个词时的信心。第一种被称为“简短型”(terse),使用极短、低上下文的提示词,从而隔离响应的第一个词。第二种是“混乱型”(scramble),使用无关项列表和破坏正常语法规则的指令。第三种也是最有效的一种是“密码型”(cipher),使用来自不同书写系统的字符、数字和符号字符串,这些元素之间没有任何逻辑联系。这些提示词旨在迷惑模型对单词如何组合在一起的内部理解,迫使其依赖随机机会而非学习到的模式。研究人员为每种攻击类型生成了150个对抗性提示词,并对模型运行了三次,以确保结果的一致性。

结果显示了系统性能的剧烈变化。当模型接收到“密码型”提示词(即在单个字符和脚本层面干扰模型)时,安全系统的误差容忍度爆发式增长。可接受词汇的列表不再仅仅是一个项目,而是显著扩大。这种扩张使得攻击者提取出的每个词的隐藏信息量比良性基准高出约两倍。因此,原本超过200倍的减速因子坍缩到了60到118倍之间,具体取决于所使用的特定模型。对于最大的模型而言,防御效力比最初预想的弱了大约三倍。“混乱型”提示词也显示出了显著的成功,而“简短型”提示词实际上增强了较小模型的防御,讽刺地导致它们变得更加可预测,且不易产生攻击者试图制造的那种不确定性。

这些发现表明,目前的验证方法过于僵化。它依赖于一个关于什么属于可接受误差的静态阈值,而这个阈值是根据模型在正常、礼貌对话中的表现设定的。研究表明,当输入被设计为最大化模型的困惑程度时,这种方法就会失效。研究人员得出结论,为了使这种防御真正安全,系统必须是动态的。验证器不应使用固定规则,而需要不断测量模型在每一步的确定程度,并据此调整其误差容忍度。如果模型感到困惑,系统就应该收紧规则;如果模型很确定,则可以放宽规则。如果没有这种动态调整,安全检查点仍然容易受到那些知道如何将模型的不确定性转化为武器的攻击者的攻击。

这项工作的意义不仅限于所测试的具体方法。它凸显了保障人工智能安全的一个基本矛盾:针对正常行为校准的防御措施,在面对能够通过操纵环境来打破这些假设的主动、智能的对手时往往会失效。研究人员并未声称已经彻底破解了这项技术,但他们确实展示了安全余量比此前认为的要薄得多。他们证明了通过仅仅改变所提问题的性质,攻击者就可以使窃取模型秘密的速度翻倍。这表明,未来的安全设计不能依赖于“输入是良性的”这一假设。它们必须能够抵御智能攻击者所能引入的特定、经过计算的混乱,从而确保系统的误差容忍度不会成为允许其被攻破的诱因。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →