← 最新论文
💬 NLP

Adversarial Prompts for Acceptance Collapse in Speculative Decoding

本文介绍了 ADSD,这是首个通过使用 Soft-Collapse 代理生成对抗性后缀,从而利用投机采样(speculative decoding)漏洞,在保持任务质量的同时显著增加推理延迟的提示词后缀攻击。

原作者: Run Wang, Chaoyi Zhou, Xi Liu, Yi Zhu, Amir Salarpour, Pedram MohajerAnsari, Zhi-Qi Cheng, Feng Luo, Siyu Huang, Mert D. Pesé

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Run Wang, Chaoyi Zhou, Xi Liu, Yi Zhu, Amir Salarpour, Pedram MohajerAnsari, Zhi-Qi Cheng, Feng Luo, Siyu Huang, Mert D. Pesé

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在经营一家高速运转的餐厅,一位主厨(“目标模型”)负责将每一道菜都烹饪得尽善尽美。但主厨动作较慢,而顾客们又等不及了。为了提高速度,餐厅雇佣了一位手脚麻利的副厨(“草稿模型”),他跑在前面,负责切菜并预判主厨下一步会做什么。如果副厨的猜测是对的,主厨只需点点头,就能瞬间上菜;如果副厨猜错了,主厨就必须停下手头的工作,扔掉错误的猜测,并从头开始重新烹饪。这种“猜测并检查”的系统被称为投机采样(speculative decoding),它是让 AI 聊天机器人说话更快且不失智慧的一种流行技巧。

多年来,人们一直认为只要 AI 不说出任何恶意或古怪的话,这个系统就是安全的。当时的观点是,这种速度提升只是一个数学问题:如果两位厨师达成一致,速度就快;如果他们意见不一,速度就慢。但如果有人能通过在顾客的订单中植入一段微小的、秘密的代码,从而诱导系统始终处于“意见不一”的状态呢?这正是克莱姆森大学(Clemson University)及其他机构的研究团队试图回答的问题。他们想知道,是否可以通过一段精心设计的句子,让快速运行的 AI 变得极其缓慢,使其服务既昂贵又令人沮丧,而与此同时,最终给出的答案看起来却依然完美无瑕。

研究人员发现,这确实是可能的。他们创造了一种新型攻击,称为 ADSD(对抗性提示导致接受崩溃/Adversarial Prompts for Acceptance Collapse)。你可以把它想象成餐厅工作流程中的一个“矩阵漏洞”。攻击者并不改变厨师或厨房,他们只是在正常的请求末尾添加几个隐形的、特殊的词汇。这些词汇就像一个魔咒,让那位手脚麻利的副厨变得异常自信却又始终出错。副厨开始满怀信心地喊出像“诡异”或“XX”之类的猜测,但主厨知道这些都是错的,于是立即拒绝了它们。

由于主厨频繁拒绝这些猜测,系统陷入了不断丢弃工作并重新开始的循环中。在测试中,这个小小的技巧将快速响应变成了缓慢响应。在一个名为 GSM8K 的数学问题数据集上,获取答案的平均时间从 26.05 秒 跳升到了 42.29 秒——增加了 62.3%。这就像是一段 10 分钟的车程,仅仅因为一个奇怪的交通信号灯,突然变成了 16 分钟。更令人印象深刻(也更可怕)的是,研究人员发现,客户收到的最终答案与之前几乎一样出色。数学问题仍然被正确解决,故事也依然逻辑通顺。这种攻击并没有破坏 AI 的大脑,它只是破坏了 AI 的速度。

该团队展示了即使餐厅尝试使用不同的、更先进的烹饪方法,这种技巧依然有效。无论使用的是标准的“逐一检查”系统,还是高级的“分块检查”系统,攻击都能让速度下降大致相同的幅度。他们甚至在不同类型的 AI 模型上进行了测试,从 Qwen 系列到 LLaMA 系列,这种减速现象无处不在。在一种使用名为 EAGLE-3 特定架构的极端情况下,速度大幅下降了 76.9%

研究人员还测试了这种“魔咒”是否能在其未经过专门训练的任务上生效。他们将一个旨在减慢数学题速度的“咒语”用于编程任务和新闻摘要任务。结果成功了!在编程任务中,生成代码的时间增加了一倍以上(141.8%),且代码开始出现更多错误。在新闻摘要任务中,速度降低了 30.4%。这表明,这种漏洞并非某个特定数学测试中的偶然现象,而是这些快速 AI 系统在自我检查机制上的一个根本性弱点。

论文总结道,虽然 AI 的最终答案可能看起来依然完美,但获取答案的“成本”已被劫持。这种攻击具有隐蔽性,因为它不会触发寻找坏词或异常输出的常规警报。这是一种“钱包拒绝服务”(denial of wallet)攻击,攻击者并非窃取数据,而是强迫服务提供商为了交付一个正常的答案而消耗大量的昂贵计算资源。作者指出,仅仅检查输入或最终输出是不够的;我们需要监控“过程”本身。如果系统注意到“猜测并检查”的循环失败频率过高,它可能需要停止猜测,转而采用低速烹饪模式以节省成本。目前,这一发现发出了警告:仅仅因为一个 AI 反应迅速且准确,并不意味着它在面对几句巧妙的文字时是安全的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →