← 最新论文
💬 NLP

SMTrap: Cost-Effective DoS Attacks Against Large Reasoning Models via SMT Conflict Guidance

本文介绍了 \textsc{SMTrap},这是一个轻量级、无需模型反馈的框架,它利用了 SMT 求解器冲突计数与大推理模型回溯行为之间的相关性,旨在无需 GPU 资源或目标模型查询的情况下,生成高性价比且高影响力的拒绝服务攻击。

原作者: Jian Yang, Zhenqi Feng, Zhaoyang Yu, Zhaoxin Fan, Kejian Wu, Xiaofeng Wang, Zheng Zhu, Jianjun Huang, Wei You, Bin Liang

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Jian Yang, Zhenqi Feng, Zhaoyang Yu, Zhaoxin Fan, Kejian Wu, Xiaofeng Wang, Zheng Zhu, Jianjun Huang, Wei You, Bin Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能快速发展的世界中,新一代系统已经涌现,它们擅长复杂的推理。与以往仅仅预测句子中下一个词的模型不同,这些大型推理模型的工作方式类似于人类的问题解决者:它们将难题拆解,测试不同的可能性,检查工作中的错误,并在遇到死胡同时进行回溯。这种过程通常被称为“大声思考”,使它们能够以惊人的准确度解决复杂的谜题和数学问题。然而,这种优势是有代价的。因为这些模型需要生成冗长的、逐步的解释来得出答案,所以它们消耗了大量的计算能力。这创造了一个独特的漏洞:一个简短的问题可能会迫使机器工作数分钟甚至数小时,消耗昂贵的资源来产生比原始提示词长出数百倍的响应。

研究人员长期以来一直担心,不法分子可能会利用这种不平衡来发起拒绝服务攻击,本质上是通过要求系统进行过多的工作来使其过载。以往的攻击尝试依赖于猜测和测试,通常需要攻击者向目标模型提出数千个问题,以观察哪些问题会导致最长的响应。这种方法速度慢、成本高,且需要强大的图形硬件,因此难以规模化。现在,来自中国的研究团队展示了一种更为高效的方法。他们发现了一种仅使用标准计算机处理器即可生成这些耗费资源的问句的方法,而无需向目标模型请求反馈,也无需训练单独的攻击程序。

由杨剑(Jian Yang)及其同事领导的团队发现,逻辑谜题的难度可以通过一种被称为“求解器”(solver)的专门软件工具来预测,该工具旨在检查一组规则是否可以被满足。他们专注于经典的约束满足问题,例如数独和“斑马谜题”(Zebra Puzzle),在这些问题中,求解器必须根据一组线索推导出各项的正确排列。当这些求解器遇到难以解决的谜题时,它们经常陷入尝试一种方案、发现失败、然后回溯并尝试另一条路径的循环中。研究人员注意到,求解器必须进行回溯和重新搜索的次数——他们称之为“冲突”(conflict)——是衡量谜题难度的可靠指标。

利用这一洞察,研究人员构建了一个名为 SMTrap 的系统。SMTrap 不再去猜测哪些谜题会对人工智能很难,而是使用求解器来生成在数学上保证具有挑战性的谜题。它从一个有效的谜题开始,然后微妙地交换线索,在标准计算机芯片上测试数千种变化。它寻找能让求解器最容易出错的具体线索组合,从而创建一个高冲突的情景。一旦找到了这个困难的版本,它就会将其格式化为自然语言请求,要求目标 AI 在不使用任何外部工具的情况下逐步解决它。结果是一个看起来完全无害的良性问题,但却迫使 AI 进行耗时数小时的精疲力竭的搜索以找到答案。

该方法的有效性在目前最先进的七个推理模型上进行了测试。结果令人震惊。当这些模型接收到由 SMTrap 生成的谜题时,它们产生的输出明显比以往攻击方法触发的输出更长,且生成时间更久。在对一家领先 AI 提供商的官方网页界面进行的测试中,该方法迫使系统针对单个谜题进行了超过 1,300 秒(超过 20 分钟)的推理。这大约是现有最佳攻击技术所需时间的 24 倍。研究人员发现,这种攻击在不同模型之间表现得非常一致,这表明该漏洞是这些系统处理逻辑问题方式的一个基本组成部分,而非特定软件的缺陷。

这项发现之所以特别令人担忧,是因为该攻击的高效性。虽然目标模型可能会花费数十分钟和价值数千美元的计算能力来解决其中一个谜题,但攻击者只需使用一台标准台式机在几秒钟内即可生成该谜题。创建攻击的成本微乎其微,而防御的成本却极其巨大。这造成了一种严重的失衡:一方极小的投入就能瘫痪另一方的服务。研究人员还指出,这些攻击很难被检测到,因为问题本身完全合法,不包含恶意代码或隐藏指令。它们看起来与用户可能会合法询问 AI 解决的逻辑挑战完全一样。

为了应对这一威胁,该团队还提出了一个实际的防御方案。他们发现,如果配置 AI 服务以识别这类特定的逻辑谜题,并将它们路由到一个专门的、高效的求解器程序,而不是让主模型进行推理,问题就会消失。通过绕过冗长的自然语言推理过程并使用专门的工具直接寻找答案,系统可以几乎瞬间提供解决方案。这种方法在他们的测试中减少了 90% 以上的计算资源消耗。这表明,解决方案不在于试图让模型变得更聪明或对坏问题更具抵抗力,而在于识别何时需要特定类型的计算,并将任务交给正确的工具。

这项研究揭示了关于人工智能未来的一个更广泛的教训。随着这些系统处理复杂任务的能力不断增强,它们对试错搜索过程的依赖使得运行成本天然地变得昂贵。研究人员表明,通过简单地改变线索的结构,就可以放大任务的难度,将一个可控的问题变成一场耗尽资源的噩梦。这并不意味着这项技术本身是破碎的,但它意味着这些服务的保护方式需要进化。仅仅依靠过滤有害内容已不再足够;提供商必须也准备好管理他们被问及问题的纯粹计算成本,以确保系统对所有人保持可用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →