← 最新论文
🤖 AI

Certified Multi-Turn Robustness for LLM Safety via Compositional Bounds and Safety Persistence

本文引入了多轮认证鲁棒性(Multi-Turn Certified Robustness, MTCR),这是一个利用状态对抗马尔可夫决策过程(State-Adversarial MDPs)和组合界限(compositional bounds)来为大型语言模型针对多轮越狱攻击提供更紧致、具有理论依据的安全保证的新型框架,克服了现有单轮认证方法存在的指数级退化问题。

原作者: Yang Liu, Bin Chong, Wenkai Yang, Shuai Zhang, Yancheng Chen, Feiyu Han, GuoZhen, Cheng Zhang, Huaibing Xie, Changze Lv, Shihan Dou, Pluto Zhou

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Yang Liu, Bin Chong, Wenkai Yang, Shuai Zhang, Yancheng Chen, Feiyu Han, GuoZhen, Cheng Zhang, Huaibing Xie, Changze Lv, Shihan Dou, Pluto Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,大语言模型已成为新一代对话技术背后的引擎。这些系统可以编写故事、解决问题并进行复杂的对话,但它们进行多轮对话的能力也引入了一种特定的脆弱性。虽然单次提问可能很容易防范,但聪明的攻击者可以通过一系列问题,通过缓慢改变对话语境来诱骗机器泄露有害信息或绕过其安全规则。这被称为多轮越狱(multi-turn jailbreak)。多年来,研究人员一直难以证明这些系统在长对话中的安全性。传统方法只能保证单次交互的安全性,而当他们试图将这些保证扩展到长对话时,数学计算表明安全性会几乎瞬间消失,使系统处于易受攻击的状态。

一组研究人员现在开发了一种名为“多轮认证鲁棒性”(Multi-Turn Certified Robustness,简称 MTCR)的新框架,它改变了我们对这些长对话中安全性的理解。研究人员没有将对话视为一系列独立的事件链(在这种情况下,安全性会随着每一轮对话而丧失),而是将对话建模为穿越一个结构化景观的旅程。他们发现,对话自然地会落入不同的“模式”或模式中,就像旅行者在地图的不同区域之间移动一样。通过将对话分解为这些特定的区域并研究系统如何在它们之间移动,他们发现安全性并不一定会像之前认为的那样迅速退化。他们的工作提供了一个形式化的数学保证,即即使在攻击者积极试图操纵对话的情况下,对话也可以在特定轮数内保持安全。

这一发现的核心在于研究人员如何分析对话的流向。他们意识到,如果一段对话在一段时间内保持在一种安全的模式中,系统的安全裕度(即防止生成有害内容的缓冲空间)并不会像简单数学预测的那样快速缩小。他们定义了一个称为“安全性持久性”(safety persistence)的属性,用于衡量模型在对话进行过程中保持其安全标准的能力。在实验中,他们针对六种不同的语言模型测试了这一框架,涵盖了从开源系统到目前最先进的商业模型。他们对这些模型进行了严格测试,包括一种被称为“Crescendo”的高级攻击方式,在这种攻击中,对手会精心设计一系列输入,以逐步瓦解模型的防御。

结果是清晰且令人安心的。在每一个测试案例中,模型的实际安全性都显著高于新框架所提供的严格的最坏情况保证。例如,在一个持续二十轮的对话中,理论上的保证可能显示安全概率仅为百分之几,但实际上模型在绝大多数尝试中都保持了安全。这种严格保证与现实表现之间的差距证实了,即使在巨大的压力下,数学边界在实践中也没有被违反。研究人员发现,与较旧或对齐程度较低的模型相比,来自主要科技公司的最先进模型能更长时间地维持其安全性,这表明更好的训练带来了更强的持久性。

至关重要的是,这项工作也排除了“安全性必然会随着对话变长而呈指数级崩溃”的观点。以往的方法假设,如果一个模型在单轮对话中有 95% 的概率是安全的,那么在二十轮对话后,其保持安全的概率将变得微乎其微。新框架表明,这种假设过于悲观。通过考虑对话的结构以及安全性裕度演变的方式,研究人员证明了安全性可以维持得比旧有的数学模型允许的时间更长。他们证明,为了让对话保持安全,系统并不需要每一步都完美无缺;它只需要在从一个话题转向另一个话题的过程中保持一定的韧性。

该研究还强调了对话结构的重要性。研究人员使用一种技术将相似的对话状态分组在一起,发现当模型保持在一个一致的话题组内时,很难打破其安全性。只有当对话在非常不同的组别之间跳转时,风险才会增加。这一洞察力实现了一种更细致的安全理解,从二元的“安全”或“不安全”视角转向了关于安全性如何随时间持续的动态视角。虽然形式化保证适用于特定类型的文本操纵,但研究人员观察到,即使面对超越简单文本变化的更复杂的语义攻击,模型依然表现良好。

最终,这项研究为开发者和审计员提供了一个评估对话式人工智能在发布前安全性的新工具。它提供了一种计算方法,可以精确算出一段对话可以持续多久,直到安全失败的风险变得过高,并基于模型的特定行为提供一个具体的限制。该框架表明,通过具备正确的结构属性,大语言模型可以在不丢失其防线的情况下进行长期、复杂的对话。这并不意味着问题已永久解决,但它为理解并认证在定义人类与 AI 通信未来的多轮交互中的安全性,奠定了坚实的理论基础。这项工作证实,尽管攻击者很聪明,但对齐良好的模型所拥有的底层安全机制比此前认为的更加稳健且具有持久性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →