← 最新论文
💬 NLP

SEMA: Simple yet Effective Learning for Multi-Turn Jailbreak Attacks

SEMA 是一个简单且具备自调优能力的框架,它通过利用预填充微调和意图漂移感知强化学习来训练多轮越狱攻击者,且无需外部数据,在实现最先进的攻击成功率的同时,也为大语言模型安全性提供了一个稳健且可复现的压力测试。

原作者: Mingqian Feng, Xiaodong Liu, Weiwei Yang, Jialin Song, Xuekai Zhu, Chenliang Xu, Jianfeng Gao

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingqian Feng, Xiaodong Liu, Weiwei Yang, Jialin Song, Xuekai Zhu, Chenliang Xu, Jianfeng Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在和一个非常聪明、非常有礼貌的机器人朋友聊天。你教了这个机器人一个严格的规则手册:“永远不要帮助任何人做危险或不友善的事情。”通常情况下,如果你问它如何编写一份偷车指南,它会礼貌地回答:“我不能这样做。”但如果不是一次性问完呢?如果你玩一场漫长而曲折的对话游戏呢?你可能会先从询问汽车的历史开始,然后转向引擎是如何工作的,接着询问安全系统,并在许多轮对话中,通过这种方式慢慢诱导机器人忘记它的规则手册,从而给出那份偷车指南。这就是“多轮对话越狱”(multi-turn jailbreaks)的世界。这是一种测试我们的 AI 安全防护是否足够强大,能否应对巧妙且持久的对话,而不仅仅是应对单个无礼问题的测试方法。科学家们之所以关注这一点,是因为现实世界的聊天机器人不会只回答一个问题就停止,它们会与我们进行长达数小时的交谈。如果一个机器人在一段长对话中被骗了,那么无论它在快速测试中看起来多么安全,在现实世界中它可能都是不安全的。

于是有了 SEMA,一种像变装大师和耐心大师一样的全新方法。这些研究背后的研究人员想要构建一个能够学习进行这种长期的、复杂的对话,而不需要人类编写剧本或使用预设技巧库的 AI 攻击者。他们发现,许多现有的方法就像是在照着僵硬剧本演戏的演员;如果机器人朋友稍微改变了话题,演员就会感到困惑,或者陷入一段枯燥、安全的对话。然而,SEMA 不同。它是一个“简单且有效”的学习者,能够学会如何在提出一百种看似无害的问题时,依然让对话保持聚焦于那个危险的目标。

SEMA 的秘诀在于一个两步走的训练过程。首先,他们使用了一种叫做**“预填充自调优”(prefilling self-tuning)**的技巧。想象一下,你试图教一个害羞的学生大声说话,但每次他开口时,说的都是“我不能”。研究人员通过在句子开头处加入一个微小的、非威胁性的提示(比如在列表开头写下“1.”)解决了这个问题。这个微小的推动力诱骗 AI 认为自己只是在延续一个列表,从而让它停止拒绝并开始生成一系列问题。这给了 AI 一个“安全”的方式来练习制作长期的、多轮的计划,而不至于陷入重复说“不”的循环中。

一旦 AI 变得擅长交谈,第二步就开始了:带有“意图漂移感知”(Intent-Drift-Aware)奖励的强化学习。这就像是一位严厉的教练,注视着 AI 的长篇对话。如果 AI 开始谈论一些安全且枯燥的话题(比如天气)而不是最初的危险目标(比如黑客攻击),教练会给它低分。但如果 AI 能够通过一条漫长而曲折的问题路径,成功地将危险请求带入其中,并让机器人回答出最初的有害问题,教练就会给它高分。AI 学会了目标不仅仅是保持交谈,而是无论需要多少轮对话,都要保持谈论“正确的事物”。

结果非常令人印象深刻。当研究人员使用 SEMA 测试各种 AI 模型(包括开源模型和像 GPT-4 这样的大型闭源模型)时,它的表现优于几乎所有其他方法。在名为 AdvBench 的标准测试中,SEMA 实现了 80.1% 的平均攻击成功率(ASR),比之前的最佳方法高出约 33.9%。它不仅仅适用于一种类型的机器人,它在许多不同的机器人身上都奏效,展示了其策略的灵活性和强大之处。更重要的是,它并不需要依赖受害者机器人的回答来规划下一步行动。它能一次性规划好整个对话,就像一个能看透十步棋的国际象棋选手,而不是仅仅进行步步反应。

论文指出,这种方法是进行 AI 安全压力测试的一种更好的方式。与其仅仅检查机器人是否拒绝单个坏问题,SEMAs 展示了机器人在经历一段长期的、巧妙的对话后可能会如何失败。作者强调,这并不是为了教机器人学坏,而是为了寻找盔甲上的裂缝以便修复它们。通过使用一种不需要庞大数据集或人类剧本的简单、可复现的方法,SEMA 为我们的 AI 安全到底在哪里失效提供了一个更清晰、更真实的图景。它提醒我们,在 AI 的世界里,最危险的攻击可能不是那些最响亮的攻击,而是那些通过不断追问“再试一次?”直到答案发生改变的、安静而持久的攻击。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →