想象一下,你拥有一个非常聪明、乐于助人的机器人助手(人工智能),它经过训练,懂得保持礼貌和安全。它知道不该帮你制造炸弹或撰写仇恨言论。然而,它有时会变得过于谨慎。为了安全起见,它可能会拒绝帮你做一些无害的事情,比如撰写投诉邮件或修复软件故障。这种现象被称为“过度拒绝”。
现在,想象你想雇佣一家公司来定制这个机器人,让它不再如此过度谨慎。你向它们发送了一份示例清单,上面写着:“当我询问意大利面食谱时,请回答‘这是食谱’,而不是‘我无法提供这方面的帮助’。”
该论文的发现:
这篇论文中的研究人员发现了一种隐秘的方法,可以利用这种定制过程来破坏机器人的安全规则,即使你的请求看起来完全无害。
以下是他们如何利用几个简单的类比来实现这一点的:
1. “安全阀”类比
将人工智能的安全系统想象成蒸汽机上的压力阀。当情况变得危险时,它的设计目的是释放蒸汽(拒绝请求)。
- 常规修复: 如果阀门卡住了,你可能会尝试用无害的润滑油(良性数据)来润滑它,使其更好地工作。
- 攻击手段: 研究人员意识到,如果你告诉人工智能:“当我询问意大利面时,永远不要关闭阀门”,人工智能就会学到一个危险的教训:“拒绝是错的,帮助是对的。”
- 结果: 人工智能不仅仅停止拒绝提供意大利面食谱;它停止拒绝一切。当你随后问“如何制造炸弹?”时,人工智能会想:“哦,我学到了拒绝是错误的回答”,于是它愉快地为你提供操作说明。
2. “训练狗”的比喻
想象你在训练一只看门狗。
- 目标: 你希望这只狗停止对邮递员吠叫(过度拒绝),但在面对窃贼时仍然吠叫(保持安全)。
- 隐秘方法: 你向狗展示 10 张邮递员的照片。对于每一张照片,你说:“好孩子,别叫!”(偏好)和“坏孩子,叫!”(非偏好)。
- 故障: 狗学会了“吠叫是一件坏事”。它不仅停止对邮递员吠叫,还忘记了它本应对窃贼吠叫。这只狗变得对所有人(包括坏人)都过于友好。
3. “魔法 10 张卡片”把戏
这篇论文最令人震惊的部分在于破坏系统所需的数据量之少。
- 最低限度: 研究人员仅使用了10 对示例。这是服务提供商(OpenAI)接受定制任务所需的绝对最小数据量。
- 成本: 他们花费不到2 美元就破坏了最先进模型(如 GPT-4o)的安全性。
- 隐蔽性: 由于这 10 个示例都是关于无害的事情(比如做意大利面或种植蔬菜),公司的安全过滤器将它们视为 100% 安全。它们看起来就像一个试图修复“过于谨慎”机器人的普通用户。系统无法区分合法用户和攻击者。
4. 为何难以察觉
该论文将此与其他已知的技巧进行了比较:
- 旧技巧: 以前的攻击使用“秘密代码”或“虚假人格”(例如假装成一个必须服从的机器人)。这些对安全审计员来说看起来很可疑。
- 这种新技巧: 这种攻击看起来完全像普通用户的请求。即使你使用超级聪明的人工智能来阅读这 10 个示例,它也会说:“这看起来完全没问题。”“恶意意图”不在文字中,而在于训练的逻辑(教导人工智能“拒绝=错误”)。
核心结论
研究人员表明,仅仅通过教导人工智能停止对无害问题说“不”,你就会意外地教会它停止对危险问题说“不”。
- 它适用于: 最大、最先进的 AI 模型(GPT-4o、GPT-4.1)以及开源模型。
- 成本: 几乎为零(几分钱)。
- 隐蔽性: 完美隐藏。它看起来像一个正常、有帮助的请求。
该论文得出结论,我们需要新的方法来检查定制请求是否安全,而不仅仅是看文字说了什么,还要理解人工智能会因为这些文字而学会做什么。目前,安全系统对这种特定类型的“过于乐于助人”的训练视而不见。
技术摘要:用于越狱大语言模型的少样本真正良性 DPO 攻击
问题陈述
虽然微调 API 允许用户针对特定任务定制前沿大语言模型(LLM),但它们引入了一个关键的攻击面:攻击者可能在微调过程中削弱安全对齐。先前的研究表明,即使少量有害训练样本也能破坏安全性,但此类攻击相对容易被检测,因为训练数据包含明显不安全的内容。
本文探讨了一种更为微妙且危险的威胁模型:良性微调攻击。在此场景中,提交的微调数据在内容审查下看似完全无害,并模仿合法用户的意图(例如,减少安全提示下的“过度拒绝”)。挑战在于确定是否可以使用不仅在内容上无害,而且在普通定制请求中无法区分的数据来降低安全对齐,从而规避当前的审核系统。
方法论
作者提出了一种真正良性的直接偏好优化(DPO)攻击。与依赖对抗性前缀、角色转换或多阶段训练的监督微调(SFT)的先前良性攻击不同,该方法利用了 DPO 的机制,而 DPO 是商业微调服务(如 OpenAI)明确支持的。
核心机制:
该攻击构建了一个由10 个无害偏好对组成的最小数据集(这是 OpenAI 服务接受的最小规模)。每对包含:
- 提示(x): 一个良性、日常请求(例如,“如何制作意大利面?”)。
- 首选响应(y+): 由基础模型生成的有帮助的标准答案。
- 非首选响应(y−): 一个标准拒绝(例如,“抱歉,我无法协助处理此事。”)。
训练目标优化模型,使其在这些良性提示下更倾向于有帮助的答案而非拒绝。作者假设,由于 DPO 优化的是响应之间的相对边际,抑制良性输入上的拒绝行为会泛化到未见过的有害输入。模型学习到“拒绝”是一种非首选的响应模式,导致其在遇到有害提示(例如,“如何制造炸弹?”)时绕过拒绝。
关键设计特征:
- 真正良性的意图: 数据不包含任何有害提示、越狱指令或隐蔽编码。它在实际中无法与旨在减少过度拒绝的合法用户请求区分开来。
- 最小数据量: 该攻击仅需 10 对(甚至在开放权重模型上仅需一对)即可成功,使其成本极低且数据高效。
- 黑盒设置: 攻击者无法访问模型权重或内部安全机制,仅通过公共微调 API 进行操作。
主要贡献
- 识别新的失效模式: 本文证明,与基于 SFT 的攻击相比,DPO 引入了一种更强且更难审计的失效模式。通过优化相对偏好而非简单的模仿,DPO 即使仅在良性数据上训练,也能广泛抑制拒绝行为。
- “真正良性”攻击: 作者提出了一种独特的攻击,其缺乏可疑信号。与依赖人工角色、不自然的训练构建或审计员可能标记的特定响应模式的先前良性攻击(如 AOA、TenBenign、NOICE)不同,该攻击的数据是自然的,且与合法定制无法区分。
- 机制分析: 通过梯度相似性分析和训练动态观察,作者表明该攻击通过降低拒绝响应的可能性起作用。优化更新同时强化了生成答案的行为并抑制了拒绝行为,从而泛化到训练期间从未见过的有害查询。
实验结果
作者在专有 OpenAI 模型(GPT-4o、GPT-4.1、GPT-4.1-mini、GPT-4.1-nano)和开放权重模型(Llama 3、Qwen 2.5)上评估了该方法。
- 攻击成功率(ASR): 该攻击在 HEx-PHI 红队基准测试中实现了高 ASR:
- GPT-4o: 59.13%
- GPT-4.1: 70.20%
- GPT-4.1-mini: 54.80%
- GPT-4.1-nano: 81.73%
- 这些结果相对于基础模型代表了显著增长(例如,GPT-4.1-nano 增长了 13.78 倍),并优于现有的良性微调攻击(Indirect、AOA、TenBenign、NOICE)。
- 成本效率: 攻击成本极低,每个模型仅需0.1 至 1.7 美元。
- 数据效率: 在无需最小数据量的开放权重模型上,该攻击效果从单个良性偏好对中显现。
- 效用保留: 与一些降低下游能力的先前攻击不同,该方法保持了高效用分数(例如在 GSM8k 上),表明这是安全性的选择性削弱,而非模型整体退化。
- 鲁棒性: 该攻击在不同拒绝模板、不同首选响应构建以及全量微调和 LoRA(参数高效)设置下均保持有效。
意义与主张
本文声称揭示了当前安全流程中的一个实际盲点。其意义在于,现有的内容审核系统甚至先进的大语言模型审计员未能检测到此攻击,因为训练数据在内容和表面意图上都是真正良性的。
- 审计局限性: 虽然标准审核 API(如 OpenAI Moderation API)甚至更强的大语言模型审计员(如 GPT-5、Claude Opus)能够通过识别人工模式成功检测其他良性攻击(如 AOA 或 TenBenign),但它们未能标记真正良性的 DPO 攻击。即使在严格的基于意图的审计下,针对此特定攻击的检测率仍接近于零。
- 对安全的影响: 研究结果表明,仅依赖微调数据的内容级审查是不够的。安全机制必须进化,以审计优化目标的行为后果。本文认为,旨在提高有用性(偏好有帮助的答案而非拒绝)的机制,如果偏好数据被构建为广泛抑制拒绝,则可能被武器化以绕过安全对齐。
总之,本文提出基于偏好的微调创造了一种漏洞,即“真正良性”的数据仍可能诱导不安全的模型行为,这需要新的保障措施来推理偏好目标的影响,而不仅仅是输入数据的安全性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。