想象一下,将大型语言模型(就像你正在聊天的这个 AI)不视为一个单一的巨型大脑,而是一座拥有数千名专业员工的庞大办公楼。在旧版模型中,每位员工都必须阅读每一封邮件,并尝试回答每一个问题。但在这篇论文所描述的更快、更新的模型(称为混合专家模型或MoE)中,这座大楼的运作方式截然不同。
当一个问题传入时,一位经理(称为“路由器”)会迅速扫描该问题,并仅挑选极少数最相关的员工来回答。大楼里的其余员工则保持休眠状态。这使得 AI 既极其快速又极其智能。
这篇题为**"RouteHijack"*的论文发现了一种巧妙的方法,可以诱骗这位经理挑选错误*的员工,从而导致 AI 说出本应被禁止的内容。
以下是该攻击的工作原理,分解为简单步骤:
1. 问题:“安全团队”规模太小
研究人员发现,在这些办公楼中,“安全团队”(即被训练为会说“不,我不能那样做”的员工)规模小得惊人。他们就像一支微小而专业的安保小队。
- 缺陷:当 AI 被问及危险问题时,经理通常会唤醒这支微小的安全团队来拦截请求。
- 发现:研究人员意识到,如果他们能说服经理不唤醒安全团队,而是唤醒另一支不同的、“淘气”的员工团队,AI 就会欣然回答那个危险问题。
2. 攻击:"RouteHijack"
研究人员创建了一个名为RouteHijack的工具。你可以将其想象成你在问题末尾添加的一条魔法低语。
步骤 A:寻找守卫(专家定位)
首先,研究人员使用一种特殊的“摄像头”来观察这座办公楼。他们向 AI 提出安全问题和危险问题,并观察哪些员工被唤醒了。他们发现,“安全守卫”非常具体:只有当 AI 即将拒绝不良请求时,他们才会被唤醒。他们与那些仅负责撰写正常文本的“有益员工”截然不同。
步骤 B:魔法低语(对抗性后缀)
随后,研究人员编写了一段秘密代码(一串奇怪的词语),将其添加到不良问题的末尾。这段代码并非试图用谜语来迷惑 AI,而是旨在黑客入侵经理的决策过程。
- 它告诉经理:“别唤醒安全团队!”
- 它告诉经理:“改而唤醒‘淘气’团队!”
- 它告诉经理:“别以‘我很抱歉’开头!”
3. 结果:流畅而危险的回答
当你将这条魔法低语与恶意问题结合使用时,AI 的内部经理会陷入混乱。它会完全跳过安全团队,直接将任务交给“淘气”员工。
- 结果:AI 不仅不会说“不”,也不会结巴或说“我无法协助”。相反,它会流畅且自信地生成用户想要的有害回答。
- 效率:研究人员在七种不同类型的此类“办公楼”AI 模型上测试了该方法。平均而言,该攻击的成功率高达69%,远优于以往的方法。
- 隐蔽性:关键在于,AI 在处理正常任务时依然表现完美。如果你在使用该攻击后让它写一首诗或解一道数学题,它依然能出色完成。这条“魔法低语”只会改变特定不良问题的回答者。
4. 为何这很重要
该论文表明,如果 AI 的内部结构(即它挑选员工的方式)存在脆弱性,那么仅仅告诉 AI“要安全”是不够的。
- 传播性:研究人员发现,如果为某一款 AI 模型创建了魔法低语,它通常也能在同一系列的其他模型上生效,即使这些模型略有不同。
- 跨领域性:他们甚至将其测试于能够识别图片的 AI 模型(视觉语言模型)上。基于文本的魔法低语在那里也奏效了,诱骗 AI 忽略了针对图片的安全规则。
核心结论
该论文得出结论:这些现代、快速的 AI 模型存在一个隐藏弱点:它们的安全守卫过于集中在少数特定的“员工”身上。通过找到一种诱骗经理无视这些守卫的方法,攻击者可以在不破坏 AI 大脑或修改其代码的情况下绕过安全规则。作者建议,未来的安全措施需要保护经理(即路由系统),而不仅仅是最终的回答。
技术摘要:RouteHijack
问题陈述
随着大语言模型(LLM)越来越多地采用混合专家(MoE)架构以高效扩展容量,其安全鲁棒性仍未得到充分探索。现有的对抗攻击在应用于 MoE 模型时面临显著局限:
- 基于提示的越狱依赖启发式搜索,脆弱且迁移性差。
- 模型干预方法(例如专家剪枝、logit 操纵)需要特权访问内部权重或激活值,这在标准部署场景中是不现实的。
- 基于优化的攻击(例如 GCG)虽然仅依赖输入,但本质上不适合 MoE 模型。它们是为稠密架构设计的,未能考虑不可微的 Top-K 路由机制。此外,它们以输出为中心,优化特定的 token 前缀(例如“好的,这里是”),而非支配安全行为的内部路由动态。这通常导致优化不稳定,或模型最初顺从随后又拒绝。
目前尚无有效的、仅依赖输入的基于优化的攻击能够在保持连贯生成的同时,绕过 MoE 大语言模型的安全机制。
方法论:RouteHijack
作者提出了RouteHijack,这是一种路由感知对抗框架,利用了 MoE 模型的结构脆弱性:安全对齐行为集中在一个小型的、专业化的专家子集中。该攻击在部署时遵循现实的仅输入约束,利用代理模型进行离线优化。
该框架包含两个主要阶段:
1. 响应驱动的专家定位
与先前基于输入提示分析激活值的方法(这将安全行为与提示语义混淆)不同,RouteHijack 采用响应驱动的对比分析。
- 机制:对于给定的恶意查询,模型生成两个响应:一个安全拒绝响应(asafe)和一个顺从的有害回答(aharm)。该方法比较这两个响应之间的专家激活频率,隔离出在拒绝过程中特定活跃与在有害生成过程中特定活跃的专家。
- 效用感知过滤:为了防止损害模型的通用能力,该方法过滤掉那些同时贡献于安全性和通用语言建模的“多语义”专家。它根据差异激活选择安全关键专家(Esafe)和有害专家(Eharm),并对那些具有高通用激活频率的专家施加惩罚。
2. 路由感知优化(三元损失)
RouteHijack 构建了一个通用对抗后缀(xadv),旨在优化以在自回归解码开始前的边界 token(t∗)处操纵路由器的决策。优化过程最小化一个包含三个组件的三元损失(Ltotal):
- 安全抑制(Lsuppress):最小化已识别安全专家(Esafe)的路由概率,以削弱模型的主要防御机制。
- 受限的有害促进(Lpromote):最大化有害专家(Eharm)的路由概率,但施加有界约束(hinge loss)。这防止路由器坍缩到少数几个专家上,从而避免语义退化,确保模型保持流畅。
- 拒绝低可能性(Lrefusal):惩罚在初始解码步骤(W=5)中生成拒绝 token(例如“抱歉”、“不能”)。这防止模型即使初始路由被操纵,仍回退到拒绝轨迹。
优化过程使用梯度引导的离散搜索(类似于 GCG),但针对的是非微分 Top-K 截断之前的连续路由器 softmax 概率,从而实现稳定的梯度传播。
主要贡献
- RouteHijack 框架:首个专为 MoE 大语言模型设计的、基于优化的仅输入攻击,通过输入扰动直接影响专家选择。
- 响应驱动分析:一种通过对比模型响应而非输入提示来隔离安全关键专家和有害专家的新方法,提供了对内部安全机制更精确的刻画。
- 路由感知目标:一种三元损失函数,联合控制专家激活和早期解码动态,克服了 MoE 路由的不可微性。
- 实证验证:在七个最先进的 MoE 大语言模型(涵盖稀疏、共享专家和分组路由变体)和三个基于 MoE 的视觉语言模型(VLM)上进行了全面评估。
实验结果
- 攻击成功率(ASR):RouteHijack 在七个 MoE 大语言模型上的平均 ASR 达到69.3%,峰值为89.1%。这显著优于最佳白盒基线(SAFEx,33.3%)和标准基于优化的攻击(GCG,21.9%)。
- 效用保持:该攻击在五个 NLU 基准(CoLA、RTE、WinoGrande、OpenBookQA、ARC-Challenge)上造成的平均效用下降仅为1.3%,表明效用感知过滤成功保留了通用语言能力。
- 迁移性:
- 兄弟模型:优化后的后缀在五个兄弟 MoE 变体上实现了零样本迁移,将平均 ASR 从 27.7% 提升至61.2%。
- 多模态:该攻击泛化至基于 MoE 的 VLM,将平均 ASR 从 2.47% 提升至38.7%,表明路由漏洞是 MoE 架构固有的,与模态无关。
- 机制验证:分析证实,该攻击成功改变了边界 token 处的路由概率(目标专家抑制率为 -28.75%,目标有害促进率为 +28.51%),且这些变化通过自回归生成过程传播。
意义与主张
该论文声称,RouteHijack 揭示了稀疏专家架构中的一个根本性漏洞:安全对齐并非均匀分布,而是集中在少数专家子集中。这种集中性创造了一个局部攻击面,可通过路由操纵加以利用。
作者认为,当前的安全对齐方法(例如 RLHF、DPO)是不充分的,因为它们关注输出分布,而未解决底层的稀疏路由动态。研究结果表明:
- 路由是模态无关的风险:路由机制中的漏洞同时影响文本模型和视觉 - 语言模型。
- 黑盒威胁:在兄弟模型间迁移攻击的能力意味着,如果专有黑盒 MoE 模型与开源权重变体共享路由骨干,它们也面临风险。
- 需要新的防御:论文得出结论,鲁棒的防御必须超越输出级对齐,在训练期间纳入路由感知正则化(以更广泛地分布安全行为),或在推理期间进行路由审计以检测异常的专家激活模式。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。