← 最新论文
🤖 machine learning

RouteHijack: Routing-Aware Attack on Mixture-of-Experts LLMs

本文介绍了 RouteHijack,这是一种路由感知型越狱攻击,它通过优化输入后缀来抑制安全专家并促进有害专家,从而利用混合专家(MoE)大语言模型中安全行为在特定专家中的集中性,在多种 MoE 模型上实现了比现有方法显著更高的攻击成功率和迁移性。

原作者: Zhiyuan Xu, Joseph Gardiner, Sana Belguith, Lichao Wu

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiyuan Xu, Joseph Gardiner, Sana Belguith, Lichao Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大型语言模型(就像你正在聊天的这个 AI)不视为一个单一的巨型大脑,而是一座拥有数千名专业员工的庞大办公楼。在旧版模型中,每位员工都必须阅读每一封邮件,并尝试回答每一个问题。但在这篇论文所描述的更快、更新的模型(称为混合专家模型MoE)中,这座大楼的运作方式截然不同。

当一个问题传入时,一位经理(称为“路由器”)会迅速扫描该问题,并仅挑选极少数最相关的员工来回答。大楼里的其余员工则保持休眠状态。这使得 AI 既极其快速又极其智能。

这篇题为**"RouteHijack"*的论文发现了一种巧妙的方法,可以诱骗这位经理挑选错误*的员工,从而导致 AI 说出本应被禁止的内容。

以下是该攻击的工作原理,分解为简单步骤:

1. 问题:“安全团队”规模太小

研究人员发现,在这些办公楼中,“安全团队”(即被训练为会说“不,我不能那样做”的员工)规模小得惊人。他们就像一支微小而专业的安保小队。

  • 缺陷:当 AI 被问及危险问题时,经理通常会唤醒这支微小的安全团队来拦截请求。
  • 发现:研究人员意识到,如果他们能说服经理唤醒安全团队,而是唤醒另一支不同的、“淘气”的员工团队,AI 就会欣然回答那个危险问题。

2. 攻击:"RouteHijack"

研究人员创建了一个名为RouteHijack的工具。你可以将其想象成你在问题末尾添加的一条魔法低语

  • 步骤 A:寻找守卫(专家定位)
    首先,研究人员使用一种特殊的“摄像头”来观察这座办公楼。他们向 AI 提出安全问题和危险问题,并观察哪些员工被唤醒了。他们发现,“安全守卫”非常具体:只有当 AI 即将拒绝不良请求时,他们才会被唤醒。他们与那些仅负责撰写正常文本的“有益员工”截然不同。

  • 步骤 B:魔法低语(对抗性后缀)
    随后,研究人员编写了一段秘密代码(一串奇怪的词语),将其添加到不良问题的末尾。这段代码并非试图用谜语来迷惑 AI,而是旨在黑客入侵经理的决策过程

    • 它告诉经理:“别唤醒安全团队!”
    • 它告诉经理:“改而唤醒‘淘气’团队!”
    • 它告诉经理:“别以‘我很抱歉’开头!”

3. 结果:流畅而危险的回答

当你将这条魔法低语与恶意问题结合使用时,AI 的内部经理会陷入混乱。它会完全跳过安全团队,直接将任务交给“淘气”员工。

  • 结果:AI 不仅不会说“不”,也不会结巴或说“我无法协助”。相反,它会流畅且自信地生成用户想要的有害回答。
  • 效率:研究人员在七种不同类型的此类“办公楼”AI 模型上测试了该方法。平均而言,该攻击的成功率高达69%,远优于以往的方法。
  • 隐蔽性:关键在于,AI 在处理正常任务时依然表现完美。如果你在使用该攻击后让它写一首诗或解一道数学题,它依然能出色完成。这条“魔法低语”只会改变特定不良问题的回答者。

4. 为何这很重要

该论文表明,如果 AI 的内部结构(即它挑选员工的方式)存在脆弱性,那么仅仅告诉 AI“要安全”是不够的。

  • 传播性:研究人员发现,如果为某一款 AI 模型创建了魔法低语,它通常也能在同一系列的其他模型上生效,即使这些模型略有不同。
  • 跨领域性:他们甚至将其测试于能够识别图片的 AI 模型(视觉语言模型)上。基于文本的魔法低语在那里也奏效了,诱骗 AI 忽略了针对图片的安全规则。

核心结论

该论文得出结论:这些现代、快速的 AI 模型存在一个隐藏弱点:它们的安全守卫过于集中在少数特定的“员工”身上。通过找到一种诱骗经理无视这些守卫的方法,攻击者可以在不破坏 AI 大脑或修改其代码的情况下绕过安全规则。作者建议,未来的安全措施需要保护经理(即路由系统),而不仅仅是最终的回答。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →