← 最新论文
💻 computer science

MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks

MASCing 是一种轻量级且无需重新训练的框架,它通过利用基于 LSTM 的代理模型来优化路由门控上的转向掩码,从而将混合专家(MoE)模型配置为适应多样化的安全场景,进而在不损害通用效用的前提下实现对特定行为的目标性增强或抑制。

原作者: Jona te Lintelo, Lichao Wu, Marina Krček, Sengim Karayalçin, Stjepan Picek

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Jona te Lintelo, Lichao Wu, Marina Krček, Sengim Karayalçin, Stjepan Picek

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,大型语言模型(LLM,就像那些驱动聊天机器人的模型)就像一支庞大、高科技的交响乐团

在旧模型中,每一位乐手(参数)都会为模型唱出的每一个音符演奏乐器。这既嘈杂、昂贵,又缓慢。

**混合专家模型(MoE)**则不同。它们就像一支庞大的乐团,对于每一个音符,只有一小部分特定的乐手被叫来演奏。其余的则保持沉默。一位“指挥家”(路由器)决定哪一组 2 到 4 位乐手为每个单词演奏。这使得模型运行得更快、成本更低。

然而,这个系统出现了一个新问题:指挥家是薄弱环节。

问题:“糟糕的指挥家”

因为每次只有少数乐手演奏,一个狡猾的捣乱者(攻击者)可以尝试欺骗指挥家,叫来错误的乐手组。

  • 场景 A(越狱): 捣乱者要求模型做坏事(例如编写炸弹手册)。模型通常会说:“不,那很危险。”但捣乱者可能会通过多轮对话绕弯子提问,迷惑指挥家,使其叫来“有害”乐手组,而不是“安全”乐手组。
  • 场景 B(过度拒绝): 有时,模型过于谨慎。它拒绝撰写关于虚构反派的故事,因为它认为“反派”意味着“坏”。开发者可能希望模型在特定语境下被允许撰写此类故事,但指挥家却不断叫来“拒绝”乐手组。

通常,要解决这个问题,你必须解雇整个乐团并雇佣新乐团(重新训练),这需要数月时间且耗资巨大。

解决方案:MASCing(“智能乐谱”)

这篇论文介绍了MASCing(MoE 激活引导配置)。不要把它想象成解雇乐团,而是交给指挥家一份特殊的、预先写好的乐谱(引导掩码),微妙地引导他们为每项任务挑选正确的乐手,而无需更换乐手本身。

以下是 MASCing 工作的三个简单步骤:

1. “替身”侦探(学习模式)

首先,研究人员训练一个微小、快速的 AI(LSTM)充当侦探。这位侦探在模型对话时观察“指挥家”的音符(路由 Logits)。

  • 它学习到:“当指挥家看到这些特定音符时,模型通常会拒绝回答。”
  • 它同时也学习到:“当指挥家看到这些音符时,模型通常会同意撰写故事。”
  • 关键在于,侦探不仅查看谁实际演奏了,还查看指挥家正在考虑的潜在音符,从而保留所有隐藏信息。

2. 寻找“安全电路”(掩码)

随后,侦探会找出指挥家乐谱上究竟需要微调哪些音符,以获得期望的结果。

  • 如果我们想阻止不良回答,侦探会找出导向“安全”的音符并增强它们,同时抑制导向“危害”的音符。
  • 如果我们想允许特定回答(例如在安全语境下的成人内容),它会找出导向“拒绝”的音符并抑制它们,同时增强导向“合规”的音符。

这就生成了一个引导掩码。想象它就像一支荧光笔,在指挥家的乐谱上标记出特定位置。它不改变音乐本身,只是告诉指挥家:“嘿,请特别关注这些特定音符。”

3. 演出(推理)

当模型实际运行时,系统会实时应用此掩码。

  • 指挥家查看音符。
  • 掩码给音符添加微小的“推动”。
  • 受此推动影响,指挥家会选择“安全”乐手组,而不是“有害”乐手组(反之亦然)。

他们取得了什么成就?

研究人员在七种不同的 MoE 模型上测试了该方法,旨在实现两个截然不同的目标:

  1. 阻止越狱(盾牌): 他们利用 MASCing 使模型更能抵抗那些试图在多轮对话中诱骗模型说出坏话的捣乱者。

    • 结果: 模型阻止不良请求的比例从52%提升至84%
    • 类比: 指挥家变得更难被诱骗去叫来“坏”乐手组。
  2. 允许特定内容(钥匙): 他们利用 MASCing 使模型更少拒绝那些实际上符合政策允许的成人内容请求。

    • 结果: 模型同意撰写此类故事的比例从52%提升至82%
    • 类比: 指挥家不再因恐慌而对每个关于反派的故事都叫来“拒绝”乐手组,从而允许“创意”乐手组演奏。

为什么这很特别?

  • 无需重新训练: 你不必重新教导整个乐团。你只需更换乐谱(掩码)。
  • 快速: 在强大的计算机上训练“侦探”仅需约 5 分钟。应用掩码几乎不花时间。
  • 灵活: 你可以瞬间更换掩码。如果规则明天改变,只需生成一个新的掩码。
  • 安全: 它不会破坏模型进行数学运算或撰写普通邮件的能力。它只是微调了决策过程中的“安全”部分。

简而言之,MASCing 是一种轻量级、即时的方法,用于告诉智能 AI:“针对这一特定情况,请听取另一组专家的意见”,而无需从头重建 AI。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →