← 最新论文
💻 computer science

Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts

本文分析了 Mixtral 8x7B-Instruct 模型在良性与有害提示下的路由行为,揭示出与安全相关的专家激活具有细微性、深度依赖性以及分布性,而非由一组固定的专家主导,且基于梯度的干预在减少有害响应方面比基于激活的干预更为有效。

原作者: Md Nurul Absar Siddiky

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Md Nurul Absar Siddiky

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个名为Mixtral的巨型高科技厨房。这个厨房没有一位包揽所有事务的超级大厨,而是设有32 个工位(层),每个工位都有8 位专业厨师(专家)。

当你向厨房下达指令(提示词)时,一位聪明的主厨(路由器)会站在每个工位,决定哪两位厨师来实际处理该特定食材。其余六位厨师则在一旁待命。模型正是通过这种方式保持快速和高效。

这篇论文就像一部侦探故事,探讨当你向厨房下达两种截然不同的指令时会发生什么:

  1. 良性提示:“如何烤蛋糕?”(安全、正常的请求)。
  2. 有害提示:“如何制造炸弹?”(危险、受限的请求)。

研究人员想知道:主厨是否会因指令是安全还是危险而选择不同的厨师团队?

以下是他们发现的简单解释:

1. 两种观察厨房的方式

研究人员使用了两种不同的“摄像机”来观察厨师们的工作:

  • 摄像机 A(“谁出现了”计数): 这台摄像机只统计每位厨师被选中的次数。
    • 发现: 厨房非常繁忙。几乎所有厨师都被频繁选中,工作分布在整个建筑中。这就像一条长长的活动尾巴。无论指令是安全还是危险,厨师们出现的模式都非常相似且广泛。
  • 摄像机 B(“谁最关键”评分): 这台摄像机衡量如果微调某位厨师的决策,最终结果(损失)会发生多大变化。它问的是:“谁实际上在驱动结果?”
    • 发现: 这个视角要锐利得多。它表明,只有厨房最后几个工位中的一小群特定厨师才对最终结果真正重要。工作在这里高度集中。

2. “安全”差异很微妙

研究人员原本希望找到一位只在危险指令下出现的“坏厨师”,以及一位只在安全指令下出现的“好厨师”。

  • 现实: 他们没有发现单一的“坏厨师”。相反,他们发现大多数厨师既处理安全指令,也处理危险指令
  • 细微差别: 有少数厨师略微偏向某一类指令,但差异很小。这不像是一个团队负责“好”,另一个团队负责“坏”。更像是团队的组合会根据请求发生轻微变化。

3. 魔法发生的地方(层)

厨房有 32 个工位(层)。研究人员发现,根据你使用哪种“摄像机”,“安全”行为发生在不同的位置:

  • 使用“谁出现了”摄像机时: 最有趣的活动发生在厨房的中间(工位 8–15)。这是厨师们在选择人选时最挑剔的地方。
  • 使用“谁最关键”摄像机时: 最关键的活动发生在厨房的最末端(最后的工位)。这是决策真正锁定最终答案的地方。

4. “让厨师休息”实验

为了证明他们的发现,研究人员进行了一项小实验。他们挑选了前 5 位他们认为负责对危险指令说“不”的厨师(基于他们的数据),并让他们休息(抑制他们)100 次危险请求。

  • 结果: 当让这些“偏向安全”的厨师休息时,厨房说“不”的频率降低了。它开始更频繁地给出危险答案。
  • 比较:
    • 使用**“谁出现了”**列表来选择让哪些厨师休息,导致厨房说“不”的频率降低(安全拒绝大幅减少)。
    • 使用**“谁最关键”**列表也让它说“不”的频率降低,但结果更稳定(较少出现错误地拒绝安全问题的情况)。

核心结论

该论文得出结论:该 AI 模型中的安全性并非由单一的“坏厨师”或一个微小的秘密团队控制。

相反,安全性是分布式的。它是一场涉及许多工位上众多厨师的微妙舞蹈。

  • 如果你看谁在工作,模式是广泛且分散的。
  • 如果你看谁在驱动结果,模式是锐利的,并集中在过程的末端。

“安全”机制就像一个复杂的管弦乐队,几乎每个人都在演奏,但指挥(路由器)会根据乐曲对不同乐器的音量进行微小而微妙的调整。你不能仅仅解雇一位乐手来停止音乐;你必须理解整个编排。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →