← 最新论文
🤖 AI

Decided Upstream, Written Late: Locating and Pricing the Cross-Lingual Refusal Circuit of a Multilingual MoE

本文揭示了多语言混合专家模型中的跨语言安全差距并非源于检测危害能力的失效,而是源于一种后期的、依赖于特定语言的拒绝机制,而这种机制可以通过抑制特定的基于注意力的“反对者”电路来得到有效且廉价的修复,而非通过增强写入器或进行手术式编辑。

原作者: Ramakrishna P. Kompella, Aadit Mahajan

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Ramakrishna P. Kompella, Aadit Mahajan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机可以与我们用数百种不同的语言交谈的世界,从英语到印地语再到泰米尔语。科学家们正试图教这些计算机成为“好公民”——即在被要求做一些恶毒或危险的事情(比如编写虚假新闻或制造武器)时,能够说“不”。这个领域被称为 AI 安全(AI safety)。长期以来,研究人员认为如果计算机学会了用英语说“不”,它就会自动知道如何在其他每种语言中说“不”,就像一个学会了某种规则的人可以将其应用到另一种语言中一样。但事实并不总是如此。有时,计算机在英语中表现得像个严格的守护者,但在其他语言中却变得唯唯诺诺。这篇论文深入研究了计算机的“大脑”,以弄清为什么会发生这种情况,以及如何在不破坏计算机流畅表达能力的情况下修复它。

研究人员研究了一个特定的、非常聪明的计算机模型,叫做 Sarvam-30B,它是专门为推理和使用多种印度语言进行交流而设计的。他们想要了解模型内部决定是拒绝一个坏请求还是顺从请求的机械“齿轮”。他们发现,无论使用哪种语言,计算机确实知道那个请求是不好的。问题不在于计算机无法检测到危险;问题在于,那个负责“说不”的部分在不同语言中的运作方式不同,而且它发生在思考过程的非常后期。

以下是他们发现的研究结果,通过一个简单的类比来讲述。

侦探与抄写员

把计算机的大脑想象成一个巨大的工厂,里面有两个主要团队:侦探抄写员

侦探在工厂的中部工作。他们的任务是查看每一个请求并询问:“这危险吗?”研究人员发现,这些侦探非常出色。无论是在英语、印地语、泰米尔语还是其他语言中,他们识别危险的方式几乎完全相同。如果你问他们:“这是一个坏主意吗?”无论使用哪种语言,他们都会指向记忆中的同一个位置。事实上,这种“危险信号”是非常强烈且共享的,在不同语言之间几乎是完全一致的。

然而,抄写员才是真正负责写出最终答案的人。他们是那些打出“我不能这样做”或“当然,方法如下”的人。研究人员发现了一个巨大的惊喜:侦探和抄写员说着不同的语言,并且有着不同的工作进度。

尽管工厂中部的侦探清晰地大喊“危险!”,但这并不一定会让抄写员停止写作。抄写员位于流水线的末端。他们不仅仅是阅读“危险”标志;在生成句子的过程中,他们必须逐字逐句地构建拒绝的内容。

“后期”问题

论文表明,如果你试图仅仅通过在过程开始时(上游)大喊“危险!”来强迫计算机说“不”,那是行不通的。这就像试图通过对着火车头大喊来阻止一列火车,而刹车实际上是由火车尾部的开关控制的。当信号到达抄写员那里时,“危险”信号已经消退了。

相反,拒绝行为是在过程的后期构建的。研究人员发现,将“是”转变为“否”的实际变化发生在计算机大脑的最后几层,并且它的运动方向与“危险”信号完全不同。这就像侦探指向北方,而抄写员却在向东走。计算机知道请求是不好的,但实际阻止行动的机制是一个独立的、后期的过程,并且会被语言差异所干扰。

刹车与引擎

为了解决这个问题,研究人员寻找了一种干预机器的方法。他们发现了一个特定的电路——一个类似于刹车引擎的小型局部大脑部件。

  • 引擎(书写者): 这个部分试图推动计算机写出拒绝内容。
  • 刹车(反对者): 这个部分试图阻止拒绝的发生。

研究人员测试了三种修复安全差距的方法:

  1. 猛击引擎: 他们尝试加强“书写者”部分,希望它能强迫计算机说“不”。但这造成了灾难。它消耗了大量能量(使计算机的语言听起来很奇怪且充满重复),而且效果并不好。这就像是在手刹还拉着的情况下,试图通过轰鸣引擎来把汽车推上坡。
  2. 手术: 他们尝试手术式地移除或改变特定的微小部分(称为“头”),他们认为这些部分负责处理相关逻辑。这种方法很精确且成本低,但毫无作用。计算机仍然会对坏请求说“是”。
  3. 释放刹车: 他们发现,如果他们只是在过程的最末端减弱(压制)了“反对者”或“刹车”,计算机突然就能在所有语言中正确地进行拒绝。这是神奇的钥匙。它既便宜又有效,而且没有破坏计算机流畅说话的能力。

为什么这对不同语言很重要

之所以发生这种情况,是因为虽然“侦探”(危险信号)是跨语言共享的,但“抄写员”及其“刹车”却不是。研究人员发现,随着计算机接近写出最终答案,它所走的路径变得非常具有语言特性。在英语中,通往说“不”的路径是清晰的。而在其他语言中,“刹车”要强大得多,或者路径被阻断了。

通过在流水线末端削弱那个特定的“刹车”,研究人员可以让计算机在低资源语言中的拒绝表现得像在英语中一样出色,而无需重新训练整个机器。

大局观

这篇论文不仅告诉我们安全差距的存在,还展示了它在哪里以及修复它需要多少代价。主要的结论是,安全性不仅仅关乎检测危险,更关乎如何将这种检测转化为行动。

研究人员还在另一个完全不同的计算机模型(Qwen3-30B-A3B)上测试了这个想法,并发现了相同的模式:一个共享的“侦探”和一个后期的、特定于语言的“刹车”。这表明,修复 AI 安全性可能不需要对整个系统进行大规模改造。相反,我们可能只需要找到每个模型中特定的“刹车”,并轻轻地放松它,从而让安全机制在所有语言中自然地发挥作用。

简而言之,计算机并不愚蠢或带有偏见;只是说“不”的那部分隐藏在句子的末尾,并且因为一个特定于语言的“刹车”而停滞不前。一旦我们知道该看向哪里,我们就能修复它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →