← 最新论文
💬 NLP

Test, then Route: How Language Models Execute In-Context Conditional Rules Across Models and Languages

本文通过激活补丁(activation patching)技术证明,尽管语言模型在中间层残差带中模块化地编码了条件谓词的真值,但基于这些条件进行答案路由的机制并非一种抽象且可迁移的模块,而是一个与标记绑定、针对特定对(pair-specific)且随模型和语言而变化的过程。

原作者: Luxshan Thavarasa, Sivasuthan Sukumar

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Luxshan Thavarasa, Sivasuthan Sukumar

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明的机器人,它能读懂你的心思并替你完成句子。研究这些机器人的科学家们被称为“大语言模型”,他们就像侦探一样,试图弄清楚这个机器人是如何思考的。他们不仅观察机器人的最终答案,还想在机器人工作时窥视其内部的“大脑”,看看哪些部分在执行什么任务。一个巨大的谜团是,机器人如何处理它即时学习到的规则,比如“如果数字很大,就说‘狗’;否则,就说‘猫’”之类的情况。机器人是否有一个专门的、可重复使用的开关,每次都会在“狗”和“猫”之间切换?还是它每次都从头开始推导答案,将规则与答案混合在一起,以一种混乱的方式进行处理?理解这一点至关重要,因为如果我们确切知道机器人是如何做决定的,我们或许就能更好地教它规则,或者阻止它犯错。

这篇论文深入探讨了正是这样一个问题。研究人员设计了一个游戏,要求三个不同的 AI 模型在六种不同的语言中遵循简单的“如果-那么”规则。他们使用了一种被称为“激活补丁”(activation patching)的巧妙技巧,这就像是用来自不同场景的一个想法来替换机器人脑中的某个特定想法,以此观察机器人是否会改变其答案。你可以把它想象成更换汽车引擎里的燃料,来看看汽车是否仍能运行。

以下是他们的发现,结果有点令人惊讶:机器人的大脑被分为两个截然不同的区域。第一个区域,我们称之为 TEST,它就像是一个专门的、模块化的开关。当机器人检查一个数字是否大于 5 时,大脑的这个特定部分会亮起“真”或“假”的信号。研究人员通过将这个“真/假”信号与另一个信号进行交换,并发现机器人立即改变了最终答案以匹配新信号,从而证明了这一点。这个“Test”区域在不同的模型、不同的语言(甚至是泰米尔语和僧伽罗语)以及不同类型的规则下,其运作方式都是一致的。它是一个干净、可重复使用的模块。

然而,第二个区域,我们称之为 ROUTE,则完全是一团乱麻。这个部分本应接收那个“真/假”信号,并决定输出“狗”还是“猫”。研究人员试图在脑中寻找一个专门处理这种路由(routing)的“开关”或“子空间”。他们找到了一个似乎能完美地在“狗”和“猫”之间切换答案的方向。但问题在于,当他们尝试将同一个开关用于另一对词汇,比如“狐狸”和“猫头鹰”时,它完全失效了。这就像是找到了一把能打开特定门的钥匙,但即使面对看起来一模一样的其他门,它也无法打开。

因此,最终的结论是一种不对称性。大脑中“检查”规则的部分是一个稳固、便携且可重复使用的工具。但“交付”答案的部分并不是一个独立的、可重复使用的工具。相反,它似乎与所使用的特定词汇紧密地粘合在一起。如果你改变了词汇,“路由”机制就会崩溃。机器人并没有一个通用的“答案开关”;它只是针对它刚才学习到的特定词汇,拥有一种特定的输出答案的方式。这意味着,虽然我们可能很容易地引导机器人的逻辑(“Test”),但想要引导它的具体选择(“Route”)可能比我们预期的要困难得多,也更不可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →