Discovering Cross-Language Reasoning Invariance in LLMs with Geometry-Invariant Sparse Autoencoders
本文通过引入几何不变稀疏自编码器(GI-SAE)来识别跨语言的共享特征,研究了多语言大语言模型中的跨语言推理不变性,揭示了尽管这些模型可以学习到语言不变的表示,但其功能可互换性以及这些特征出现的特定层,会随模型架构的不同而显著变化。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是当今许多最先进人工智能工具背后的引擎,它们能够阅读、写作并用数十种语言解决问题。多年来,研究人员一直在思考这些系统是如何处理多语言复杂性的。当一个模型用英语解决一道数学题,然后又用中文解决完全相同的题目时,它是在两种语言中使用相同的内部思维机制,还是为每种语言切换了一套完全不同的规则?这个问题至关重要,因为如果模型使用一种共享的内部语言进行推理,我们就能通过理解一次逻辑,将其应用到它所使用的每种语言中。然而,如果它依赖于各自独立的、特定于语言的路径,那么理解一个版本的模型对于理解其他版本几乎毫无帮助。机械解释性(mechanistic interpretability)领域试图深入观察这些模型的内部,将其内部状态视为可以被映射和理解的复杂电路板。
一个研究小组通过窥探五个不同大语言模型的内部运作方式,试图回答这个问题。他们专注于一个特定的任务:解决小学数学题。他们选取了一个包含 250 道数学题的数据集,并要求每个模型用六种不同的语言来解决这些问题:英语、德语、法语、西班牙语、俄语和中文。为了确保比较的对象是同类事物,他们只保留了那些模型在每种语言中都能得出正确答案,并能产生清晰、逐步推理路径的题目。随后,研究人员记录了模型在处理过程各个阶段的内部活动,捕捉了计算机在思考解决方案时,内部产生的类似于电信号的具体模式。
为了理解这些复杂的信号,研究人员使用了一种称为“稀疏自编码器”(sparse autoencoder)的工具。你可以将它理解为一种将模型的混乱噪声转化为一组截然不同、可理解概念的方法。就像人类通过列出关键元素(如天空、树、狗、汽车)来描述一个场景一样,自编码器将模型的活动分解为一组活跃的特征。研究人员为模型的每一层都训练了两个版本的这种工具。第一个版本仅仅学习如何描述它所看到的一种语言中的内容。第二个版本则接受了特殊指令进行训练:它必须学会使用同一组特征来描述同一个数学问题,无论该问题是以英语还是中文呈现。第二个版本旨在迫使模型寻找共同点,即一种用于推理的共享内部语言。
结果揭示了关于这些模型如何思考的一个令人惊讶的现实。研究人员发现,仅仅让内部描述在几何特征上看起来更相似,并不能保证模型实际上正在使用相同的逻辑。在某些模型中,迫使内部特征在不同语言间对齐,使得模型的推理更加稳健且具有互换性。而在另一些模型中,这完全没有效果;甚至在一种情况下,当他们尝试将一种语言的推理部分与另一种语言进行交换时,这种做法反而降低了模型的性能。这是因为这些模型已经形成了非常不同的习惯。一类模型在处理问题的过程中自然地发展出了一种共享的思维方式,因此新的训练有助于优化这一共享路径。另一类模型已经建立了如此强大的共享结构,以至于新的训练无法为其增添任何东西。第三类模型则保持了语言的高度隔离,试图强行将它们结合在一起的做法引发了混乱而非清晰。
这项研究调查了来自四个不同家族、规模从 17 亿到 40 亿参数的五个特定模型。他们发现,创造共享推理语言的成功与否完全取决于模型现有的架构。在那些表现出“收敛”(convergent)模式的模型中(即共享特征随着模型处理问题的深入而变得更加强大),新的训练方法表现完美,提升了模型在每一层测试中跨语言推理的能力。在那些已经处于“饱和”(saturated)状态(即已拥有大量共享特征)的模型中,新的训练没有带来益处,有时甚至破坏了模型的自然流转。而在那些保持“低共享”(low-sharing)状态(即语言保持相对独立)的模型中,尽管新的训练在纸面上让内部信号看起来更相似,但未能建立起功能性的桥梁。
这项工作挑战了该领域的一个普遍假设:即如果两件事在图表上看起来相似,它们的功能也必然相同。研究人员证明,一个模型的特征即使在不同语言间实现了几何上的对齐,在实际运作中仍可能无法互换使用。他们表明,理解多语言模型的路径并非千篇一律。相反,模型的内部逻辑与其特定的设计深度绑定。有些模型自然地构建了一个通用的推理引擎,而另一些模型则将它们的语言锁在不同的房间里。研究人员得出结论,要真正理解人工智能如何在不同语言间思考,我们必须观察每个模型的特定架构,而不是假设它们都遵循相同的隐藏规则。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。