A Declarative-Procedural Perspective on Expert Routing in Bilingual Mixture-of-Experts Language Models
本研究表明,虽然在混合数据上训练的双语混合专家模型表现出更强的聚合专家专业化,但通过顺序课程暴露进行训练的模型则能发展出更稳定、语言平衡的路由模式,这表明阶段性的双语习得有助于减少单一语言的主导地位,从而实现更具解释性且具备语言结构化组织的特征。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代人工智能广袤的数字思维中,存在着一种旨在处理人类语言复杂性的隐藏架构。这些被称为大型语言模型的系统,并非使用同一套工具来处理遇到的每一个词。相反,它们依赖于一种被称为“混合专家”(Mixture-of-Experts)的结构,其中模型包含许多专门的子网络,即“专家”,以及一个决定哪个专家应该处理每个特定词汇的智能“交通指挥员”。这个交通指挥员,或者说“路由”,是理解机器如何思考的关键。多年来,科学家们一直想知道,当模型同时学习两种语言时,这种内部路由系统是否会形成有意义的组织结构。机器是自然地进行分工,将关于词汇的词语发送给一组专家,而将关于语法的词语发送给另一组专家吗?还是它仅仅是在没有深度语言逻辑的情况下随机移动标记(tokens)?回答这个问题不仅有助于我们理解这些模型是如何运作的,也有助于我们了解它们如何镜像人类大脑区分不同类型知识的方式,例如记忆的事实与构建句子的规则。
一个研究小组致力于通过训练一个具备英语和德语双语能力的类人工智能来调查这种内部组织情况。他们特别感兴趣的是,模型学习这两种语言的顺序是否重要。为了测试这一点,他们创建了两种不同的学习路径。在第一条路径中,模型先被专门教授英语一段时间,随后才逐渐引入德语,模拟人类在掌握第一门语言后学习第二门语言的过程。在第二条路径中,模型从一开始就被喂入英语和德语的随机混合数据,没有任何结构化的进展。研究人员随后在模型处理特定单词的时刻进行密切观察,追踪每个单词被发送到了哪个专家网络。他们将这些单词分为三类:测试词汇知识的、测试语法规则的,以及测试句子结构的。通过分析路由模式,他们可以观察模型是否已经开发出了一套专门的系统来处理这些不同的语言任务。
结果揭示了一个清晰且可衡量的组织模式。研究人员发现,模型确实开发出了一个专门的路由系统,不同的类型的单词会被一致地发送到不同的专家那里。这种组织并非随机产生的;交通指挥员学会了区分词汇、语法和句法,并将每一类发送到略微不同的专家组。这种专业化在模型的中间层最为显著,这表明机器的“思考”部分正是这种分类发生得最清晰的地方。有趣的是,研究人员发现,即使是在那个没有遵循结构化课程、同时学习两种语言的模型中,这种有组织的行为也出现了。这表明,对语言任务进行分类的能力是模型架构的一种自然产物,并不严格依赖于循序渐进的学习进度表才能出现。
然而,模型在两种语言之间平衡注意力的平衡方式,在很大程度上取决于它是如何被教授的。在那个没有计划、同时学习英语和德语的模型中,专业化变得严重向其中一种语言倾斜。交通指挥员会几乎完全专注于英语,或者在某些情况下,几乎完全专注于德语,这取决于训练时的随机初始条件。这造成了一种不平衡,即模型对一种语言高度专业化,但对另一种语言的组织性较低。相比之下,遵循结构化课程(先学英语,后学德语)的模型则开发出了一个稳定且平衡的系统。它在两种语言之间均匀地分配其专门的注意力,确保没有任何一种语言占据主导地位。这一发现表明,虽然机器自然会学习如何对任务进行分类,但需要一个结构化的学习路径来确保它公平且平等地对待两种语言。
该研究得出结论,这些双语人工智能模型确实开发出了一个复杂的语言处理内部地图,但该地图的质量取决于训练方法。如果没有引导,模型往往会偏向于其中一种语言,从而创建一个失衡的系统。通过结构化的方法,它能够实现和谐的平衡。这并不意味着模型正在像人类一样思考,但它确实表明,这些系统背后的数学机制有能力以反映语言自身结构的方式来组织复杂信息。这项研究为我们提供了一个难得的机会,让我们窥见这些数字大脑分配资源的隐藏机制,表明通往双语能力的路径不仅在于接触,更在于这种接触的顺序与平衡。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。