Left-Branching Transformers Excel at Right-Branching Languages: Data Shapes Word Order Preferences in Language Models
本文表明,仅解码器语言模型中的词序偏差并非内在的架构偏好,而是由训练数据驱动的,即由于数据的丰富性和质量,模型倾向于自然语言中的右分支 SVO 结构,从而构成了降低全球词序多样性的风险。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
语言不仅仅是词汇的集合;它是一套关于如何排列这些词以使其产生意义的规则。在某些语言中,动词位于主语和宾语之后,例如“猫吃了鱼”。而在另一些语言中,动词可能排在首位,或者宾语排在主语之前。这种被称为“语序”的排列方式,是人类语言最基本的差异方式之一。几十年来,语言学家一直研究这些模式,以了解人类大脑如何学习和处理语言,并试图寻找可能适用于全球所有人的普遍规则。今天,一种新型的学习者进入了这一领域:人工智能。这些被称为语言模型的计算机程序,通过海量文本进行训练,能够生成类人般的句子。一个关键的问题出现了:这些机器学习语言的方式是否与人类相同,还是它们为单词如何排序发展出了自己的隐藏偏好?
一个研究小组致力于通过测试这些模型如何处理不同的语序来回答这个问题。他们利用两种截然不同的数据类型构建了一个受控实验。首先,他们创建了数百种人工语言。这些不是人类所说的真实语言,而是旨在隔离特定特征的数学构造。想象一下,有一种语言,唯一改变的是形容词是在名词之前还是之后,或者动词是在句首还是句尾。通过剥离真实人类语言中的复杂性——如文化背景、不规则语法和混乱的数据——研究人员可以观察计算机模型是否对某种特定结构具有内置偏好。随后,他们将这些结果与模型在世界各地真实自然语言(从英语、西班牙语到日语和斯瓦希里语)上的表现进行了对比。
研究结果揭示了这些模型行为中一个令人惊讶的分歧。当研究人员在人工语言上训练模型时,计算机一致地偏好一种修饰语位于中心词之前的结构,语言学家称之为“左分支”(left-branching)结构。这种偏好非常强烈,以至于无论句子的基本顺序如何,它都会出现。然而,这种偏好并不符合我们对人类语言学习的认知。人类倾向于追求一致性;如果一种语言将动词放在句末,人类通常会预期句子的其他部分也遵循类似的模式。人工语言的研究表明,这些模型并没有遵循人类逻辑或世界语言中的统计模式。相反,模型似乎偏好一种对其特定架构而言更易于处理的结构,这种偏好独立于任何现实世界的语言规则而存在。
当研究人员切换到现实世界的数据时,故事发生了彻底的变化。当模型在自然语言上进行训练,但仅使用极少量的数据(约5兆字节/MB每种语言)时,它们没有表现出对任何特定语序的明显偏好,对于不同的排列方式都同样适应。然而,随着研究人员增加训练数据的规模(达到约1000兆字节/GB),一个明显的模式出现了。模型开始偏好主语在动词之前、动词在宾语之前的语言,例如英语或中文。这被称为“主-谓-宾”(SVO)语序。有趣的是,随着模型接触的数据增多,这种偏好变得越来越强,尽管另一种“主-宾-谓”(SOV)的顺序在世界语言中实际上更为常见。
研究人员调查了这种转变发生的原因。他们发现,对SVO结构的偏好并不是因为计算机架构本身更擅长理解这种特定顺序,而是完全由喂给模型的数据驱动的。互联网和数字图书馆中最广泛可用的语言——通常被称为“高资源”语言——绝大多数都是SVO语序。由于模型是在这些特定语言的海量文本上进行训练的,它们学会了优先考虑这种结构。当研究人员观察那些仅使用极少可用数据的语言训练的模型时,SVO的优势便消失了。这表明,模型并非在发现某种普遍真理,而是在简单地反映其所能获取信息的失衡状态。
这一发现对语言技术的未来具有重要意义。如果这些模型越来越多地被用于翻译、写作或使用其他语序的语言进行交流,那么存在一种风险,即它们会微妙地推动这些语言向SVO结构靠拢。模型可能会使人们难以使用或理解许多语言赖以表达细微差别、焦点或情感的自然且灵活的语序。这项研究表明,虽然计算机的内部设计可能存在轻微偏见,但其消耗的数据才是塑造其行为的主导力量。随着这些工具变得越来越普及,我们如何策划和选择它们学习的数据,将决定它们是会保护人类语言的丰富多样性,还是会逐渐将其磨平为一个单一、统一的模式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。