The Geometry of Low-Resource Language Representations
本文表明,由于数据匮乏,大语言模型中的低资源语言在最终层会出现表示退化现象,并展示了在持续预训练期间应用几何正则化可以有效缓解这一问题并提升性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大型语言模型是当今我们使用的许多人工智能工具背后的引擎,它们能够创作故事、解决问题并进行文本翻译。然而,这些系统并非为每种人类语言都进行了同等的构建。虽然它们在处理英语或西班牙语等拥有海量数字文本可供训练的语言时表现得非常出色,但在面对数字资源较少的语言时,往往会表现得非常吃力。这种差距不仅仅是数据量较少的问题;它表明当数据稀缺时,模型的内部信息处理方式就会发生崩溃。科学家们长期以来一直想知道,当模型遇到它见得不够多的语言时,其内部的“大脑”会发生什么,以及它组织意义的方式是否会根据其拥有的信息量而改变。
来自开普敦大学的一个研究小组致力于直接观察这些模型以寻找答案。他们关注的是模型内部表示的几何结构。简单来说,当计算机处理一个词时,它会将该词转化为一组代表其意义的数字列表。这些数字列表存在于一个巨大的多维空间中。研究人员想要观察这个空间的形状如何随不同语言而变化。他们发现,对于数据丰富的语言,这些数字列表分布广泛且清晰,使模型能够保持不同意义之间的独立性。但对于低资源语言,模型似乎坍缩了这个空间,将许多不同的意义强行挤压进一个紧密、拥挤的簇中,导致它们失去了辨识度。研究人员将这种现象称为“表示退化”(representational degeneration),这意味着模型在思考这些语言时,实际上是在失去清晰思考的空间。
为了调查这一问题,该团队检查了九种不同的各类大型语言模型,范围从较小的 10 亿参数版本到较大的 120 亿参数版本。他们分析了这些模型如何表示三十种不同的语言,从英语这样极高资源的语言到奥罗莫语(Oromo)和沃洛夫语(Wolof)这样极低资源的语言。通过测量单词数值表示之间的接近程度,他们发现了一个清晰的模式:一种语言拥有的数据越少,模型的内部表示就越趋于坍缩。这种效应在模型的最终层中最为显著,而这些层正是负责对一个词的含义或下一个词是什么做出最终决定的部分。在这些最终阶段,模型似乎失去了在低资源语言中区分不同概念的能力,从而创造了一个限制性能的瓶颈。
随后,研究人员询问是否可以解决这个问题。他们知道,仅仅增加更多的训练数据对于这些语言来说通常是不可能的,因此他们寻找了一种方法,在被称为“持续预训练”(continued pretraining)的过程中来引导模型的内部几何结构。持续预训练是指一个已经过多种语言混合训练的模型,接受针对特定低资源语言的第二轮专注训练。该团队引入了一种新技术,在训练过程中起到温和引导的作用。他们增加了一条规则,如果模型让单词的数值表示过于接近,则会对模型进行惩罚。这条规则迫使模型保持表示的分布广泛且清晰,从而有效地防止了他们所观察到的坍缩现象。
他们通过将九种不同的基础模型适配到包括基尼亚卢旺达语(Kinyarwanda)、豪萨语(Hausa)和约鲁巴语(Yorùbá)在内的十种非洲语言来测试这种方法。结果显示,这种几何引导起到了作用。与未经此类训练的模型相比,使用这种新规则训练的模型在处理这些语言时保持了更健康、更分散的内部结构。当他们在回答问题或解决数学问题等困难任务上测试这些模型时,改进在较大的模型中最为明显。对于这些较大的系统,几何正则化训练带来了更好的性能,尤其是在最具挑战性的任务上。这项研究表明,帮助这些模型更好地理解低资源语言的关键不仅是喂给它们更多的文本,而且是确保它们组织这些文本的方式保持清晰和明确。
这项工作揭示了关于这些人工大脑如何学习的一个基本事实:可用数据的量塑造了它们思维的结构。当数据稀缺时,存放意义的内部空间会变得拥挤且低效。通过识别这种几何缺陷,研究人员证明了进行干预并纠正它是可能的。虽然在某些领域的改进是适度的,但通过一个简单的训练过程调整就能恢复模型区分概念的能力,这一事实提供了一条充满希望的路径。它表明,通过适当的引导,我们可以帮助这些强大的工具更有效地服务于所有人类语言,在无需等待更多数据出现的情况下,弥合丰富资源与贫乏资源之间的鸿沟。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。