GLeMM: A large-scale multilingual dataset for morphological research
本文介绍了 GLeMM,这是一个大规模、全自动且多语言的派生形态学数据集,涵盖了七种欧洲语言,旨在为词法形成中形式与意义关系的数据驱动研究和计算测试提供支持。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
语言是一个生命系统,单词在其中不断演变,通过分裂与合并来创造新的含义。当我们把“happy”(快乐)变成“happiness”(幸福),或者把“teach”(教)变成“teacher”(教师)时,我们正在参与一种被称为“派生”(derivation)的过程。这就是人类如何从简单的词根构建复杂概念,从而扩展词汇量的方式。几十年来,语言学家一直试图绘制这些联系的图谱,探究为什么有些单词的变化遵循可预测的规律,而另一些则似乎遵循各自独特的规则。他们曾好奇,不同文化之间构建新词的方式是否相同,还是每种语言都有其自身的秘密逻辑。直到最近,回答这些问题仍需依赖专家的直觉和经过人工挑选的小规模示例列表。这有点像通过观察一朵云来试图理解天气;你可能会捕捉到某种模式,但却会错过整场风暴。
一组研究人员现在建立了一个庞大的数字图书馆,旨在改变我们研究这一过程的方式。他们创建了一个名为 GLeMM 的资源,代表“大规模多语言词形构建数据集合”(a large-scale multilingual collection of word-formation data)。他们没有依赖小规模列表,而是收集了涵盖七种欧洲语言(英语、法语、德语、意大利语、波兰语、俄语和西班牙语)的近 120 万对相关词汇的信息。其目标是超越猜测,利用海量数据揭示语言增长的真实结构。通过自动化寻找这些联系的过程,研究人员得以观察到此前无法察觉的模式,从而更清晰地描绘出在创造新词时,形式与意义是如何相互作用的。
研究人员并没有坐下来手动记录每一个单词的联系。相反,他们转向了维基词典(Wiktionary)——一个任何人都可以编辑的免费在线词典。他们意识到,人们为单词编写的定义往往包含了关于这些单词如何相互关联的线索。例如,如果“spryness”(矫健)的定义是“the property of being spry”(矫健的属性),那么单词“spry”(矫健)就在解释之中。该团队开发了一种计算机方法来扫描数百万个这样的定义,寻找那些其中一个词是用另一个词来定义的词对。随后,他们检查这两个词看起来是否足够相似以至于具有相关性,例如是否共享一个共同的词根。通过将这些发现与其他的相关词列表进行交叉验证,他们过滤掉了随机匹配项,仅保留了那些显示出一致且重复模式的词对。这使他们能够为每种语言构建一个庞大的词族网络,捕捉从简单的后缀(如“-ness”)到涉及前缀及多步变化的复杂变化。
他们的发现挑战了一些关于语言运作方式的长期观点。长期以来,许多语言学家认为词族就像完整的网,其中词族中的每个词都与其他所有词直接相连。如果你有一个表示“旅行”的词、一个表示“旅行者”的词和一个表示“正在旅行”的词,理论上认为它们构成了一个完美的三角形。然而,来自 GLeMM 的数据表明,情况很少如此。在庞大的数据集中,大多数词族并不是完美的网,而是更像一个带有辐条的中心轮毂,新词从主词根向外分支,但不一定彼此连接。研究人员发现,只有极小比例的词组形成了这种完美的三角形。事实上,在每 100 对理论上可以构成三角形的单词对中,实际上只有寥寥数对。这表明我们构建单词的方式比之前认为的更具方向性和层级性,即存在从基础词到其派生词的清晰流动,而非混乱的相互连接之网。
这项研究还阐明了不同语言如何处理相同的概念。虽然研究中的所有七种语言都会创造新词,但它们使用的工具和频率各不相同。例如,研究人员观察了语言如何表达“再次做某事”的概念。在法语中,他们发现了一种特定的模式,即通过在动词前添加前缀来反转动作,从而创造出一个镜像原词的全新词族。在英语中,类似的模式也存在,但并不那么统一。数据集显示,虽然词形构建的底层逻辑是共通的,但具体的规则却有显著差异。一种语言可能倾向于结合两个现有的词来造新词,而另一种语言则可能倾向于在单个词后加上一个小结尾。研究人员还发现,有些词形构建是“倒置”的。有时,一个较短的词实际上是由一个较长的词派生而来的,尽管看起来那个较短的词应该是词根。数据帮助识别了这些反向模式,因为研究人员发现它们出现的频率远低于标准方向,从而能将它们识别为规则中的例外情况。
尽管该项目规模宏大,研究人员仍谨慎地指出,他们的资源并非完美无缺。由于数据是从一个公共词典中自动采集的,因此包含了一些错误和不一致之处。某些看似相关的词对可能并不相关,某些定义也可能略有偏差。然而,由于集合规模巨大,这些错误非常罕见,不足以扭曲整体图景。研究人员估计,英语和法语部分的词对准确率非常高,超过 90%。该资源旨在作为一个进一步调查的起点,让其他科学家可以根据大量的现实世界数据来测试自己的理论。它不是语言之谜的最终答案,而是一个强大的新工具,让我们能够以此前无法实现的清晰度去观察词形构建的景观。
GLeMM 的创建代表了研究语言方式的一种转变,即从小规模、精选的示例转向大规模、数据驱动的探索。通过将词典视为包含数百万种关系的活体语料库,研究人员为人类语言的隐藏架构开启了一扇窗口。他们证明了虽然语言各异,但它们遵循某些可以被测量和观察的结构原则。研究结果表明,我们构建单词的方式并非随机的习惯集合,而是一个具有明确模式、例外和特定方向的结构化系统。随着研究人员计划将这项工作扩展到更多语言并完善其方法,这一资源有望深化我们对人类大脑如何从声音中创造意义的理解。它提醒我们,我们所说的每一个新词都是宏大且互联的历史的一部分,而现在,我们第一次拥有了一张足以看清整个疆域的地图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。