Toward a systematic method for identifying language areas
本文提出了一种系统的地理聚类方法,用以识别任意大小的语言区域,从而解决了现有依赖专家的宏观区域定义所存在的空白,并能够更好地将普遍语言属性与局部接触或继承效应区分开来。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图解开人类语言运作之谜的侦探,但你的调查对象不是犯罪现场,而是世界上 7,000 多种语言。这个被称为语言类型学(linguistic typology)的领域,核心在于发现模式。是否所有语言都将动词放在宾语之前?是否所有语言都有声调?当语言学家发现一个模式时,他们想要知道:这是一个关于人类语言结构的普遍规则,还是仅仅因为两个邻居互相借用了词汇而产生的巧合?
为了弄清这一点,科学家们必须玩一场“控制”游戏。他们需要将那些因为拥有共同祖先而相关的语言(如英语和德语)与那些因为住在隔壁并整天聊天而相关的语言(如互相借用俚语的邻居)区分开来。问题在于,这两件事往往同时发生。如果你不考虑地理因素,你可能会误以为某种语言特征是一个普遍规则,而它实际上只是一个局部趋势。为了解决这个问题,研究人员使用了“宏观区域”(macroareas)的概念——即语言极有可能相互影响的大型地理区域。把这些区域想象成一座巨大城市里的不同社区;如果你住在同一个社区,你更有可能拥有相似的习惯,而与住在海洋另一端的人则不同。但直到现在,绘制这些“社区”的界限一直有点像在靠猜:专家们只是看着地图说,“好吧,这整个大陆就是一个社区”,这种方法很混乱,有时也是错误的。
这篇由希拉姆·林(Hiram Ring)撰写的论文提出了一个简单但强大的问题:如果我们不必再去猜测这些语言社区从哪里开始、到哪里结束呢?如果我们可以让计算机为我们画出这些界限呢?作者提出了一种方法,将语言视为地图上的点,并使用一种叫做“聚类”(clustering)的数学工具将它们根据彼此的接近程度进行分组。这就像是把一把五颜六色的弹珠撒在桌子上,让它们根据彼此的距离自然地滚成一堆,而不是尝试用手去分类。
该论文利用来自 8,000 多种语言的数据在大规模范围内测试了这个想法。计算机纯粹基于经度和纬度,将这些语言分成了六个大的“宏观区域”。结果令人惊讶地与语言学家多年来使用的专家绘制的地图非常相似,这表明专家们其实做得相当出色。然而,计算机也发现了一些有趣的差异。例如,它似乎在喜马拉雅山脉和华莱士线(亚洲和澳大利亚之间著名的海洋边界)等自然屏障周围画出了更清晰的界限,而专家有时会模糊这些区域。作者认为,计算机生成的界限在识别真正的语言模式方面可能更准确,因为它们更严格地遵循了物理地理。
研究还缩小了范围,观察了一个著名的较小语言社区——“巴尔干语区”(Balkan sprachbund),在这里,许多不同的语言在几个世纪里混合在一起。计算机成功地将这个区域分解成了 16 个更小的簇。虽然这些簇并不完全符合传统的语言学“语言区域”定义,但它们表明该方法适用于任何规模的地图,从全世界到单个区域都可以。
主要的结论并不是说计算机已经解决了一切。作者谨慎地表示,这仅仅是一个起点。计算机并不了解历史、文化,也不知道地图上的某个特定点是城市的中心还是一个孤独的村庄;它只知道坐标。因此,虽然该方法表明我们可以使用这些数学分组来使我们的研究更加精确,但它并不能取代人类专家验证结果的需求。这篇论文本质上是在主张,我们应该停止仅仅依赖于人工、基于猜测的地图,而是开始使用这些简单的自动化工具来帮助我们绘制更好的边界。通过这样做,语言学家可能会更清晰地看到是什么让真正的人类语言具有普适性,从而将语言的深层规则与邻居的局部习惯区分开来。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。