Semantic Space of Parts of Speech
本文通过利用 word2vec 嵌入和神经网络将词汇映射到三维语义空间,揭示了五种语言中词性之间固有的模糊性与边界关系,从而挑战了将词性视为清晰范畴的传统观点。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
语言通常被当作一个由整齐方框组成的系统来教授。我们学习到一个词要么是名词,要么是动词,或者形容词,并且它在同一时间只能属于其中一类。这种清晰的分类有助于我们编写词典和教授语法,但它并不总是符合单词实际运作的混乱现实。有些词感觉同时属于两个地方,或者它们恰好位于类别的边界上,拒绝被固定下来。语言学家长期以来一直怀疑这些边界是模糊的,但证明这一点一直很难,因为传统方法依赖于人类的判断和僵化的规则。现在,来自布拉格查理大学和德国波茨坦大学的研究小组使用了一种不同的方法来绘制这种不确定性。他们没有要求人们决定单词属于哪里;相反,他们通过分析数百万个句子中单词的行为,让单词自己“说话”。
研究人员从一个简单的想法开始:出现在相似情境中的词往往具有相似的含义。这个概念被称为分布语义学,它表明如果你观察一个词所处的“伴随环境”,你就能理解它是什么。例如,一个经常出现在“the”和“big”旁边的词很可能是一个名词,而一个紧跟在“will”或“can”之后的词则很可能是一个动词。计算机可以将这些模式转化为数学地图,其中每个单词都是广阔空间中的一个点。两个点越接近,说明这些词在用法上的相似性越高。该团队更进一步,要求计算机自主学习词性的规则。他们向计算机输入了五种不同语言的大量文本集合:法语、捷克语、芬兰语、俄语和英语。计算机被给予了单词及其标准标签,并被要求寻找连接它们的隐藏模式。
为了理解复杂的数据,研究人员构建了一种特殊的计算机程序——一种神经网络,旨在将所有信息压缩到仅有的三个维度中。想象一个房间里充满了成千上索悬浮的点,每个点代表一个单词。在计算机的思维中,这些点存在于一个拥有数百个方向的空间里,这对于人类来说是无法直观看到的。研究人员强迫计算机将这个空间压平为一个我们可以实际可视化的形状:一个三维地图。在这个地图上,计算机根据词义和用法的相似程度来放置单词。结果不是一份规则清单,而是一幅景观图。在这个景观中,最常见的词类形成了明显的簇(clusters),或者说是从中心点向外延伸出的“触手”。
当研究人员观察这些地图时,他们看到名词、动词和形容词这些传统类别确实是最强的群体。在他们研究的每种语言中,这三组都形成了清晰且独立的形状。然而,它们之间的空间并非空无一物。研究人员发现,许多词并不严格位于某一个“触手”内部,而是位于这些形状接触或重叠的空间里。例如,在法语中,像“forgotten”(被遗忘的)这样既可以作为动词又可以作为形容词的词,被发现就在动词和形容词组的边界上。在英语中,像“laugh”(笑/笑声)或“care”(关心/照顾)这样既可以是名词也可以是动词的词,位于名词和动词触手融合的地方。这证实了语言学家所怀疑的模糊性是真实存在且可衡量的。那些让传统语法感到困惑的词,正是自然生活在这些过渡地带的词。
研究还揭示了关于特定语言的惊人细节。在俄语中,研究人员注意到形容词的短形式(用于描述如“那个人很年轻”这类状态)比其他形容词更靠近动词。这在俄语语法中是合理的,因为这些短形式经常充当句子的主要动作。在芬兰语中——一种与其它语言结构迥异的语言——地图显示副词并没有形成自己的独立组别,而是散布在其他类别之中。这表明在芬兰语中,副词与其他词类之间的界限比在英语或法语中要模糊得多。即使在那些规则看似严谨的语言中,数据也显示出单词会根据其使用方式而发生漂移。
最令人震惊的发现之一是,数词(即数字)经常形成一个单独的组别,尽管传统语法有时将其视为名词或形容词的一种。在法语、捷克语和俄语的地图中,数字远离主要的词类簇,这表明它们具有一种使之区别于其他词汇的独特语义身份。尽管计算机并未被告知去寻找数字,但它纯粹通过分析现实文本中单词的使用方式发现了这一模式。研究人员还发现,单词的分组方式会根据具体的数据集而改变,这表明边界不是固定的,而是流动的。
研究人员的目的并不是要创造一本新的语法书,也不是为了证明某种语言比另一种更好。他们的目标是观察当我们让数据来决定类别时会发生什么。他们发现,虽然名词、动词和形容词这些主要类别是强大且稳定的,但边缘是柔软的。单词经常同时属于多个类别,或者根据语境发生偏移。这项研究表明,我们用于教授语法的那些僵化的方框虽然是有效的工具,但它们并不能捕捉到语言运作的全貌。一个词的真实本质不是一个单一的标签,而是在一个广阔且不断变化的、可以靠近许多不同概念的空间中的一个位置。
通过将这些关系可视化,研究人员提供了一种看待语言结构的新方式。我们不再争论一个词究竟是名词还是动词,而是可以精确地看到它相对于两者所处的位置。这种方法并非取代旧规则,而是增加了一层深度,展示了人类交流的复杂性。这些地图表明,语言不是一系列孤立岛屿的集合,而是一个连续的景观,词汇在其中相互流动。这项研究证实,语言的模糊性并非错误或缺陷,而是我们使用单词来描述世界的一个基本特征。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。