← 最新论文
💬 NLP

Losing My Composure: Predicting Compositionality Over Time

本文介绍了一个用于预测德语和英语名词复合词组合性历时趋势的新型数据集和任务,揭示了其透明度随时间仅有轻微下降,并证明了在捕捉这些渐进变化方面,基于狭窄且具有特定时间切片的语义模型优于基于广泛历史窗口训练的模型。

原作者: Chris Jenkins, Emma Raimundo Schulz, Filip Miletić, Sabine Schulte im Walde

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Chris Jenkins, Emma Raimundo Schulz, Filip Miletić, Sabine Schulte im Walde

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

将语言想象成一座巨大且繁忙的城市,其中的单词就像是建筑。有些建筑是仅由一块砖头构成的简陋棚屋;而有些则是通过将两个较小的建筑拼接在一起而建成的复杂摩天大楼,比如“coffee house”(咖啡馆)或“freight train”(货运列车)。长期以来,语言学家对这些摩天大楼一直有一种直觉:他们认为随着这座城市的变老,这些建筑会逐渐失去它们的“蓝图”。他们相信,经过几个世纪,一个“coffee house”将不再看起来像是一个用来喝咖啡的房子,而是变成一个奇怪、神秘的单元,你必须死记硬背它,从而失去它与“coffee”和“house”这两个词之间的联系。

这篇论文就像是一群决定测试这种直觉的时光旅行侦探。他们并没有只观察两个时期的城市快照(过去的一个和今天的一个),相反,他们制造了一台高速摄像机,每十年拍摄一张照片,持续了数百年的时间。他们专注于 23 个德语和 26 个英语的复合词,比如“bosom friend”(挚友)或“Kaffeehaus”(咖啡馆),并要求人类志愿者在 0 到 5 的刻度上进行评分,评估在每个特定的十年中,整个单词的含义在多大程度上仍与其组成部分的含义相匹配。

大惊喜:蓝图依然稳固
侦探们发现,旧有的直觉在很大程度上是错误的。他们并没有发现一种大规模的、全城范围内的趋势,即这些词汇建筑正在崩塌成谜团。事实上,这些变化微乎其微,几乎难以察觉。如果测量这些单词随时间变化的“透明度”,平均变化是一个微小的负值(英语约为 -0.016,德语约为 -0.001)。这就像每十年检查一次摩天大楼的高度,却发现它甚至连一粒沙子的增减都没有。论文表明,与普遍观点相反,这些复合词通常能保持其“建筑方案”的完整;它们并不一定会因为时间的流逝而变得不再符合逻辑或变得更加习语化。

时光旅行摄像机
为了进行这些测量,该团队构建了大约 100 个不同的“摄像机”(计算机模型)来模拟一个单词在不同时代是如何被理解的。他们尝试了两种主要的类型:

  1. “上下文感知型”摄像机(类似于现代的 BERT): 这些是高端、高科技的镜头,它们通过观察目标词周围的词来理解其含义,就像你会根据“bank”旁边是“river”(河)还是“money”(钱)来理解这个词的不同含义一样。
  2. “静态”摄像机(类似于 Word2Vec): 这些是更简单的镜头,它们根据一个词的历史给出单一、固定的定义,就像一个永远不会改变的字典条目。

他们还测试了向这些摄像机输入多少“历史数据”量。有些被喂入了长达 50 年的历史数据块(“全量”窗口),而另一些则只喂入了一个十年的数据,或者是一个随时间推移逐年增长的滑动窗口。

结果:少即是多
这里剧情变得复杂了。团队发现,那些“高端”的上下文感知型摄像机并不一定能在比赛中胜出。事实上,那些更简单的、静态的摄像机表现得同样出色,甚至在预测组合性随时间变化方面表现得更好。

更重要的是,论文指出,喂给摄像机的历史数据“规模”至关重要。当他们使用长达 50 年的大段文本(“全量”计划)来训练模型时,模型会感到困惑并错过那些细微的、逐十年的变化。然而,当他们使用狭窄的、单十年的切片(“十年”计划)进行训练时,模型的表现与人类评分的契合度更高。这就像试图通过阅读一份 50 年前的报纸存档来理解一座城市的情绪,其效果不如阅读你感兴趣的那一天的日报。论文表明,对于追踪这些微小且渐进的变化,你需要聚焦于特定的十年,而不是将其与过去模糊地混合在一起。

结论
那么,最终的定论是什么?这篇论文并不声称它已经永远解决了语言之谜。相反,它暗示了“复合词必然会随着时间推移而变得‘缺乏组合性’”这一观点很可能是一种夸张。变化确实存在,但它们是微小且杂乱的,而不是一条向下的直线。

这项研究也警告我们,虽然高端 AI 模型很酷,但它们并不总是进行历史侦探工作的最佳工具。有时,一个基于非常特定的时间切片(仅一个十年)训练的简单模型,比一个基于半个世纪数据的超复杂模型更准确。作者使用统计得分(例如最好的英语模型 R² 值约为 0.36)来衡量这些结果,这表明计算机的猜测与人类评分之间存在着相当不错但并非完美的匹配。

最后,这篇论文提醒我们,语言是一场旅程,但对于这些特定的词汇建筑而言,这场旅程并未演变成一场向混乱的剧烈崩溃。它们大多保持了最初的蓝图,岁岁年年,证明了有时,观察过去最简单的方法就是一次只看一年。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →