ReFRAME or Remain: Unsupervised Lexical Semantic Change Detection with Frame Semantics
本文介绍了 ReFRAME,这是一种基于框架语义学的无监督词汇语义变化检测方法,它在提供高度可解释性的同时,为神经嵌入模型提供了一种具有竞争力的替代方案,并展示了与之相当甚至更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
词语并非静态的物体;它们是活生生的生命,随着使用它们的人的变化而生长、移动和适应。在语言学研究中,这一过程被称为语义演变(semantic change)。几十年来,科学家们一直试图利用计算机来追踪这些变化,通常依赖于海量的文本数据库,以观察一个词所处的“邻里环境”随时间如何变化。主流观点认为,如果一个词在不同时代出现在不同种类的词汇旁边,那么它的含义很可能已经发生了演变。现代计算机程序非常擅长识别这些模式,但它们往往像一个“黑箱”:它们能告诉你发生了变化,却无法轻易解释为什么发生,也无法展示其背后的具体原因。其结果是一个正确的答案,却显得晦涩难懂,使研究人员无法清晰地洞察意义转化的实际机制。
来自鲁汶大学(KU Leuven)及其他机构的一组语言学家和计算机科学家决定尝试一条不同的路径。他们不再要求计算机根据统计模式来猜测一个词的含义,而是要求它观察该词被使用的特定情境,即“框架”(frames)。这种方法借鉴了一种被称为“框架语义学”(Frame Semantics)的理论,该理论认为我们理解词语并非孤立地理解,而是通过它们所唤起的心理图景。当你听到“买”(buy)这个词时,你的大脑会自动构思出一个涉及买家、卖家、商品和金钱的场景。当你听到“卖”(sell)时,场景是一样的,只是视角转向了卖家。研究人员假设,如果一个词的含义随时间发生变化,那么它参与的场景类型也会随之改变。他们不想依赖隐藏的数学模式,而是希望利用这些明确的、结构化的场景作为透明的信号,来检测词义何时发生了转化。
为了测试这一想法,该团队将研究重点放在英语上,使用了分为两个截然不同时期的庞大文本集:19世纪中期和20世纪末。他们挑选了一系列已知含义发生变化的词汇,并使用计算机程序分析了包含这些词的所有句子。该程序不仅仅是统计词汇出现的频率,还识别了每个句子所属的具体概念框架。例如,它会判断关于“plane”一词的句子是在讨论正在起飞的飞机,还是在讨论几何学中的平面。通过比较这两个时期不同框架出现的频率,研究人员可以衡量一个词的使用方式发生了多大的偏移。他们基于这些场景分布在不同时代之间的差异程度计算出了一个得分。
结果非常令人惊喜。这种完全依赖于这些明确框架的方法,表现优于许多使用复杂且隐藏数学表示的最先进计算机模型。事实上,他们的系统在一次旨在测试此类任务的国际大赛中名列前茅。更重要的是,由于该方法是建立在清晰、人类可理解的类别之上的,研究人员可以观察结果并准确看到究竟发生了什么变化。他们可以指着一个特定的词说:“这个词之所以发生变化,是因为它开始出现在关于旅行和商业的场景中,而不再出现在关于测量的场景中。”这种细致的程度是那些功能强大但缺乏透明度的模型通常无法提供的。
团队通过具体案例来理解其成功的机制。他们观察了“prop”一词:在19世纪,这个词主要用于与物理支撑或家庭稳定性相关的语境;到了20世纪末,该词已转向频繁出现在与戏剧和表演相关的场景中,指代演员使用的道具。计算机通过注意到旧有的框架逐渐消退,而新的框架取而代之,从而检测到了这种转变。他们还观察了“tree”(树)一词,该词在框架使用上几乎没有变化,从而正确地将其识别为一个稳定的词汇。然而,该方法也揭示了自身的局限性。对于“quilt”(被褥/缝被)一词,计算机检测到了巨大的变化,因为该词出现在许多新的物理语境中(如被折叠或铺开),尽管其核心含义本身并未真正改变。这表明,虽然该方法在检测用法变化方面非常出色,但有时会将语境的变化误认为是含义的变化。
尽管存在这些微小的局限性,这项研究仍证明了显性的语言知识可以成为理解语言演变的强大工具。研究人员的目标并非构建最快或最复杂的系统,而是创建一个清晰且具有可解释性的系统。他们发现,通过关注词语所唤起的结构化场景,他们不仅能高精度地检测语义演变,还能用通俗易懂的语言解释变化的本质。这种方法提供了一种桥接现代人工智能的强大算力与人类语言细微理解之间鸿沟的方式,证明了有时,观察一个词使用的具体细节,比依赖隐藏的数学猜测更具启发性。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。