← 最新论文
💬 NLP

Rethinking the Idiomaticity Decomposability Hypothesis: Evidence from Distributional Learning

本文通过在语言模型中进行受控的分布学习,证明了可分解性与人类判断及句法灵活性之间的相关性较弱,并揭示了预训练期间成语表征的稳定化是由频率、惊异度及可分解性之间复杂的相互作用而非仅由频率驱动,从而对传统的成语可分解性假设提出了挑战。

原作者: Maggie Mi, Golzar Atefi, Atsuki Yamaguchi, Felix Gers, Aline Villavicencio, Nafise Sadat Moosavi

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Maggie Mi, Golzar Atefi, Atsuki Yamaguchi, Felix Gers, Aline Villavicencio, Nafise Sadat Moosavi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心问题:成语(习语)是像乐高积木,还是像魔法咒语?

想象你有一盒乐高积木。如果你搭建了一座城堡,你可以把它拆开,移动一座塔楼,或者把一个红色的积木换成蓝色的,它依然清晰地是一座城堡。这就是**可分解(decomposable)**习语的工作方式。例如,“spill the beans”(泄露秘密)。你可以将“beans”(豆子)想象成秘密,将“spilling”(洒出)想象成揭露。因为组成部分是有意义的,该论文指出,我们应该能够改变句子的结构(比如变成被动语态:“The beans were spilled”),而不会丢失原意。

现在,想象一个魔法咒语。“Kick the bucket”(去世/翘辫子)的意思是死亡。如果你试图把它改成“The bucket was kicked”(桶被踢了),听起来会非常奇怪,并且失去了“死亡”的含义。这是一个**不可分解(non-decomposable)**的习语。其中的部分(“kick”和“bucket”)并不能解释其含义;它们只是作为一个单一的、不可改变的整体在起作用。

几十年来,语言学家一直相信习语可分解性假设(Idiom Decomposability Hypothesis, IDH)。他们的理论很简单:

  • 规则: 如果一个习语的部分是有意义的(可分解),它就可以以多种方式进行扭转和变换(句法灵活性)。
  • 规则: 如果部分没有意义(不可分解),它必须保持僵化和固定。

新方法:教机器人阅读

本论文的作者想要测试这个规则,但他们并没有仅仅询问人类的想法(因为人类的表现可能并不一致)。相反,他们使用了大语言模型(LLMs)——比如聊天机器人背后的 AI——作为“受控学习者”。

把这些 AI 模型想象成学生,他们读过了整个互联网,但从未被教过语法规则,也没有被要求解释为什么某件事物是有意义的。他们仅通过观察单词出现在彼此身边的模式来进行学习。

研究人员问道:“如果我们仅通过展示示例来教 AI(分布学习),它是否会自然而然地发现‘可分解’的习语是灵活的,而‘不可分解’的习语是僵化的?还是它学到了完全不同的东西?”

实验:拆解习语

为了测试这一点,研究人员为 AI 设计了一个特别的测试:

  1. “意义匹配”: 他们向 AI 展示一个习语(例如“spill the beans”)及其直白的英文含义(“reveal the secret”)。他们测量了 AI 对这两者的理解有多相似。
  2. “鼹鼠测试”: 他们从 AI 对习语的理解中秘密地移除一个单词(比如“beans”)。如果 AI 对整个短语的理解发生了剧烈变化,说明这个词很重要(可分解);如果理解保持不变,则说明这个词并不重要(不可解性)。
  3. “灵活性检查”: 他们查看现实世界的数据,看看人们实际上改变这些习语结构的频率是多少(例如,是否有人说过“The beans were spilled”?)。

令人惊讶的结果

论文发现,当你观察这些 AI 模型是如何学习时,旧有的“乐高 vs. 魔法咒语”理论并不成立。

1. 人类与机器人的脱节
当研究人员将 AI 的“可分解性得分”与人类评分进行比较时,他们发现两者之间只有微弱的联系

  • 类比: 想象两个人在看一幅画。一个人看到了风景,另一个人看到了脸。他们会在某些方面达成共识,但在大多数情况下,他们看到的都是不同的东西。AI 和人类正在使用不同的“眼镜”来评判习语。

2. 灵活性之谜
最大的冲击在于,AI 的可分解性度量并不能预测一个习语是否具有灵活性。

  • 发现: 论文发现了一个微小的、持续的负相关关系。在某些情况下,AI 认为一个习语越是“可分解”,它在实际语言中的灵活性反而越低。
  • 类比: 旧理论说:“如果积木是松动的,你就可以搭建任何东西。” 数据却说:“事实上,积木看起来越松动,人们似乎就越倾向于用胶水把它们粘在一起,并拒绝移动它们。”

3. 真正的驱动力:频率与惊异度
那么,如果可分解性不是决定习语行为的主要原因,那是什么呢?

  • 频率(你听到它的频率): 一个习语出现的次数越多,AI 就越将其视为一个单一的、不可改变的块。高频习语变得具有“整体性”(holistic,即粘在一起了)。
  • 惊异度(Surprisal,即意料之外的程度): AI 学习到,如果一个短语是令人惊讶或难以预测的,它就需要密切关注特定的单词。
  • 类比: 想象一首歌。如果你听了一百万遍一个朗朗上口的副歌,你每次都会唱得一模一样(它变成了一个固定的单元)。如果你听到一段复杂的、罕见的爵士即兴演奏,你可能会尝试改变音符,因为你在关注单个部分的细节。AI 学习习语就像学习那首朗朗上口的副歌:重复让它们变得僵化,而不是内在的意义。

“学习曲线”的发现

研究人员还观察了 AI 随着时间的推移(在其训练阶段)的学习过程。

  • 早期学习: 在开始阶段,AI 对单词如何组合在一起(可分解性)以及短语的惊异度非常敏感。
  • 后期学习: 随着 AI 看到更多数据,可分解性的影响逐渐减弱。AI 不再关心部分是否有意义,而是开始主要关注它之前见过这个短语多少次
  • 结论: AI 并不是通过理解习语的“内在逻辑”来学习的。它是通过记忆其“习惯性用法”来学习的。

总结

论文得出结论,习语可分解性假设(即意义结构决定语法灵活性的观点)很可能是错误的,或者至少不是主要的驱动因素。

相反,基于用法的因素才是真正的老板。

  • 旧观点: “我们可以改变这个句子,因为这些词是有意义的。”
  • 新观点(来自本论文): “我们不改变这个句子,是因为我们已经听过它一百万遍了,它在我们的记忆中感觉就像一个单一的、坚实的物体。”

这项研究表明,习语之所以特殊,并不是因为它们隐藏的意义,而是因为它们被使用的频率。仅通过接触进行训练的 AI 证明了:熟悉感带来了僵化,而非灵活性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →