← 最新论文
💬 NLP

Wisdom in Unity: The Role of Multilingual Training in Figurative Language Identification in Proverbs

本文表明,多语言监督——特别是通过纳入诸如文化特定谚语和道德/劝诫类谚语等多样化的修辞形式——显著提升了修辞语言识别的性能,并暗示了向超越以隐喻为中心的、迈向多维概念级框架的转变。

原作者: Rama Alomair, Remas Alsubaie, Walaa Saifalislam, Rima Alsonbul, Mona Alnajjar, Razan Aldossari, Haya Alibrahim, Abeer Aldayel

发布于 2026-08-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Rama Alomair, Remas Alsubaie, Walaa Saifalislam, Rima Alsonbul, Mona Alnajjar, Razan Aldossari, Haya Alibrahim, Abeer Aldayel

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人理解人类的笑话、谜语和古老的谚语。这不仅仅是将一种语言的词汇翻译成另一种语言,而是要理解其背后的“隐藏含义”。在计算机科学领域,这被称为“比喻性语言”(figurative language)。这就像是一个秘密代码,比如“it's raining cats and dogs”并不意味着天上有动物掉下来,而是指雨下得很大。谚语是测试这些机器人的终极考验,因为它们短小精悍,蕴含着文化智慧,而且如果从字面意思去理解,往往会显得毫无道理。长期以来,科学家们尝试仅通过一种语言来教计算机识别这些说法,就像是在一个仅限英语的课堂里研究英语笑话。但现实世界是复杂且多语言的,所以研究人员想知道:如果我们同时向机器人展示多种语言的谚语,它会变得更聪明吗?看到法语、日语和阿拉伯语的谚语,是否能帮助它更好地理解英语谚语?

这篇题为《统一中的智慧》(Wisdom in Unity)的论文深入探讨了这个问题。研究人员利用了一个包含 742 个谚语概念并翻译成七种不同语言(阿拉伯语、英语、法语、德语、俄语、日语和西班牙语)的大型集合,总计超过 6,700 个示例。研究人员不仅询问一个谚语是“比喻性的”还是“字面的”,还将它们细分为四种特定的意义类型:隐喻性(使用图像或符号)、道德/劝诫性(给出教训或警告)、因果关系(将行动与结果联系起来)以及特定文化性(需要深厚的本土知识才能理解其中的梗)。他们测试了五种不同的计算机模型,从标准的编码器到先进的“指令微调”大语言模型(LLMs),以观察这些模型在接受不同数量的翻译示例训练时的表现如何。

以下是他们的发现,这有点像是在寻找制作多语言奶昔的完美配方。首先,他们发现你并不需要把每一个翻译过的谚语都喂给机器人来获得出色的结果。事实上,向模型提供大约 50% 的翻译训练数据就足以达到接近完美的性能。在超过这个点之后(从 50% 增加到 100%)添加更多数据并没有带来太大帮助,这表明模型达到了一个能够进行泛化的“甜点位”(sweet spot)。

其次,也是最令人惊讶的,谚语的类型非常重要。研究人员发现,“特定文化性”的谚语——即那些因为依赖当地历史或宗教而最难理解的谚语——在接受多语言数据训练时,性能提升最为显著。这就像是通过在不同的文化背景下观察这些谚语,帮助机器人最终破解了其独特之处的密码。与此同时,对于更常见的类型(如隐喻),额外的语言带来的提升并没有那么大。

最后,研究表明,没有任何一种“口味”的谚语可以单独支撑起理解。当模型接受所有四种类型混合训练时,表现最为出色。事实证明,虽然有些模型擅长识别道德教训,而另一些模型擅长识别因果关系,但结合这些不同的视角可以创造出最强大的整体理解力。作者建议,未来的人工智能不应仅仅寻找隐喻,还需要被训练去识别这些不同的、互补的意义层面,从而真正理解隐藏在我们全球谚语集中的智慧。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →