← 最新论文
💬 NLP

Multilingual Idioms in Sentences and Conversations Across High-, Medium-, and Low-Resource Languages

本文介绍了 MIDI,这是一个涵盖高、中、低资源语言的新型多语言数据集,它将成语嵌入到句子和对话语境中,以揭示当前的模型即使在提供上下文线索的情况下,在处理字面解释和低资源语言方面仍面临显著困难。

原作者: Saeed Almheiri, Bilal Elbouardi, Salsabila Zahirah Pranida, Irina Nikishina, Ashwath Rao B, Parameswari Krishnamurthy, Muhammad Cendekia Airlangga, Rifo Ahmad Genadi, Nguyen Phan Gia Bao, Amir Hossein
发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Saeed Almheiri, Bilal Elbouardi, Salsabila Zahirah Pranida, Irina Nikishina, Ashwath Rao B, Parameswari Krishnamurthy, Muhammad Cendekia Airlangga, Rifo Ahmad Genadi, Nguyen Phan Gia Bao, Amir Hossein Yari, Hawau Olamide Toyin, Nurdaulet Mukhituly, Mena Attia, Besher Hassan, Ahmad Fathan Hidayatullah, Tatsuki Kuribayashi, Haonan Li, Suma Bhat, Fajri Koto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人理解人类的对话。你给了它一本词典和数千本书,它学会了流利地使用多种语言。但随后,你问了它一个简单的问题:“当有人说他们‘在下猫和狗’(raining cats and dogs)时,是什么意思?”

如果机器人的回答是:“正在发生动物降雨,”那么它失败了。它错过了成语/习语(idiom)——这种词汇的实际含义与它们的字面定义完全不同的表达方式。

这篇论文介绍了一个名为 MIDI(多语言习语数据集)的新工具,旨在测试现代 AI 模型处理这些棘手短语的能力,涵盖了从全球主要语言(如中文和日语)到数字化程度较低的小众语言(如约鲁巴语和爪哇语)在内的 18 种语言。

以下是研究人员发现的详细内容,使用了简单的类比:

1. 问题所在:“字面陷阱”

习语就像是文化内部的笑话。要理解它们,你不能只查单词;你需要了解该文化的“氛围”。

  • 研究内容: 研究人员构建了一个包含 2,000 多个习语的海量测试库 (MIDI)。他们不仅给 AI 提供这个短语,还将其置于两种不同的场景中:
    • 句子: 单行文本(就像一张闪卡)。
    • 对话: 两人之间的简短聊天(就像电影中的一个场景)。
  • 目标: 观察 AI 是否能够区分一个短语是被比喻性地使用(笑话的含义)还是字面上使用(实际的含义)。

2. 结果:“富与贫”的差距

研究人员测试了目前最智能的 AI 模型(包括昂贵的“专有”模型和免费的“开源”模型)。

  • 语言鸿沟: 把语言资源想象成互联网带宽
    • 高资源语言(如英语、中文): 这些语言在互联网上有海量的数据。AI 模型在这些语言上的表现尚可,就像一个读了很多教科书的学生。
    • 低资源语言(如约鲁巴语、棉纳卡布语): 这些语言在网上的数据非常少。模型在这里表现得很糟糕,通常表现得并不比随机猜测好多少。这就像要求一个从未见过该语言的学生参加考试。
  • 字面意义的挣扎: 即便是最好的模型也发现,理解字面意思比理解比喻义要难得多。
    • 类比: 如果你说,“我正在折断一条腿(breaking a leg)”,AI 很擅长知道你的意思是“祝你好运”(比喻义)。但如果你是在医院里真的说着“我正在折断一条腿”,AI 经常会感到困惑,仍然认为你在说“祝你好运”。它很难意识到什么时候这个“笑话”并不是一个笑话。

3. “记忆” vs. “推理”测试

研究人员想知道:AI 真的在思考,还是仅仅像鹦鹉一样背诵答案?

  • 记忆测试: 他们询问 AI,“这个短语是什么意思?”,且没有任何上下文
    • 结果: 大型、昂贵的模型表现出色。它们已经“背诵”了定义。
  • 推理测试: 他们给 AI 提供该短语,并附带英文定义,然后让它根据故事选出正确的含义。
    • 结果: 这对开源模型很有帮助,但“富”与“贫”语言之间的差距依然存在。
  • “偏见”的发现: AI 具有很强的倾向于笑话(比喻义)的偏见。一旦遇到不确定的情况,它就会假设该短语是比喻性的。
    • 类比: 这就像一个人总是假设你在开玩笑,即使你是在认真说话。这使他们擅长识别习语,但在识别何时是字面意思时表现极差。

4. “转向”实验(遥控器)

研究人员尝试了一种酷炫的技巧,叫做激活转向(Activation Steering)。想象 AI 的大脑是一个收音机,他们找到了一个特定的“旋钮”,可以控制 AI 是在思考“记忆的事实”还是“逻辑推理”。

  • 做法: 他们稍微转动这个旋钮,以推动 AI 向更好的推理方向发展。
  • 结果: 有效!AI 变得稍好了一些,尤其是在低资源语言方面。这就像给学生一点小提示或推了一把,帮助他们解开被难住的谜题。有趣的是,他们发现用完全不同的数据集(MML-Pro)训练出的“旋钮”在这次习语测试中同样有效,这表明 AI 处理记忆和推理的方式是一种跨不同任务的通用“肌肉”。

5. 人类 vs. 机器

最后,他们让真实的人类参加了同样的测试。

  • 得分: 人类的正确率为 94%
  • AI 得分: 最好的 AI 模型得分约为 81%(专有模型)和 72%(开源模型)。
  • 差距: 在低资源语言中差距最大。例如,在约鲁巴语中,最好的开源模型得分仅为 23%,而人类得分高达 96%

总结

论文得出结论,虽然 AI 在语言方面正变得非常出色,但它仍然难以掌握语言的“灵魂”:习语

  • 它过度依赖记忆。
  • 当短语意在字面意思时,它会感到困惑。
  • 在数据量不足的语言中,它的表现很差。
  • 即便是最智能的模型,在理解文化表达的细微差别方面仍远落后于人类。

研究人员并非声称这能立即修复翻译软件或创造新的医疗工具。相反,他们只是建立了一个更好的“健身房”(MIDI 数据集),向我们展示了 AI 的弱点究竟在哪里,以便我们在未来构建更强大的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →