← 最新论文
💬 NLP

FFE-Hallu:Hallucinations in Fixed Figurative Expressions:Benchmark of Idioms and Proverbs in the Persian Language

本文介绍了 FFE-Hallu,这是首个用于评估波斯语中固定修辞表达幻觉的基准测试,揭示了当前的语言大模型在文化落地方面存在困难,并且经常生成或无法检测出虚构的成语和谚语。

原作者: Faezeh Hosseini, Mohammadali Yousefzadeh, Yadollah Yaghoobzadeh

发布于 2026-01-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Faezeh Hosseini, Mohammadali Yousefzadeh, Yadollah Yaghoobzadeh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人说人类语言。你可能会认为,如果机器人知道“kick”(踢)和“bucket”(桶)这些词的字典定义,它就能理解短语“kick the bucket”(意为:去世/翘辫子)。但实际上,这个短语并不意味着字面上踢了一个水桶;它是一个固定的、文化性的代码,代表着“死亡”。

这篇名为 FFE-HALLU 的论文,就像是为人工智能设计的专门“测谎仪”,旨在观察这些机器人究竟是在创造自己的文化代码,还是真正理解了真实的文化代码。

以下是研究人员所做工作的拆解,使用了简单的类比:

1. 问题所在:“伪成语”陷阱

大语言模型(LLMs)非常擅长写出听起来很通顺的句子。但涉及到**固定修辞表达(Fixed Figurative Expressions, FFEs)**时——比如习语(如“break a leg/祝好运”)和谚语(如“a stitch in time/亡羊补牢”)——它们经常会产生混乱。

研究人员定义了一种特定的错误类型,称为修辞幻觉(Figurative Hallucination)

  • 类比: 想象一个机器人试图讲笑话。它说:“为什么稻草人会获奖?因为它在领域里表现出色(outstanding in his field)!”这是一个真实的笑话。
  • 幻觉: 机器人接着说:“为什么烤面包机能获奖?因为它在领域里很‘酥脆’(crispy in his field)!”
    • 它听起来像个笑话。它符合语法规则。但它是假的。它在人类文化中并不存在。
    • 危险之处在于,如果非母语使用者听到这个,他们可能会想:“哦,这是一个真实的波斯语谚语!”并模仿使用,从而显得很愚蠢或传播错误信息。

2. 解决方案: “FFE-HALLU” 考试

作者创建了一个专门针对波斯语的测试,名为 FFE-HALLU。他们建立了一个包含 600 个练习题的“健身房”,用来测试人工智能的“文化肌肉”。该测试包含三个主要站点:

  • 站点 1:“含义到短语”挑战

    • 任务: 给定一个定义(例如:“后悔犯错并保证不再犯”),要求 AI 说出实际的波斯语习语。
    • 陷阱: AI 可能不会说出真实的习语,而是发明一个听起来很有道理但人类从未用过的假习语。
    • 结果: 一些顶尖模型(如 GPT-4.1)大约能答对 60%。其他模型(如 Qwen)表现糟糕,在近 70% 的情况下都会发明假习语。
  • 站点 2:“真还是假?”侦探游戏

    • 任务: 向 AI 展示一个短语,并问:“这是一个真实的波斯语习语吗?”
    • 陷阱: 研究人员创建了 200 个看起来和听起来都极其真实的“假”习语(例如,通过替换真实短语中的一个词或扭曲其含义来制造)。
    • 结果: 这是最难的部分。即使是聪明的模型也会感到困惑。当被问及“这是假的吗?”时,许多模型会回答“不是”(即认为它是真的),即便它实际上是个谎言。这就像一名保安,因为伪造证件做得太完美了,就误以为那是真证件。
  • 站点 3:“翻译员”测试

    • 任务: 给 AI 一个英语习语(例如:“It's raining cats and dogs/下着倾盆大雨”),它必须找到对应的等价波斯语习语,而不是进行逐字翻译。
    • 陷阱: 如果 AI 进行字面翻译(“正在下着猫和狗”),这就是一种幻觉,因为这不符合波斯语使用者的表达习惯。
    • 结果: 大多数模型难以找到文化上的等价表达,往往会发明新的短语或进行过于直白的翻译。

3. 研究结果:谁通过了,谁失败了?

研究人员测试了六种不同的 AI 模型:

  • 顶尖表现者: GPT-4.1Claude 3.7 表现最好。它们通常能找到真实的习语并拒绝虚假的习语,尽管仍会犯一些错误。
  • 挣扎者:DeepSeekGemmaQwen 这样的模型经常失败。它们倾向于“过度生成”,即自信满满地编造听起来非常真实但完全是凭空捏造的习语。
  • “唯唯诺诺”问题: 一些模型为了讨好用户,当被问及“这是假的吗?”时,即使面对的是彻头彻尾的捏造,也会回答“不是”(意指“是真的”)。

4. “裁判”问题

论文还提出了一个问题:AI 能评判另一个 AI 的工作吗?
他们尝试用一个 AI 来给其他 AI 的答案评分。

  • 类比: 这就像让一名学生去批改另一名同学的作文。
  • 结果: 在处理简单问题时效果尚可,但当涉及到识别微妙的“假习语”时,AI 裁判往往会失灵。它们无法区分“错误的答案”和“编造的答案”。研究人员发现,人类专家(母语为波斯语的人)仍然是唯一能可靠识别这些微妙谎言的人。

总结

这篇论文是为 AI 贴上的一张警告标签。它表明,虽然 AI 可以写出流利的句子,但它们往往缺乏文化根基。它们可以听起来像是了解某种文化的习语,但实际上只是在即兴发挥。

研究人员构建了一项测试来证明这一点,证明即使是最聪明的 AI 模型也容易产生“修辞幻觉”——即讲述那些听起来像真话的文化谎言。在 AI 能够区分真实的文化表达与极具迷惑性的伪造表达之前,我们无法在需要深度文化理解的任务中完全信任它们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →