← 最新论文
💬 NLP

BenHalluEval: A Multi-Task Hallucination Evaluation Framework for Large Language Models on Bengali

本文介绍了 BenHalluEval,这是首个针对孟加拉语大语言模型的全面幻觉评估框架,该框架利用双轨协议和一种新的校准指标来评估四个任务中的性能,并揭示了幻觉检测能力的显著差异。

原作者: Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham, Ajwad Abrar, Ishmam Tashdeed, Md Taukir Azam Chowdhury

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Shefayat E Shams Adib, Ahmed Alfey Sani, Ekramul Alam Esham, Ajwad Abrar, Ishmam Tashdeed, Md Taukir Azam Chowdhury

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、精通多种语言且会说孟加拉语的机器人。你可以向它提问、让它总结新闻或解决数学问题。有时,这个机器人表现得才华横溢;但有时,它也会自信地胡编乱造——比如,它可能会说一位著名作家的母亲名叫“Kathleen”,而实际上她的名字是“Anne”。在人工智能领域,我们将这种自信的谎言称为幻觉(hallucinations)

直到现在,还没有人专门为孟加拉语构建一个合格的“测谎仪”。这篇论文的作者们开发了 BenHalluEval,旨在解决这个问题。以下是他们的方法,通过简单的解释呈现如下:

1. 大问题:“无声的谎言”

大多数针对 AI 的测试只检查机器人是否得到了正确答案。但如果机器人只是碰巧得到了正确答案,或者它撒谎撒得如此圆滑以至于你没察觉出来呢?

  • 类比: 想象一个学生正在参加考试。如果你只检查最终成绩,你可能会忽略他在一半题目上作弊的事实。你需要检查他们是“如何”回答的,而不只是回答了“什么”。

2. 解决方案:“双轨制”测试

研究人员构建了一场特殊的考试,设有两条独立的赛道(轨道),用以捕捉不同类型的错误:

  • 轨道 A(真相检查): 他们给机器人提供了带有正确答案的问题。他们想看看机器人是否会错误地指控一个正确的答案是谎言。(当没有狼出现时,它是否在虚报狼来了?)
  • 轨道 B(测谎器): 他们给机器人提供了带有虚假、编造答案的问题。他们想看看机器人能否识别出谎言。(它是否抓住了狼?)

评分标准 (BenHalluScore):
他们创建了一个名为 BenHalluScore 的新评分标准。你可以把它看作是一个“信任计”。

  • 如果一个机器人对所有事物都说“是的,那是谎言!”,它虽然抓住了所有的假答案,但也错误地指控了所有的真答案。
  • 如果它对所有事物都说“不,没问题”,它会错过所有的谎言,但也从不指控真相。
  • 目标: 一个完美的机器人需要足够聪明,既能识破谎言,又不会指控真相。分数越低,说明机器人在分辨真伪方面表现得越好。

3. 他们是如何构建这场考试的

他们不仅仅是编写问题,还建立了一个庞大的工厂来生成“虚假”答案。

  • 工厂: 他们使用了一个超级聪明的 AI (GPT-5.4) 来生成 12,000 个虚假答案,涵盖四个不同的任务:
    1. 回答问题: (例如:“市长是谁?”)
    2. 语码混合问题: (混合孟加拉语和英语,就像人们在社交媒体上发信息那样:用 "Kothay jabe?" 代替 "কোথায় যাবে?")
    3. 摘要: (将一篇长文章浓缩成一段短小的段落)。
    4. 推理: (逐步解决数学问题)。
  • 谎言的类型: 他们让 AI 以特定的方式撒谎,比如改变日期、捏造人物姓名或算错数学题。

4. 结果:谁通过了测试?

他们测试了 7 个不同的 AI 机器人(有些是庞大且通用的,有些是较小且专注于孟加拉语的)。

  • 赢家: 一个名为 TigerLLM-9B 的小型专业化机器人(专门为孟加拉语构建)表现得非常出色,甚至击败了许多规模更大、更通用的机器人。这就像是一个当地导游比一个试图了解全世界的巨大、昂贵的 GPS 更了解这座城市。
  • 输家: 一些非常著名的庞大机器人表现得很糟糕。其中一个机器人 (Mistral-nemo) 表现得非常混乱,它竟然指控每一个正确的答案都是谎言。另一个 (LLaMA) 则表现得非常懒散,即使谎言显而易见,它也认为没有任何东西是谎言。
  • 脚本惊喜: 当问题是用“Banglish”(用英文字母书写的孟加拉语)编写时,一些机器人的表现竟然比使用标准孟加拉语脚本时还要好。这就像有些机器人读短信比读正式信函感觉更自在。

5. “大声思考”的小技巧并不总是奏效

人们经常告诉 AI 要“一步步思考”(思维链/Chain-of-Thought)以防止它撒谎。研究人员尝试了这个技巧。

  • 结果: 它并没有稳定奏效。有时它确实有帮助,但通常它只是让机器人改变了主意,却没有真正提高识别谎言的能力。这就像告诉一个骗子要“多思考一点”——有时他们只是编出了一个更好的谎言,而不是真相。

核心结论

这篇论文是首次有人为孟加拉语构建专门的“测谎仪”。他们发现:

  1. 规模并非一切: 一个较小的、专注于孟加拉语的机器人可能比一个巨大的、通用的机器人更值得信赖。
  2. 单方面的测试是危险的: 如果你只测试机器人能否发现谎言,你可能会忽略它同时也排斥真相。你需要同时测试两者。
  3. 低资源语言需要关爱: 仅仅因为一种语言的数字资源较少,并不意味着我们不能为其构建更好的工具。

作者们已经将他们的“考试题目”和“虚假答案”开放给所有人使用,以便我们可以持续测试并改进这些机器人,确保它们在孟加拉语环境下能够讲述真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →