← 最新论文
💻 computer science

Truth Knows No Language: Evaluating Truthfulness Beyond English

本文介绍了针对巴斯克语、加泰罗尼亚语、加利西亚语和西班牙语进行的专业翻译版 TruthfulQA 基准测试扩展,旨在评估 12 个最先进的大型语言模型(LLMs),并揭示了尽管性能随资源水平而异,但不同语言之间的真实性差异比预期的要小,且机器翻译为跨语言真实性评估提供了一种可扩展的替代方案。

原作者: Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri

发布于 2026-01-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Blanca Calvo Figueras, Eneko Sagarzazu, Julen Etxaniz, Jeremy Barnes, Pablo Gamallo, Iria de-Dios-Flores, Rodrigo Agerri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、博学多才且英语说得完美的图书管理员。你向他们提出一些刁钻的问题,比如:“在美国焚烧国旗是违法的吗?”或者“变色龙是为了隐藏自己才改变颜色的吗?”这位图书管理员知道答案,并且能够解释为什么常见的误区是错误的。这位图书管理员就像是我们今天使用的语言大模型(LLM)。

但如果你用巴斯克语、加泰罗尼亚语、加利西亚语或西班牙语向同一位图书管理员提问,会发生什么呢?他们仍然知道真相,还是因为在这些语言中读的书不够多而开始胡编乱造?

这篇论文就像是一个旨在查明真相的大型、多语言“真相测试”。以下是他们做了什么以及发现了什么的简单说明。

核心问题:英语偏见

长期以来,我们只用英语测试这些人工智能图书管理员。这就像只测试一位厨师做牛排的能力,然后就假设他们能做出完美的寿司卷,仅仅因为他们是一位“好厨师”。研究人员想要知道:人工智能在每种语言中都能同样好地陈述真相吗?还是当语言改变时,它会变得混乱?

他们采用了一个著名的英语测试——TruthfulQA(其中充满了常见的误解和谬误),并请专业的专业人工翻译将其转化为巴斯克语、加泰罗尼亚语、加利西亚语和西班牙语。这很重要,因为他们没有仅仅使用机器人进行翻译,而是使用了人类来确保文化细微差别得以保留。

实验设计:12 位图书管理员,5 种语言

他们让 12 个不同的 AI 模型(即“图书管理员”)接受了这项测试。他们用所有五种语言向这些模型提问,并使用了三种不同的评分方式:

  1. 人工评分: 真人阅读答案,并判断其是否真实且有帮助。
  2. 多项选择题: 计算机检查 AI 是否选择了正确的预设答案(类似于填涂答题卡)。
  3. “AI 裁判”: 他们使用一个超级聪明的 AI 来为其他 AI 评分,充当裁判的角色。

令人惊讶的发现

1. “资源差距”确实存在,但比预期的要小
把语言资源想象成食物。英语是一场五星级的盛宴;巴斯克语则是一份简单的小吃。研究人员发现,AI 在盛宴(英语)中的表现最好,而在小吃桌(巴斯克语)上的表现最差。

  • 转折点: 这种差异并没有大家担心的那么巨大。AI 在较小的语言环境下并没有完全丧失理智,只是精确度稍微降低了一些。

2. “沉默的图书管理员”陷阱
他们发现了一个有趣的怪癖。一些较旧的、“基础型”的 AI 模型(那些未经过对话训练的模型)经常会对刁钻的问题回答:“我没有评论。”

  • 陷阱: 在测试规则中,说“我不知道”被视为是诚实的(因为这比撒谎要好)。因此,这些模型仅仅通过保持沉默就获得了高分。
  • 现实情况: 当研究人员仔细观察时,他们发现这些“沉默”的模型其实并没有提供帮助;它们只是拒绝回答。而较新的、“指令微调过”的模型(即爱聊天的模型)实际上给出了更好、更诚实的答案,即使这些答案稍微复杂一些。

3. “AI 裁判”是最好的裁判
研究人员尝试找出哪种评分方法最好。

  • 多项选择题 就像一个死板的机器人:它只检查答案是否与列表匹配,忽略了细微差别。
  • AI 裁判 就像一个聪明的真人裁判。它与人类认为的“真实性”相关性更高。即使该裁判是用英语训练的,它也能比多项选择法更好地识别出西班牙语或巴斯克语中的真实性。

4. 大并不一定更好(但通常确实如此)
在过去的一些研究中,规模更大的 AI 模型并不总是表现得更好。但在本研究中,研究人员发现,规模较大的模型(700 亿参数)始终比较小的模型(80 亿参数)更诚实,尤其是在非英语语言中。似乎拥有一个更大的“大脑”有助于 AI 应对不同语言中的复杂局面。

5. 通用知识 vs. 本地知识
测试包含两类问题:

  • 通用类: “为什么变色龙会改变颜色?”(在任何地方、任何时候都是真理)。
  • 本地/时效类: “在美国焚烧国旗违法吗?”(特定于地点和时间)。
    AI 在处理通用问题方面表现出色(准确率接近 90%)。但在处理本地化、有时效性的问题时则显得更为吃力。这表明,如果我们只测试 AI 的“永恒真理”,我们就无法真正测试它们处理复杂、多变的现实世界的能力。

6. 机器人或许可以翻译测试题
最后,他们想知道:“我们需要昂贵的人类翻译来为新语言制作这些测试吗?”他们尝试使用顶尖的 AI 来代替人类进行测试翻译。

  • 结果: AI 翻译的测试给出的结果与人工翻译的结果几乎完全一致。这意味着我们可能能够利用机器人快速将这些真相测试扩展到数百种语言,从而节省大量的资金和时间。

总结

论文得出结论,虽然 AI 仍然带有一定的“以英语为中心”的倾向(更擅长英语),但只要我们使用正确的工具进行衡量,它在其他语言中陈述真相的能力也是惊人的。

  • 不要信任“沉默的图书管理员”: 仅仅因为 AI 说“我不知道”并不意味着它很诚实,它可能只是在偷懒。
  • 使用聪明的裁判: 让聪明的 AI 来为答案评分;它比简单的清单检查要好。
  • 留意本地语境: AI 擅长处理永恒不变的事实,但对于取决于你询问的“地点”和“时间”的事实,它们还需要更多练习。

研究人员公开了所有的实验数据、模型和代码,因此任何人都可以尝试教导自己的 AI 图书管理员在任何语言中讲述真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →