LLM Evaluators are Biased across Languages
本文表明,多语言大语言模型评估器表现出一种一致且具有统计学意义的偏差,即低资源语言比高资源语言获得更高的评分并更容易通过安全过滤器,尽管这些评估器在相对排序上具有高度一致性,但这一关键缺陷仍未被标准的成对准确率指标所检测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:每当你向一个超级聪明的机器人提问时,它都会用你自己的语言回答你。这些被称为“大语言模型”(LLM)的机器人就像数字百科全书,可以写故事、解数学题,并能聊任何话题。但是,我们如何知道它们做得好不好呢?我们需要一个裁判。在人工智能的世界里,这些裁判被称为“评估器”。它们要么是经过训练专门用来打分的其他机器人,要么是要求 AI 进行自我评分的人类化提示词。通常,我们会通过检查这些裁判是否能正确选出两个选项中“更好”的那一个来检查它们是否公平,这有点像法官判定哪幅画更漂亮。这被称为“成对准确率”(pairwise accuracy)。如果裁判在 90% 的情况下都能选出正确的赢家,我们就认为它们做得非常出色,并且无论使用哪种语言,它们的评分都是公平的。
然而,这个假设中隐藏着一个问题。仅仅因为一个裁判能分辨出两幅画中哪一幅更好,并不意味着他们使用的是同一把尺子来衡量它们。在现实世界中,东京的一家四星级餐厅可能被视为烹饪杰作,而纽约的一家四星级餐厅可能仅被视为“还可以”。星星的含义取决于你在哪里。这篇题为《LLM 评估器在不同语言间存在偏差》的论文深入探讨了我们的 AI 裁判是否也遭受了同样的文化困惑。研究人员想知道:如果一个 AI 给出了完美的答案,当这个答案被翻译成印地语、波斯语或乌克兰语时,它是否还会给出完全相同的分数?还是说,即使意思完全相同,语言本身也会改变分数?
团队进行了一项大规模实验来查明真相。他们将完全相同的指令集和响应翻译成了 23 种不同的语言,涵盖了从英语、西班牙语等广泛使用的语言到希伯来语、印地语等其他语言。然后,他们要求八种不同类型的 AI 评估器——有些是仅通过提示词给出评分,有些是经过专门训练以给出“奖励”数值——来对这些内容完全相同的答案进行评分。
结果令人震惊。这些评估器并没有使用同一把尺子。尽管内容在语义上是完全一致的(即意思完全一样),但分数却根据语言的不同而剧烈波动。这种偏差是巨大的:在 1 到 5 分的量表中,得分最高的语言与得分最低的语言之间的差距约为 0.5 分。在评分领域,这是一个巨大的差距。
这里有一个让问题变得如此棘手的转折点:这些评估器在纸面上看起来依然很完美。当研究人员检查“成对准确率”(即裁判是否选出了更好的那个答案)时,得分非常高,通常在 90% 以上。裁判们在判断“答案 A 是否优于答案 B”方面表现得非常一致且出色。但它们在判断“答案 A 究竟有多好”这一点上却表现得很糟糕。这就像一位法官,虽然总能正确选出比赛的获胜者,但如果选手用法语跑步,他会给 100 分;如果选手用德语跑步,他只给 50 分。
论文发现了一个清晰的模式:评估器对低资源语言(即在线数据较少的语言,如印地语或希伯来语)表现出了惊人的慷慨,而对英语等高资源语言则更加严格。就好像 AI 裁判在想:“我不百分之百确定这种语言下的完美答案是什么样的,所以我先给个高分以保稳妥。”相反,对于英语,它们感到非常有信心且严苛,对答案提出了更高的标准。
这不仅仅是一个数字游戏;它具有现实世界的后果。许多 AI 系统使用“全局阈值”来决定向用户展示什么内容是否安全。例如,如果安全过滤器被设置为拦截任何低于特定分数的项,那么这种偏差意味着,在低资源语言中,有害内容更容易溜过缝隙。研究发现,在单一的全局规则下,不同语言之间的内容接受率差异可能高达 43 个百分点。在一个具体的例子中,一个在英语中的有害问题被正确拦截了,但完全相同的问题在乌克兰语中却被允许通过,因为评估器给它打了更高的分数。
研究人员还调查了为什么会发生这种情况。他们怀疑这可能是因为 AI 对低资源语言的确定性较低。他们发现,当 AI 的确定性较低时(通过文本的“惊讶度”来衡量),它确实倾向于给出更高的分数。然而,他们证明了“不确定性”并不是故事的全貌。即使在考虑了 AI 的困惑程度后,语言本身仍然能预测分数的走向。这意味着这种偏差是这些模型构建过程中的一个深层、结构性的问题,而不仅仅是“我不熟悉这种语言”这么简单。
论文得出结论,我们不能简单地信任这些 AI 评估器的原始分数在不同语言间的表现。虽然我们可以通过为每种语言调整分数来解决部分问题,但这会产生一个新的漏洞:如果有人在单个提示词中混合使用多种语言(语码转换),系统可能会对应该应用哪种语言规则感到困惑,从而让有害内容溜过去。作者建议,我们不应仅仅检查评估器是否能选出“赢家”,而是需要建立能够实现跨语言公平且一致的校准系统,确保印地语中的五星级答案与英语中的五星级答案同样具有价值。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。