Challenges and Recommendations for LLMs-as-a-Judge in Multilingual Settings and Low-Resource Languages
本文分析了自然语言处理(NLP)领域内,在多语言及低资源语言环境下,大语言模型作为评判者(LLM-as-a-Judge)应用有限且往往不一致的问题,强调了过度信任和单一模型依赖等风险,并为更稳健的评估实践提出了建议。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在举办一场面向全球作家的盛大才艺表演赛。你拥有成千上万名来自世界各地的参赛者,他们说着不同的语言,从英语、西班牙语到像约鲁巴语(Yorùbá)或马赛语(Maasai)这样稀有的低资源语言。
过去,为了决定谁能获胜,你需要一个精通每种语言的人类评审团。这既缓慢又昂贵,而且组织难度极大。
最近,一个新工具出现了:AI 评审员。这是一个超级聪明的计算机程序(大型语言模型,简称 LLM),它可以阅读答案、进行比较并给出评分。因为它速度快、成本低且精通多种语言,于是大家都开始使用它来取代人类评审。
问题所在:
这篇论文就像一份侦探报告,调查当我们让 AI 评审员去主持那些它并不熟悉的语言的比赛时,会发生什么。作者研究了 3 篇试图将 AI 评审用于非英语语言的近期研究论文。他们发现,虽然这个想法听起来很棒,但现实情况却混乱且充满风险。
以下是他们研究结果的简单类比拆解:
1. “游客型”评审员
想象一下,AI 评审员是一个游客,他多次造访过巴黎(英语),对那里了如指掌。但现在,他被要求去评判亚马逊丛林里一个偏远村庄的烹饪比赛。
- 论文的说法: AI 评审员擅长英语。但在处理低资源语言时,它就像那个试图评判从未品尝过的当地美食的游客。他们可能会仅仅因为食物看起来很华丽就认为它美味,或者完全误解了食材。
- 现实情况: 论文发现,在许多研究中,研究人员假设 AI 评审员在处理约鲁巴语或尼泊利语时,表现得和处理英语时一样好。他们并没有检查评审员是否真的理解该语言。通常情况下,AI 只是在瞎猜或产生幻觉,但研究人员却盲目信任了它。
2. “单一裁判”偏差
在一场体育比赛中,如果你只有一个裁判,一旦这个裁判犯错,整场比赛就会变得不公平。
- 论文的说法: 大多数研究人员查看的研究仅使用了一个 AI 模型(通常是像 GPT-4 这样著名的模型)来进行所有评审工作。他们没有要求第二个 AI 来复核工作。
- 现实情况: 这就像有一个本身就是某队粉丝的裁判。如果这个特定的 AI 模型存在偏差(例如,它比起简短精炼的回答,更喜欢冗长的回答),那么整个评估结果就会产生偏差。论文发现,48% 的研究依赖于单一的评审模型,而 33% 的研究仅使用 GPT 作为其唯一的评审。
3. “仅限英语”的安全网
想象一位老师正在用法语批改试卷。为了确保教学质量,她会根据一份用法语编写的答案解析来检查自己的评分是否准确。
- 论文的说法: 许多研究人员声称他们的 AI 评审员是可靠的。但当作者深入观察时,他们发现“安全网”缺失了。他们经常使用英语数据来验证 AI 的可靠性,然后便假设它在法语、德语或斯瓦希里语上也同样有效。
- 现实情况: 论文发现,在许多情况下,AI 从未真正针对目标语言中的人类专家进行过验证。他们在英语(AI 擅长的领域)中验证了评审员的可靠性,然后就盲目地将其应用到其他语言(AI 可能表现糟糕的领域)上。
4. “过度自信”的群体
研究界存在一种过度信任 AI 的倾向。
- 论文的说法: 因为 AI 快速且廉价,研究人员正在“过度信任”它。他们将 AI 的评分视为绝对真理,即使 AI 在处理困难语言时正处于挣扎状态。
- 现实情况: 论文警告说,对于那些使用者或数据非常稀少的语言(低资源语言),AI 通常是最弱的时候。然而,由于没有人类专家可以进行复核,人们只是接受了 AI 有缺陷的评分。这创造了一个错误的循环:错误的评估被当作事实接受了下来。
作者的建议(“游戏规则”)
为了解决这个问题,论文为任何使用 AI 评审的人提出了四条简单的规则:
- 在当地语言中测试评审员: 不要仅仅因为 AI 会说英语就假设它了解某种语言。在信任其评分之前,你必须测试 AI 是否真的与该特定语言的人类使用者达成一致。
- 保持人工参与: 即使你使用 AI,你也需要人类来抽查一小部分工作。这就像是有主教练去复核裁判的判罚一样。
- 检查传统工具是否效果更好: 有时,一些简单、传统的数学工具(比如计算精确的词汇匹配)可能比一个并不理解该语言的高级 AI 更安全。如果简单的工具效果一样好,就不要使用 AI。
- 尊重文化,而不只是文字: 一种语言不仅仅是语法,它还包含文化。AI 可能会理解故事中的词汇,但会错过文化的内涵。研究人员需要检查 AI 是否理解该语言的语境和文化,而不只是词汇量。
核心结论
论文总结道,虽然 AI 评审员是一个强大的工具,但将它们用于其并不完全理解的语言是危险的。这就像是让一个游客在不知道当地艺术史的情况下,去评判一个当地的艺术节。在我们能够证实这些 AI 评审员在特定的低资源语言中确实具备能力之前,我们不应将其评分视为最终定论。我们需要停止假设它们无处不在,而是开始证明它们确实有效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。