← 最新论文
💬 NLP

Rank Reversal in Multilingual LLM Judges: A Label-Free Double-Centering Calibrator

本文介绍了基于共识的校准(Consensus-Based Calibration, CBC),这是一种源自双向方差分析(two-way ANOVA)的无标签后验校准方法,它通过恢复并消除语言骨干交互项,消除了多语言大语言模型(LLM)评判器中由语言引起的排名逆转问题,从而在不需要地面真值标签的情况下,显著提高了排名的连贯性以及与人类偏好的对齐度。

原作者: Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,研究人员经常需要了解哪种计算机程序最擅长解决某个问题。为了找出答案,他们使用其他的计算机程序,即被称为“裁判”的程序,来阅读答案并给出评分。这种方法已成为测试新模型的标准方式,因为它既快速又具备可扩展性。然而,一个隐藏的复杂问题出现了:这些裁判并不总是能保持一致。当一个裁判在不同的语言(如英语、阿拉伯语或西班牙语)中评估同一组答案时,它往往会改变自己的判断。一个在一种语言中获得高分的模型,在另一种语言中可能会跌至末尾。这种不一致性创造了一个混乱的局面,使得“赢家”完全取决于提问所使用的语言,从而难以信任结果或选择合适的工具。

一组研究人员现在已经识别出了这种困惑的根源,并开发出了一种无需人类专家重新为数千个答案评分的方法来解决它。他们发现,问题并非随机噪声,而是一种特定的、可预测的模式,即裁判的语言与被测试的模型之间存在一种相互作用,从而扭曲了评分。通过将评分视为一组数据点而非绝对真理,他们创建了一种数学调整方法,剥离了这种语言偏差。其结果是一个更清晰、更一致的排名,无论问题是用英语、斯瓦希里语还是日语提出的,该排名都保持不变。

研究人员首先在大规模范围内测试了这一现象。他们选取了六个不同的强大人工智能模型,并要求它们解决五十个不同的软件工程任务。然后,他们使用另外六个人工智能模型来评判这些解决方案的质量。至关重要的是,他们在八种不同的语言中运行了整个实验。结果令人震惊。在十五种可能的模型配对组合中,有七种组合的排名完全取决于语言。例如,当裁判说英语时,某个模型可能是明显的优胜者;但当裁判说西班牙语时,它可能会落后于竞争对手。在某些情况下,差异如此之大,以至于在一种语言中首选的模型在另一种语言中却是最不受欢迎的。这证明了裁判并非仅仅是不一致,而是根据提示词的语言对相同的内容做出了不同的反应。

为了解决这个问题,研究人员将评分视为一个测量网格。他们意识到,模型获得的最终得分由三部分组成:任务的难度、模型本身的技能,以及第三个因素——一个将语言与模型混合在一起的隐形因素。这个第三个因素正是罪魁魁。它就像一个过滤器,根据所使用的语言扭曲了对模型能力的观察。该团队开发了一种名为“基于共识的校准”(Consensus-Based Calibration)的方法来移除这个过滤器。这个过程非常简单:他们查看了所有语言和所有模型的平均分,计算出每种“语言-模型”对的具体失真程度,然后将其减去。这种被称为“双重中心化”(double-centering)的操作有效地抵消了语言偏差,同时保留了模型的真实技能。

该方法的有效性经过了严格测试。在进行调整之前,模型的排名在不同语言之间变化剧烈,一致性得分仅为 0.650。应用校准后,模型的排名在所有八种语言中几乎变得完美稳定,一致性得分跃升至 0.902。在另一个使用涵盖七种语言的 10,500 个项目的独立测试中,改进更为显著,一致性从 0.430 提升到了 0.900。或许最重要的一点是,当他们将修正后的排名与一组人类偏好的答案进行对比时,一致性从 68.7% 上升到了 76.6%。这表明,通过消除语言偏差,计算机裁判实际上更接近于人类专家的决定。

研究人员谨慎地指出,这种方法并不能创造一个完美的、普遍的真理。它在相同的任务在相同的语言集下进行评估时效果最好。它也无法修复那种所有裁判对某一特定语言都表现出整体严厉或宽容的情况;它只能修复语言与特定模型进行交互的方式。此外,该方法依赖于拥有一个完整的、每个模型都在每种语言中都被评判的数据集。如果数据缺失,计算会变得更加困难。然而,对于绝大多数数据完备的多语言评估而言,这种方法提供了一个强大的工具。它让研究人员不再需要猜测哪个模型真正更好,而是能够清晰地看到结果,不受提问语言的扭曲影响。

这项工作改变了我们如何在全方位背景下评估人工智能的方式。它使该领域不再仅仅接受那些不一致的、依赖于语言的评分作为最终结论。相反,它提供了一种可靠的方法,将不同的语言对齐到一个单一的、共享的质量标准之上。通过这样做,它确保了当我们说一个人工智能模型比另一个更好时,无论对话发生在东京、开罗还是纽约,这一说法都是成立的。这个解决方案不需要昂贵的人力劳动或新的数据收集;它只需要一种更聪明的方式来审视我们现有的数据。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →