← 最新论文
💬 NLP

Lost in Translation: Do LVLM Judges Generalize Across Languages?

该论文提出了首个大规模多语言多模态评测基准 MM-JudgeBench,通过评估 22 种大语言视觉模型发现,现有奖励模型在跨语言泛化能力上存在显著差异且表现不稳定,揭示了当前自动评估器在多语言场景下的根本局限性。

原作者: Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul Hoque, Jimmy Huang

发布于 2026-04-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul Hoque, Jimmy Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给一群“超级翻译官兼裁判”做体检,看看它们到底是不是真的“通晓万国语言”。

想象一下,现在的 AI 模型(特别是那些能看懂图片、能聊天的“多模态大模型”)越来越聪明,它们不仅能回答问题,还能当“裁判”,帮人类判断哪个 AI 的回答更好。这就像是在选美比赛里,让 AI 当评委,给其他 AI 选手打分。

但是,这篇论文发现了一个大问题:这些 AI 评委,可能只是“英语通”,而不是“世界通”。

以下是用大白话和比喻对这篇论文核心内容的解读:

1. 背景:为什么我们需要新的“考场”?

以前,我们测试这些 AI 评委时,只让它们用英语做题。这就像只让一个只会说英语的裁判去评判全球各地的比赛。虽然它在英语国家表现完美,但一旦到了法国、日本或者哈萨克斯坦,它可能就不灵了。

作者们觉得:“不行,这太不公平了,也不够真实。”于是,他们造了一个全新的、超大的“国际考场”,名叫 MM-JudgeBench

2. 这个“新考场”有什么特别?

  • 规模巨大:里面有超过 6 万道题,涵盖了 25 种 完全不同的语言(从英语、中文到哈萨克语、孟加拉语等)。
  • 内容多样
    • 看图说话:给一张图(比如一只狗坐在长椅上),让 AI 裁判判断两个描述哪个更准。
    • 读图解题:给一张图表,让 AI 裁判判断哪个解释更合理。
  • 双语测试:他们把原本只有英语的题目,用高质量的翻译工具翻译成了其他 24 种语言,确保题目本身没变,只是换了个“外壳”。

3. 他们做了什么实验?

作者们找来了 22 个 目前最厉害的 AI 模型(包括像 GPT-5、Gemini 这样的“商业巨头”,以及像 Qwen、InternVL 这样的“开源新秀”),让它们在这个新考场上当裁判。

实验过程就像这样:

给 AI 看一张图,问它:“图里有什么?”
AI 选手 A 说:“有一只狗和长椅。”
AI 选手 B 说:“有一只狗、长椅,上面还刻着‘沃森碗’的字样。”
AI 裁判的任务:判断谁对谁错,并给出理由。

4. 发现了什么惊人的真相?(核心发现)

🚨 真相一:英语是“舒适区”,其他语言是“雷区”

很多 AI 在英语环境下表现完美,得分很高。但一旦换成其他语言,尤其是像哈萨克语这样的小语种,它们的水平就“断崖式下跌”。

  • 比喻:这就像一个体操运动员,在熟悉的木地板上能拿金牌,但一换到沙坑里,连站都站不稳。有些为了省钱优化的“轻量级”模型,在英语里还能凑合,一换语言直接“崩盘”。

🏆 真相二:谁是最强“多面手”?

在开源模型(大家都能免费用的模型)里,Qwen3-VL 家族表现最稳。

  • 比喻:如果其他模型是“偏科生”,英语好但外语差;Qwen3-VL 就像是“全能特长生”,不管换什么语言,它都能保持稳定的发挥,甚至能打败一些更贵的商业模型。

⚖️ 真相三:大小不是万能的,偏见很可怕

  • 模型越大不一定越强:有时候,大模型在某种语言上表现还不如小模型。
  • 位置偏见:有些 AI 裁判很“懒”或“有偏见”。比如,它不管答案内容对不对,只要答案 A 排在前面,它就选 A;或者只要答案 B 写得长,它就选 B。这种“看脸”或“看位置”的毛病,在跨语言时变得更严重。

📉 真相四:翻译质量影响裁判水平

如果用来翻译题目的工具本身质量不高,AI 裁判的得分也会变低。这说明,“题目翻译得准不准”直接决定了“裁判判得准不准”

5. 他们给了什么建议?

  • 别只盯着英语:如果你想让 AI 裁判真正可靠,必须用多种语言去测试它。只测英语就像只测汽车在平路上的表现,却忘了它在泥路上的表现。
  • 可以“特训”:作者发现,如果用多语言的数据专门“训练”一下开源模型,它们的裁判能力会大幅提升(就像给裁判上了个“多语言速成班”)。
  • 警惕风险:现在直接让 AI 裁判去处理涉及多语言的重要任务(比如医疗、法律建议的评估)是很危险的,因为它们可能会因为语言不通而乱打分。

总结

这篇论文就像给 AI 界敲了一记警钟:“别以为你的 AI 裁判已经无敌了,它可能只是个‘英语单语者’。”

作者通过建立这个多语言、多模态的“国际考场”,揭露了当前 AI 在跨语言判断上的巨大短板,并呼吁大家以后在开发和使用这些 AI 裁判时,必须把“多语言能力”作为核心考核指标,否则它们可能会在关键时刻“掉链子”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →