← 最新论文
💬 NLP

Multilingual Prompt Localization for Agent-as-a-Judge: Language and Backbone Sensitivity in Requirement-Level Evaluation

该研究通过跨五种语言的 4950 次评估实验揭示,在智能体作为裁判的代码基准测试中,评估语言与模型骨干之间存在显著交互作用,导致不同语言下最优模型排名发生逆转,因此必须将语言视为显性的评估变量并实施完整的提示语本地化。

原作者: Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

发布于 2026-04-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Alhasan Mahmood, Samir Abdaljalil, Hasan Kurban

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给AI 程序员做“体检”时,发现了一个以前没人注意到的**“语言陷阱”**。

想象一下,你开了一家跨国软件公司,雇佣了五位不同的AI 程序员(也就是论文里的“骨干模型”,比如 GPT-4o、Gemini 等)来写代码。为了知道谁最厉害,你请了一位**“考官”**(Judge)来检查他们的作业。

1. 以前的做法:只有一种“考试语言”

过去,大家默认这位考官只说英语。不管 AI 程序员是用什么语言写的代码,或者任务本身是用什么语言描述的,考官都用英语来打分。

  • 潜台词:“只要英语考得好,你就是最好的程序员。”
  • 结果:大家觉得 GPT-4o 是绝对的“考神”,因为它在英语考试里总是拿第一。

2. 这篇论文的发现:换个“考官语言”,排名全变了!

作者们做了一个大胆的实验:他们把这位考官的“语言包”换成了五种完全不同的语言(英语、阿拉伯语、土耳其语、中文、印地语),然后让同一批 AI 程序员做同样的编程任务。

结果让人大跌眼镜:

  • 在英语考场:GPT-4o 依然是老大,分数最高。
  • 在阿拉伯语和印地语考场:GPT-4o 突然“水土不服”,分数大跌;而原本在英语里排第二的 Gemini 却像换了一个人,直接冲到了第一名,甚至把 GPT-4o 甩在身后。

这就好比:

一个擅长做“美式汉堡”的厨师(GPT-4o),在美式餐厅里是五星大厨。但如果你把他放到一家“印度咖喱餐厅”里,让他用印地语菜单做菜,他可能连火都点不着。而另一个厨师(Gemini),在美式餐厅里只是二流,但到了印度餐厅,他却是神厨。

结论:如果你只用英语去评价厨师,你就永远不知道谁在印度餐厅里更厉害。语言,直接决定了谁才是“最强”。

3. 核心发现:不仅仅是“翻译”那么简单

作者还发现了一个更有趣的现象:“考官的指令”比“考题本身”更重要。

  • 实验:他们让考官用印地语去读印地语的考题(全本地化),和用英语指令去读印地语的考题(部分本地化)。
  • 结果
    • 阿拉伯语环境里,考官用英语指令也能考得不错(因为阿拉伯语在 AI 的训练数据里很多,考官“懂行”)。
    • 但在印地语环境里,如果考官用英语指令,分数直接从 43% 暴跌到 23%!
    • 比喻:这就像让一个不懂中文的考官,拿着中文试卷,却用英文的“评分标准”去打分。他可能完全看不懂试卷里的细微差别,导致误判。只有当考官完全用当地语言思考时,他才能公正地评判。

4. 为什么这很重要?(给普通人的启示)

这篇论文其实是在给所有搞 AI 的人敲警钟:

  1. 不要迷信“英语排名”:如果你看到某个 AI 在英语榜单上排第一,别急着认为它在所有语言环境下都是最好的。它可能只是“英语特化型”选手。
  2. 语言不是中立的:以前大家觉得语言只是换个外壳,换个翻译就行。但这篇论文证明,语言是核心变量。就像给汽车换轮胎,换不同路面的轮胎(语言),车的性能表现会完全不同。
  3. 未来的评价标准:以后评价 AI 程序员,不能只问“它英语好不好”,而要问“它在目标语言环境下,能不能听懂指令、能不能把活干好”。

总结

这篇论文就像是一个**“语言侦探”**,揭开了 AI 评估界的一个大秘密:
“没有绝对的王者,只有最适合特定语境的选手。”

如果你要在中东或南亚开发软件,千万别只盯着英语榜单上的第一名,否则你可能会选到一个在本地完全“水土不服”的 AI 助手。真正的“好”,取决于你和它用什么语言对话

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →