Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study
这项实证研究探讨了在高低资源语言中开发可靠的多语言大语言模型作为评判者的策略,揭示出经过微调的较小模型在领域内数据上表现优异,而更大的零样本模型在领域外场景中更为出色,并警示领域外微调可能导致性能下降。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一位巨型、超级聪明的机器人图书管理员(即大型语言模型,或 LLM),它的工作是批改其他机器人撰写的文章。通常,这位图书管理员只说英语。但现在,我们需要它也能批改西班牙语和巴斯克语(巴斯克地区使用的一种独特语言)的文章。
这篇论文提出了一个问题:我们如何教会这位机器人图书管理员,在它不母语的语言中也能成为公正且准确的评判者,尤其是在我们缺乏大量“范文”来教导它时?
以下是他们实验的故事,分解为简单的概念:
1. 三种语言(测试对象)
研究人员挑选了三种语言进行测试,代表了不同程度的“数据可用性”:
- 英语: “高资源”语言。它就像拥有数百万本书的图书馆。机器人对它非常熟悉。
- 西班牙语: “中资源”语言。它有一个不错的图书馆,但不如英语的庞大。
- 巴斯克语: “低资源”语言。它就像一个只有极少书籍的乡村小图书馆。机器人天生对它知之甚少。
2. 场景 A:当我们拥有“教师指南”(领域内数据)时
想象你有一叠带有教师评语和分数的已批改文章(这就是“领域内数据”)。你想利用这份指南来训练你的机器人批改新文章。
重大发现:将评分标准保留在英语中!
研究人员尝试了两种翻译训练材料的方法:
- 方法 1(完全翻译): 将文章、学生的回答,以及教师的评分标准(评分规则)都翻译成西班牙语或巴斯克语。
- 方法 2(部分翻译): 翻译文章和学生的回答,但将评分标准和指令保留在英语中。
结果: 当评分规则保留在英语中时,机器人的表现好得多。
- 类比: 将评分标准视为机器人的“操作系统”。即使机器人正在阅读西班牙语的故事,如果关于如何评分的指令是英语的,机器人的大脑就能保持专注和一致。将规则翻译成机器人不太熟悉的语言,实际上会让它感到困惑,导致评分变得粗糙。
规模很重要(但不如你想象的那么重要)
他们测试了小型机器人(80 亿个“脑细胞”或参数)和巨型机器人(700 亿)。
- 发现: 当你拥有一份优秀的教师指南(训练数据)时,小型机器人就能做得和昂贵的大型机器人一样好。如果你有良好的数据来教导它,就不需要最大的模型。
- 额外收获: 同时用这三种语言混合训练机器人(多语言),比一次只训练一种语言更能提高它在西班牙语和巴斯克语上的表现。这就像同时学习三种语言能帮助你更好地理解所有语言的语法规则一样。
3. 场景 B:当我们没有“教师指南”(领域外数据)时
现在,想象你必须批改一种全新类型的文章(比如科学报告而不是故事),而且你没有任何已批改的样本来展示给机器人。你必须依赖机器人的天然智慧(零样本)。
重大发现:不要对大型机器人“过度训练”
研究人员尝试利用其他主题的数据(领域外数据)来教导机器人,看看这是否有助于它们学会批改新文章。
- 小型机器人: 通过这种额外的练习,它们实际上变得稍微好了一些。它们需要帮助。
- 大型机器人(700 亿): 这适得其反!当他们尝试用不相关的数据微调巨型机器人时,它们开始产生幻觉。它们变得过于自信,即使文章很差,也给每个人打满分 5 分。
- 类比: 想象一位博学的教授(大型机器人),他已经无所不知。如果你试图教他一项他不玩的游戏的规则,他可能会感到困惑,并开始编造自己奇怪的规则,以为那是正确的。与此同时,一个聪明的学生(小型机器人)实际上能从额外的练习中受益。
针对新主题的最佳策略:
如果你没有特定的训练数据,根本不要尝试微调机器人。就让这个巨大、聪明的机器人“原样”批改文章(零样本)。这比强迫它从不相关的数据中学习更可靠。
4. 研究结果总结
- 对于你熟悉(或有数据)的语言: 使用更小、更便宜的机器人。即使文章是西班牙语或巴斯克语,也要将评分指令保留在英语中。
- 对于你不太熟悉或没有数据的语言: 不要试图用随机示例来教导机器人。直接使用你拥有的最大、最聪明的机器人,让它在不进行额外训练的情况下自然地进行评分。
- “翻译陷阱”: 将游戏的规则翻译成低资源语言,往往会让机器人表现更差,而不是更好。
他们未做之事
该论文并未声称这将解决医疗诊断、法律判决或情感咨询问题。它严格专注于如何构建更好的工具,用于自动批改不同语言的文章。他们还指出,他们的“训练数据”是由其他人工智能模型生成的,而非人类,这是一个局限性,但对于像巴斯克语这样的语言,这是可用的最佳数据。
简而言之: 要构建一个可靠的多语言评判者,有时你需要用机器人的母语(英语)来发出指令,而有时你需要让大型机器人保持独立,让它们发挥天然的智慧。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。