← 最新论文
💬 NLP

No Optimal Language Set Exists for Multilingual Instruction Tuning: Insights from a Linguistically-Informed Study

本文系统地评估了用于多语言指令微调的基于语言学启发的语言选择策略,并发现不存在通用的最优语言集,因为性能高度依赖于特定的任务和模型,且增加更多语言往往会引发多语言诅咒。

原作者: Gürkan Soykan, Gözde Gül Şahin

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Gürkan Soykan, Gözde Gül Şahin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,人工智能的世界就像一座庞大且饥肠辘辘的图书馆。近年来,科学家们一直在教这些数字大脑遵循指令,而且不仅限于英语这一种语言,而是涵盖了数十种甚至数百种语言。这被称为“多语言指令微调”。你可以把它想象成在培训一名新员工,他需要与来自地球上每个国家的客户交流。目标是让这位员工足够聪明,能够理解法语提出的请求,用斯瓦希里语回答,并用日语解释一个笑话,且全程不会感到困惑。

然而,这里有一个陷阱。这座图书馆的架位空间(计算能力)和培训员工的时间都是有限的。如果你试图把每一种语言都塞进培训计划中,员工可能会因为负担过重而开始忘记如何流利地使用其中任何一种语言。这被称为“多语言之咒”。正因如此,许多研究人员都在思考:是否存在一种挑选完美语言组合的“魔法配方”?也许如果我们挑选那些地理分布广泛、或者听起来差异巨大的语言,我们就能创造出一个能为全世界所有人提供完美服务的超级聪明员工。这是一个充满希望的想法:找到完美的组合,就能得到最好的 AI。

这篇题为《多语言指令微调不存在最优语言集》的论文进入实验室,去测试这个想法。研究人员 Gürkan Soykan 和 Gözde Gül Şahin 设计了一系列实验,以观察他们是否能找到那个魔法配方。他们采用了三种不同类型的 AI 模型(可以把它们想象成三个具有不同学习风格的实习生),并尝试使用各种“基于语言学信息”的策略来教授它们。这些策略就像是不同的组队方式:一组是根据语言在地图上的分布位置(地理)来挑选的;另一组是根据语言的语法结构(类型学)来挑选的;还有一些是基于语言含义的相似度或计算机学习方式来挑选的。他们将这些“聪明”的选择与简单的“随机”选择(比如从帽子里抽签)进行了对比。

结果却是一个剧情反转。作者发现,并不存在一支每次都能获胜的“最佳”语言团队。这并不像找到一把能打开所有门的万能钥匙。相反,最佳选择完全取决于你正在训练哪种特定的 AI 模型,以及你要让它完成哪项特定的任务。对于某个模型,根据地理位置挑选语言效果很好;对于另一个模型,根据语法进行挑选则更有效。有时,“聪明的”选择甚至比随机挑选的表现还要差!

研究还发现了一个硬性限制。当他们不断向训练组合中添加更多语言时,AI 的性能并没有无限提升。一旦达到某个点——大约 13 或 14 种语言时——性能实际上开始下降。这就像是在吃自助餐:前几盘菜非常美味,但如果你不停地往盘子里堆食物,最终你会因为吃得太饱而无法享受其中的美味。这证实了“多语言之咒”:在固定的训练时间内,添加过多的语言会损害 AI 学习好所有语言的能力。

此外,研究人员发现,对一个 AI 模型有效的策略,对另一个模型可能效果很差。一种让某个模型变得更聪明的策略,可能会让另一个模型变得更笨。他们还注意到,在某些情况下,仅用一种语言(如越南语)进行教学,效果竟然与使用多种语言混合教学一样好,甚至更好,这取决于具体的模型。

最后,论文指出,寻找单一、完美的“最优语言集”是一条死胡同。不存在一劳永逸的解决方案。最好的方法似乎要更加谨慎:挑选一组大约 10 到 15 种语言的多元化组合通常是一个稳妥的选择,但你必须准备好为每一个新模型和每一项新任务测试不同的组合。作者警告说,仅仅通过平均不同测试的分数来评估是具有误导性的,因为这会掩盖某种策略可能对某项工作表现卓越、但对另一项工作表现糟糕的事实。所以,虽然我们找不到魔法配方,但我们确实知道,通过深思熟虑地挑选语言——并知道何时停止添加——是构建更好、更有用的多语言 AI 的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →