Multilingual Large Language Models do not comprehend all natural languages to equal degrees
该研究发现,尽管多语言大模型在多种语系中表现出显著的准确性,但其整体表现仍不及人类基线,且出乎意料的是,英语并非表现最佳的语言,反而被包括低资源语言在内的多种罗曼语族语言超越,这揭示了模型性能受分词机制、训练数据规模及来源(如WEIRD与非WEIRD社区)等多重因素驱动。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一次对人工智能(AI)语言能力的“全球体检”。
想象一下,现在的 AI 大模型(比如 GPT-4o、Grok-3、DeepSeek-V3)就像是一个个超级聪明的“语言翻译官”或“图书管理员”。大家通常认为,这些管理员最擅长的是英语,因为英语是它们读得最多的书。而对于那些不太常见的语言(比如小语种或非西方语言),大家觉得它们可能只会“照猫画虎”,理解得不够深。
但这篇研究告诉我们要打破这个刻板印象。研究人员找了 12 种来自不同“语言家族”的语言(包括英语、中文、日语、阿拉伯语、西班牙语、意大利语等),给这三位 AI 管理员出了一套阅读理解题,看看它们到底能不能真正“读懂”这些语言,而不是仅仅在“猜”答案。
以下是用通俗的大白话和生动的比喻来解释这篇论文的核心发现:
1. 核心发现:AI 还没完全“学会”像人一样思考
- 比喻:想象你在考场上,人类学生是真正的学霸,而 AI 是背了很多题库的“刷题机器”。
- 结果:在所有的 12 种语言测试中,人类学霸的成绩都普遍高于 AI。
- 意外:虽然 AI 在大多数语言上表现不错,但它们并没有达到人类那种“融会贯通”的水平。哪怕是在英语这种它们最熟悉的语言里,它们也偶尔会犯一些人类不会犯的“低级错误”。这说明 AI 目前更多是在统计规律(比如看到“因为”就猜后面是“所以”),而不是真正理解了句子的含义。
2. 最大的反转:英语不再是“王者”
- 旧观念:大家都以为 AI 的“母语”是英语,用英语问它,它最聪明;用其他语言问,它就像在“翻译”后再回答,容易出错。
- 新发现:英语并没有拿第一! 这就像你以为一个只会说英语的厨师,做意大利菜肯定不如做美式汉堡好吃,结果发现他做意大利面和西班牙海鲜饭比做汉堡还好吃!
- 具体表现:
- 西班牙语和意大利语(属于罗曼语族)在多个模型中表现最好,甚至超过了英语和德语。
- 有些模型在意大利语上的表现甚至能和人类打平手。
- 英语反而排在了中间位置,甚至不如一些“小语种”(相对于英语而言)。
3. 为什么会出现这种“怪象”?(三个关键因素)
研究人员像侦探一样分析了原因,发现了三个影响 AI 表现的“幕后推手”:
A. “分词”的魔法(Tokenization)
- 比喻:想象 AI 阅读时,不是按“字”读,而是按“积木块”读。
- 对于英语,积木块可能切得比较碎,导致它需要拼很多块才能理解一个词。
- 对于西班牙语或意大利语,积木块切得可能更合理、更完整,AI 读起来更顺畅,就像吃到了切得大小刚好的水果,一口一个,很香。
- 结论:有时候,切分语言的方式比语言本身的数据量更重要。
B. “距离”的影响
- 比喻:AI 的大脑里有一个“参考系”。研究发现,AI 似乎和西班牙语的“亲密度”更高,而不是英语。
- 结果:语言离西班牙语越近,AI 表现越好;离英语越近,表现反而不一定好。这推翻了"AI 以英语为默认核心”的假设。
C. “文字”的门槛(非拉丁字母的困境)
- 比喻:想象 AI 学习写字。
- 对于拉丁字母(如英语、法语、西班牙语),AI 就像在学骑自行车,有现成的路,容易上手。
- 对于非拉丁字母(如中文的方块字、日文的汉字假名、希腊文的特殊符号、阿拉伯文的连笔),AI 就像在学走钢丝。
- 结果:无论数据量多大,只要是用非拉丁字母写的语言(如中文、日语、希腊语),AI 的表现就明显较差。这说明目前的训练数据和处理方式,对非西方文字还不够友好。
4. 稳定性:AI 是个“情绪稳定”的机器人
- 比喻:人类做题时,可能会因为累了、走神了或者心情不好,同一道题做两次答案不一样。但 AI 只要设定好参数,它就像机器人一样,问它 100 次同样的问题,它给出的答案(哪怕可能是错的)通常一模一样。
- 发现:在“稳定性”这项指标上,有些 AI 模型(如 Grok-3)甚至比人类更稳定。这意味着 AI 不会“犯迷糊”,但也意味着如果它学错了,它会顽固地错下去。
总结:这对我们意味着什么?
- 不要盲目迷信 AI:哪怕是最先进的 AI,在理解语言深层含义上,离人类还有差距。如果你用它来处理重要的法律、医疗或情感问题,它可能会“一本正经地胡说八道”。
- 打破“英语中心论”:如果你用英语问 AI 问题,它不一定比用西班牙语或意大利语问它更聪明。在某些场景下,用罗曼语族语言可能得到更准确的结果。
- 关注“非西方”语言的公平性:对于那些使用非拉丁字母、或者属于非西方文化(非 WEIRD 群体)的语言,AI 的表现确实存在“短板”。这意味着这些语言的使用者在使用 AI 时,可能会面临更多的误解和信息偏差。
一句话总结:
这篇论文告诉我们,AI 并不是一个完美的“全知全能英语通”,它更像是一个在某些语言(如西语、意语)上表现惊艳,但在理解深层含义和特殊文字系统上仍有明显短板的“偏科生”。我们需要更谨慎地使用它,并意识到它背后的偏见和不平等。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。