← 最新论文
💬 NLP

Language Models Entangle Language and Culture

本文表明,大型语言模型在处理低资源语言查询时,会系统性地提供质量较低的响应并表现出改变的文化语境,从而基于语言选择造成系统性的劣势。

原作者: Shourya Jain, Paras Chopra

发布于 2026-01-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Shourya Jain, Paras Chopra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你走进了一座巨大的、充满魔力的图书馆,那里有一位超级聪明的机器人图书管理员(即大语言模型),它可以帮助你解决任何问题。你可能会问关于如何改善睡眠、如何创业或如何投资储蓄的问题。

这篇论文就像是给那位机器人图书管理员的一份成绩单,但有一个特别之处:研究人员想看看,这位图书管理员是否会根据你所说的语言来区别对待你。

以下是他们发现的故事,通过简单的方式进行了拆解:

1. “魔镜”测试

研究人员创建了一个包含 20 个日常问题的列表,例如“我该如何改善睡眠?”或“卖 T 恤的一个好商业计划是什么?”他们不仅仅用英语提出了这些问题。他们还将这些问题翻译成了印地语、中文、斯瓦希里语、希伯来语和巴西葡萄牙语。

随后,他们用所有这些语言向机器人图书管理员询问了同样的问题。

结果: 图书管理员并不公平。当人们用英语、中文或葡萄牙语提问时,回答质量很高、细节丰富且很有帮助。但当人们使用印地语、斯瓦西里语或希伯来语提问时,回答往往较短、缺乏细节,而且质量明显变差。这就像是图书管理员有一个“偏爱的语言”,并且对其他语言投入的精力较少。

2. “文化服饰”的变化

这是最有趣的地方。研究人员发现,你所说的语言不仅会改变机器人的回答质量,还会改变机器人所想象的世界

把机器人想象成一名演员:

  • 如果你用英语提问,演员会穿上“西方”的戏服。他们可能会基于美国或欧洲的习惯、价值观和例子来提供建议。
  • 如果你用印地语提问,演员会换上“印度”的戏服。他们会突然开始思考印度的家庭结构、当地食物或不同的社会规范。
  • 如果你用斯瓦希里语提问,他们会穿上“非洲”的戏服。

研究人员通过将印地语的回答翻译回英语,并让第二个机器人(“裁判”)来猜测文化,证明了这一点。这个“裁判”仍然能分辨出:“这个回答最初是用印地语写的,”因为建议的“风味”是不同的。语言不仅改变了词汇,也改变了机器人思考时使用的文化视角

3. “事实地图”测试

为了进一步验证,他们使用了一张文化事实图谱(一个名为 CulturalBench 的基准测试)。他们向机器人提问,例如“巴西的一道名菜是什么?”或“谁是尼日利亚的历史人物?”

他们发现,机器人的准确性在很大程度上取决于所使用的语言。与使用其他语言相比,当用某个国家自身的语言(或与其相关的主要语言)提问时,机器人对该国的知识掌握得更多。这就像机器人为不同语言准备了不同的“事实书”,而其中一些书比其他的要完整得多。

4. 为什么会这样?

论文指出,对于这些 AI 模型来说,语言和文化是纠缠在一起的,就像缠绕在同一棵树上的两根藤蔓。你很难将它们分开。

因为 AI 是通过海量的互联网文本进行训练的,它学到了“英语”通常与“西方文化”联系在一起,而“印地语”则与“印度文化”联系在一起。当你切换语言时,AI 会自动切换它从记忆中提取的文化语境。

核心结论

主要的启示非常简单:如果你用一种“低资源”语言(即在互联网上数据较少的语言)向 AI 提问,你得到的答案可能比用英语提问时要差。

更糟糕的是,你得到的答案可能在文化层面也会有所不同,这不仅体现在质量上,还体现在它对你生活所做的基本假设上。研究人员认为这是不公平的。正如人类应该能够用母语寻求建议,并获得与英语使用者同等优质的帮助一样,这些 AI 模型需要得到更好的训练,以免根据用户所说的语言而将用户拒之门外。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →