Same question, different history: language, national identity, and credit in large language models
这项研究表明,大语言模型充当了文化记忆的分布式系统,其中查询语言系统性地充当了激活不同国家叙事的开关,导致在以相关语言提问时,地位较低的历史声索者被更频繁地呈现,而主导性的英语人物在所有语言中均保持稳定。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你拥有一位神奇、超级聪明的图书管理员,他读过几乎所有被写下来的书籍、文章和网站。你问这位图书管理员一个简单的问题:“无线电是谁发明的?”
如果你用英语问,图书管理员会说:“古列尔莫·马可尼(Guglielmo Marconi)。”
如果你用俄语问,图书管理员会说:“亚历山大·波波夫(Alexander Popov)。”
如果你用中文问,图书管理员会说:“毕生(Bi Sheng)”(指印刷术)。
你可能会认为图书管理员糊涂了或者在撒谎。但根据这篇论文,图书管理员并没有糊涂。图书管理员实际上是在扮演一个变色龙的角色。答案之所以改变,不是因为图书管理员改变了主意,而是因为你用来提问的语言就像一个开关,开启了机器内部特定的“民族记忆”。
以下是研究人员发现的内容,使用了简单的类比:
1. “变色龙”效应
研究人员测试了 11 种不同的 AI 聊天机器人(例如 ChatGPT 背后的那些),针对 21 种不同的历史争议(例如“电话是谁发明的?”)。他们用 12 种不同的语言询问了同样的问题。
他们发现,AI 不仅仅是在检索事实,它还在检索故事。
- 开关: 当你用特定的语言(如俄语)提问时,AI 会从其训练数据中存储的“俄语版”历史中提取信息。在那个版本中,波波夫是英雄。
- 结果: 如果你用俄语提问,波波夫出现在答案中的概率为 85%。如果你用其他任何语言提问,他出现的概率只有 48% 左右。
- 例外情况: 对于非常著名的、强大的人物(如亚历山大·格拉汉姆·贝尔或莱特兄弟),无论你使用什么语言,AI 都会给出相同的答案。他们是历史中的“全球名人”,在任何地方都会出现。但对于其他国家的“本土英雄”,只有当你使用他们的语言时,AI 才会展示他们。
2. “平庸的民族主义”
作者称之为**“平庸的民族主义(Banal Nationalism)”**。
想象一幅挂在建筑上的旗帜。你并不会每天注意到它;它只是背景的一部分。但它不断地提醒你:“这是我们的国家。”
AI 也在做同样的事情,只是它是隐形的。它不会挥舞旗帜或唱国歌。它只是回答你的问题。但通过用俄语回答并提到一位俄罗斯英雄,它在悄悄地强化这样一个观点:“这是俄罗斯的故事。”这是一种微妙的、日常的方式,在说:“我们记得我们自己的。”
3. “橡皮擦” vs. “荧光笔”
研究人员观察了 AI 完全忽略故事另一面(称为“抹除”)的情况有多频繁。
- 橡皮擦: 有时,AI 会说“贝尔发明了电话”,却对意大利发明家梅丘奇(Meucci)只字不提。当存在一个强大的英语使用者主张者(如贝尔)和一个较弱的竞争对手时,这种情况发生得更频繁。
- 荧光笔: 然而,如果你向 AI 询问关于两人的情况(例如“是贝尔还是梅丘奇发明了它?”),AI 就不太可能抹除第二个人。仅仅把名字放入问题中就像是一个安全网,迫使 AI 承认那个人的存在。
4. “纪念”的联系
研究发现,一个国家“庆祝”一位发明家的程度(通过雕像、节日或学校课程)与 AI 提及该发明家的频率之间存在强烈的联系。
- 类比: 想象一个城镇广场。如果一个国家为一位发明家建造了一座巨大的雕像,那么那位发明家在 AI 的训练数据中就是“响亮”的。当你用该国的语言提问时,AI 能清晰地听到那个响亮的声音。
- 惊喜之处: 即使对于那些没有雕像或节日的发明家,如果你用他们的母语提问,AI 仍然会更频繁地提到他们。这表明 AI 捕捉到的是该语言的普遍“噪音”——新闻、故事和日常谈话——而不仅仅是官方纪念碑。
5. “普遍性”的幻象
论文指出,我们经常认为这些 AI 工具是中立、普遍的图书馆。我们认为:“如果我问同样的问题,我应该得到同样的真相。”
研究显示事实并非如此。AI 更像是一个说着不同方言的旅行指南。
- 如果你讲英语,指南会向你展示“全球/英语版”的历史。
- 如果你讲葡萄牙语,指南会向你展示“巴西/葡萄牙语版”的历史。
危险之处不在于 AI 在撒谎,而在于它将这些不同的版本呈现为唯一的版本。如果你用英语提问,你可能永远不知道另一个国家对于谁发明了飞机有着完全不同的故事,因为 AI 没有提到它。
总结
论文得出结论,这些 AI 模型不仅仅是“事实机器”。它们是记忆机器,在潜移默化地塑造我们如何记忆历史。它们扮演着数字镜像的角色:如果你用自己的语言去看它们,你会看到你自己的民族英雄。如果你用另一种语言去看,你可能会看到另一组英雄,或者你可能对自己的本土历史一无所知。
你用来提问的语言不仅改变了答案中的词汇,它还改变了 AI 决定向你展示的哪个版本的过去。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。