← 最新论文
💬 NLP

Cultural Awareness is Represented but Not Decoded: Tracing Mythological Knowledge across 18 Open-Source LLMs

本文研究了 18 个开源大语言模型,发现尽管它们在内部表征了来自不同文化的神话知识,但其无法一致性地检索非主流传统知识的原因在于一种解码器读取偏差(decoder readout bias),这种偏差将这些表征坍缩到了主流传统的标记(tokens)上,且这一局限性进一步受到提示词语言的影响。

原作者: Iaroslav Chelombitko, Ekaterina Chelombitko, Mika Hämäläinen

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Iaroslav Chelombitko, Ekaterina Chelombitko, Mika Hämäläinen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

文化大故障:为什么人工智能知道宙斯,却忘了乌科

想象一下,你正走进一座巨大的、高科技的图书馆,里面包含了互联网上几乎所有的书籍。这座图书馆由一个超级聪明的机器人管理员管理,它读过了每一页。你问管理员:“希腊故事里的众神之王是谁?”管理员立刻喊道:“宙斯!”你问:“罗马故事里的众神之王是谁?”“朱庇特!”你问:“北欧故事里的众神之王是谁?”“索尔!”这个机器人表现得完美无缺。但随后,你问:“芬兰神话中的至高天空之神是谁?”机器人犹豫了,结巴了,最后给出了一个错误的答案,或者甚至说:“我不知道。”

这不仅仅是一个随机的错误;这是一个模式。这个机器人似乎了解那些“流行”的故事(希腊、罗马、北欧),但对于“不太出名”的故事(芬兰、斯拉夫、埃及、中国)却显得力不从心。这是因为机器人学习的图书馆大部分是用英文编写的书籍和西方故事组成的。但这里有一个巨大的谜团:机器人是真的忘记了这些较少为人知的神明,还是它其实知道,只是拒绝说出正确的名字?

为了解决这个问题,科学家们使用特殊的工具来观察机器人的“大脑”(实际上是一个被称为“大语言模型”的复杂计算机程序)。他们想要看看信息是丢失在了记忆中(“编码器”),还是记忆本身没问题,但负责说话的部分(“解码器”)出了故障。把这想象成一个学生在参加考试。如果学生写错了答案,是因为他不知道这个事实,还是因为他明明知道,却因为紧张而写错了?这篇论文就像是一个侦探故事,深入机器人的大脑内部,去查明文化偏见究竟发生在哪个环节。

调查过程:深入机器人的大脑

研究人员 Iaroslav 和 Ekaterina Chelombitko 以及 Mika Hämäläinen 决定测试 18 个不同的开源 AI 模型。他们并没有随机提问,而是基于古老的民俗书籍设计了一个非常巧妙且结构化的游戏。他们从一个著名的神话目录中挑选了 27 个特定的角色(如“至高天空之神”、“太阳神”或“恶作剧者”),并要求机器人说出这些角色在 10 种不同文化中的对应身份:希腊、罗马、北欧、芬兰、乌克兰、印度、埃及、中国、日本和美索不达米亚。

为了观察机器人内部发生了什么,他们使用了四种不同的“X光”工具:

  1. 线性探测(Linear Probing): 一项测试,用于查看机器人的内部记忆是否包含正确的文化标签。
  2. 对数透镜(Logit Lens): 一种逐层窥视机器人思维的方法,以观察它何时决定一个答案。
  3. 激活补丁(Activation Patching): 一个“如果……会怎样”的实验,他们通过交换机器人内部来自另一种文化的思维,来观察答案是否会发生变化。
  4. 输出提取(Output Extraction): 简单地询问机器人问题,并观察它实际说了什么。

重大发现:大脑没问题,嘴巴坏了

结果令人惊讶且非常明确。当研究人员观察机器人的记忆(残差流)时,他们发现机器人实际上完美地掌握了该文化。

想象一下,机器人的大脑是一个巨大的文件柜。当你问及一位芬兰神明时,机器人的内部文件清晰地显示出一个贴着“芬兰神话”标签的文件夹,里面装有正确的名字。使用“线性探测”工具可以高精度地读取这个文件夹(准确率通常在 60% 到 88% 之间)。机器人知道希腊神与芬兰神之间的区别。

然而,当机器人被要求开口说话时,它搞砸了。

这是核心发现:失败发生在“读出”(readout)阶段,而不是“表示”(representation)阶段。 机器人知道答案,但当它试图说出来时,它会将那个独特、具体的名称(比如芬兰天空之神的“乌科”)坍缩成最流行、最默认的名字(比如“宙斯”或“索尔”)。

研究人员称之为**“解码受抑”(Decoding Suppressed)**。在对 18 个模型的研究中,这是最主要的问题。在每一个模型中,绝大多数情况下(在 51% 到 76% 的时间里),机器人的内部记忆是正确的,但它给出的最终答案却是错误的。这就像一个学生明明知道答案是“芬兰”,但在动笔写的时候,他的手却自动写成了“希腊”,因为那是他在老师桌上每天都能看到的东西。

他们排除了哪些可能性

论文还测试了一些其他的想法,以确保他们的结论是正确的:

  • 并非仅仅是“翻译问题”: 有人认为机器人只是在脑子里把一切都翻译成英文,然后再翻译回来。如果真是这样,机器人在其大脑内部就不会感知到文化差异。但研究表明,机器人的大脑确实能清晰地识别这种差异。
  • 并非仅仅与模型规模有关: 研究人员检查了更大的模型(拥有更强的“脑力”)是否能解决这个问题。他们发现,虽然更大的模型稍有进步,但“知道答案”与“说出答案”之间的差距从未缩小。即使是最大的模型,仍然存在这种偏见。
  • 并非仅仅是语言问题: 他们测试了机器人是否因为无法阅读母语(如芬兰语或乌克兰语)而失败。他们发现,即使机器人能够阅读该语言,它仍然倾向于给出“英语/西方”的默认答案。偏见存在于机器人的决策部分,而不仅仅是它的阅读能力。

语言的转折

这项研究中最有趣的环节之一,是使用两种方式提出相同的问题:用英语以及用该文化的母语(例如,用英语询问芬兰神话,以及用芬兰语询问)。

他们发现,机器人的大脑就像一个开关。当你用英语提问时,它使用一套路径来决定答案;当你用芬兰语提问时,它使用另一套略有不同的路径。有时,使用母语能帮助机器人给出正确答案,但通常情况下,机器人仍然会默认使用那些著名的西方名字。

研究人员发现,如果你用英语和母语分别询问同一个问题,然后取两者中的最佳答案,你可以在不教给机器人任何新知识的情况下,多修复约 36% 的错误。这就像有两个朋友在核对答案;如果一个说“宙斯”,另一个说“乌科”,你可以选择正确的那一个。

结论:修复嘴巴,而非大脑

论文得出结论,问题不在于 AI 不了解芬兰、斯拉夫或埃及的神话。AI 是知道这些的。 问题在于,生成文本的部分被“文化默认值”所限制(gated)。它有一种习惯,即将独特的、具体的文化细节“压平”为它在训练数据中看到的那些最常见、最主流的细节。

这意味着,要解决 AI 中的文化偏见,我们不应该仅仅尝试喂给机器人更多关于芬兰神话的书籍(这会对“记忆”有帮助,但其记忆已经存在了)。相反,我们需要修复机器人“说话”的部分。我们需要教会机器人,即使在觉得“宙斯”是更安全、更常见的答案时,说出“乌科”也是完全可以的。

研究表明,解决方案在于“读出”干预——即改变机器人选择最终词汇的方式——而不是仅仅试图重新训练它的整个大脑。这提醒我们,仅仅拥有所有信息并不意味着机器一定会告诉你真相;有时,它只是在告诉你它认为你想听的话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →