Camellia: Benchmarking Cultural Biases in LLMs for Asian Languages
本文介绍了 Camellia,这是一个包含九个亚洲语言中超过 19,000 个标注实体和 2,000 个掩码上下文的基准测试,旨在评估并揭示多语言大语言模型在非西方文化方面存在的显著文化偏见和上下文理解差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一群非常聪明、见多识广的机器人(大型语言模型,或称 LLM)。这些机器人几乎阅读过互联网上的所有内容,并能说多种语言。你可能会认为,既然它们读了这么多,就能同等程度地理解每一种文化。但这篇名为Camellia的论文指出,这些机器人实际上存在相当大的偏见,尤其是在涉及亚洲文化时。
以下是研究人员所做的工作及其发现,使用了一些日常类比进行简要说明。
问题所在:“西方视角”
把这些 AI 机器人想象成大部分时间都待在纽约和伦敦的游客。他们对这些地方了如指掌。但当你问起印度乡村的一个村庄或首尔的一个街区时,他们有时会感到困惑。他们可能会假设,在纽约行得通的做法就是“默认”或“正确”的答案,即使上下文明显是亚洲的。
研究人员想知道:这些机器人是否以与西方名称、食物和地点相同的尊重和理解为对待亚洲名称、食物和地点?
工具:"Camellia"测试
为了找出答案,研究团队构建了一个名为Camellia的大型测试。你可以把 Camellia 想象成一个巨大的、多语言的“找不同”游戏。
- 参与者:他们测试了四种流行的 AI 模型(Llama、Qwen、Aya 和 Gemma)。
- 语言:他们专注于 9 种亚洲语言(如中文、日文、韩文、印地语、乌尔都语等),涵盖 6 种不同的文化。
- 数据:他们创建了两项主要内容:
- 一份包含 19,530 个条目的清单:包括名称、食物、饮料、城市和运动队。他们确保每种语言都有“西方”版本(如“千层面”或“纽约”)和“亚洲”版本(如“比尔亚尼饭”或“首尔”)。
- 2,173 个“填空”故事:他们从社交媒体中选取真实句子,将重要单词(实体)隐藏在
[MASK]标记之后。- 示例:“当我去韩国时,我绝对必须尝试 [MASK]。”(答案应该是一道韩国菜,而不是披萨)。
他们玩的三个游戏
研究人员让 AI 玩三种不同的游戏,以观察其偏见程度:
1. “文化契合”游戏(语境适应)
- 设置:AI 看到关于特定文化的句子(例如,关于韩国节日的故事),并必须猜出缺失的单词。
- 测试:AI 会猜出韩国名称/食物,还是不小心猜出西方名称/食物?
- 结果:AI 表现挣扎。在约30% 到 40% 的案例中,即使故事明显是关于亚洲文化的,机器人仍猜出了西方物品。这就像一个在东京的游客想点寿司,却不小心点了汉堡,因为他们认为“汉堡”是默认食物。
2. “情绪戒指”游戏(情感关联)
- 设置:AI 阅读带有隐藏单词的句子,并必须判断该句子是快乐、悲伤还是中性。
- 测试:AI 是否认为带有西方名称的句子更负面,或者带有亚洲名称的句子更积极?
- 结果:AI 的“情绪”会根据故事中谁而改变。某些模型更倾向于认为西方实体是“坏”或“负面”的,而另一些模型则认为亚洲实体是“好”的。这就像一个人潜意识里觉得,仅仅因为主角有一个外国名字,故事就更悲伤。
3. “寻宝”游戏(抽取式问答)
- 设置:AI 阅读一段长文,并必须从中找出隐藏的具体名称或地点。
- 测试:它能像找到西方名称那样容易地找到亚洲名称吗?
- 结果:AI 找到西方名称的能力远强于找到亚洲名称。在某些语言中,准确率差距巨大(高达 20%)。这就像一个侦探能轻易在人群中认出著名的西方名人,却错过了就站在他们旁边的本地英雄。
为什么会发生这种情况?
论文提出了几个原因,可以比作图书馆的组织方式:
- “图书馆”问题:AI 是在互联网数据上训练的。如果互联网上关于西方文化的书籍比关于亚洲文化的多,AI 就会更多地学习西方知识。
- “翻译器”问题:AI 使用“分词器”(一种将单词拆分成片段的工具)。对于某些亚洲语言,AI 的分词器就像一副有点模糊或缺失片段的眼镜。它无法像看清西方单词那样清晰地“看到”亚洲单词,这使得理解语境变得更加困难。
- “起源”问题:在中国构建的模型(如 Qwen)在中文、日文和韩文任务上的表现优于在其他地方构建的模型。这表明机器人“出生”(训练)的地方非常重要。
结论
该论文得出结论,尽管这些 AI 模型是“多语言”的,但它们尚未实现“多文化”。它们通常默认采用西方观念,难以理解亚洲语境的细微差别,并且对待亚洲实体的方式与西方实体不同。
研究人员构建Camellia并非为了立即修复这些机器人,而是为了给它们一份成绩单,让我们能确切看到它们在哪里失败。他们希望这有助于未来的开发者构建能够平等、公正地对待所有文化并具备同等理解力的 AI。
重要提示:该论文并未声称这些机器人在临床意义上具有危险性,或者它们现在就应该用于特定的现实世界决策。它只是说:“这是一个测试,这是机器人存在偏见的证据。在我们信任它们处理重要任务之前,我们需要修复这个问题。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。