← 最新论文
💬 NLP

IndoBias: A Dual Track Culturally Grounded Benchmark for LLMs Bias Evaluation in Indonesian Languages

本文介绍了 IndoBias,这是一个具有双重评估轨道的文化根植型基准测试,用于评估大语言模型在印尼语及三种当地语言中的偏见,结果显示现有模型表现出显著的表征不公平性,且在 Common Crawl 数据上进行预训练或纳入当地语言可能会加剧这些偏见。

原作者: Ikhlasul Akmal Hanif, Muhammad Falensi Azmi, Filbert Aurelian Tjiaranata, Eryawan Presma Yulianrifat, Fajri Koto

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Ikhlasul Akmal Hanif, Muhammad Falensi Azmi, Filbert Aurelian Tjiaranata, Eryawan Presma Yulianrifat, Fajri Koto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个超级聪明、读过互联网上几乎所有内容的巨型机器人图书管理员。当你问它:“哪种类型的员工最好?”或者“这个村庄的人是什么样的?”时,机器人会瞬间回答,但有时,它的回答是基于它在阅读过程中听到的陈旧、不公或夸张的故事,而非事实。这就是偏见(Bias)

长期以来,科学家们一直在检查这个机器人是否存在偏见,但他们大多只用英语进行提问。他们没有检查机器人对印度尼西亚人是否公平,而印度尼西亚是一个拥有超过 1,300 个不同民族和 700 种地方语言的国家。这就像只检查伦敦的天气预报,就假设它对整个地球都准确一样。

这篇论文介绍了 IndoBias,这是一个专门为印度尼西亚及其地方语言(爪哇语、巽他语和望加锡语)设计的全新“公平性测试”。你可以把 IndoBias 想象成一个旨在观察机器人思维方式的两部分侦探游戏。

侦探游戏的两个赛道

研究人员构建了两种不同的方式来测试机器人:

1. “找不同”赛道 (IndoBias-Pairs)
想象一下将两个句子并排展示给机器人:

  • 句子 A(刻板印象): “[群体 X] 的人以 [懒惰] 著称。”
  • 句子 B(反向叙述): “[群体 X] 的人以 [勤奋] 著称。”

机器人必须选择哪一个句子看起来更“自然”或更有可能真实。如果机器人一致选择负面的刻板印象,那么它就是有偏见的。研究人员用四种语言创建了 544 对这样的句子。他们发现,机器人在处理印尼语时能很好地捕捉到常见的刻板印象,但在谈论地方语言中的宗教和政治问题时,它的偏见甚至变得更加严重。

2. “开放式故事”赛道 (IndoBias-QA)
这个赛道就像是要求机器人针对特定的人物或群体(如特定的部落、政府部门或大学)编写一个故事或填写一份表格。

  • 挑战: 一些群体非常有名且拥有清晰的刻板印象(如爪哇人)。而另一些群体则规模较小或知名度较低(如科罗威人)。
  • 发现: 机器人对这些群体的对待方式截然不同。对于著名的群体,它可能会有一种“标准”偏见。但对于规模较小或边缘化的群体,机器人往往会描绘出一幅更加黑暗、不那么公平的画面。这就像机器人的“聚光灯”在某些群体身上照得极亮,却让另一些群体处于阴影之中,使他们看起来比实际情况更糟。

他们发现了什么?

研究人员进行了实验,以了解机器人为什么会这样表现:

  • “原始互联网”问题: 他们发现,如果让机器人在未经滤过的原始互联网数据(如 Common Crawl)上进行训练,机器人会学到更多的偏见。这就像是通过让一个孩子阅读互联网上所有评论区而不加过滤一样去教导他们。相比之下,在经过精心编辑的来源(如维基百科或新闻文章)上进行训练,得到的机器人会稍微公平一些。
  • “地方语言”的意外发现: 你可能会认为教给机器人更多的当地语言会让它变得更公平。然而,研究发现事实恰恰相反。当他们在训练组合中加入地方语言(如爪哇语和巽他语)时,机器人实际上变得更加有偏见了。它似乎吸收了存在于这些特定地方对话中的现实世界的偏见和刻板印象。
  • 解码器 vs. 编码器: 研究对比了不同类型的“机器人大脑”。“解码器”(Decoder)模型(即生成文本和进行聊天的模型)比“编码器”(Encoder)模型(即仅理解文本的模型)具有更严重的偏见。

大局观

主要结论是,偏见并非千篇一律。 一个机器人在英语中可能是公平的,但在印尼语中可能就不公平;或者它对一个民族是公平的,但对另一个民族却不公平。

作者警告说,如果我们不在特定的文化背景下测试这些机器人,我们就有可能制造出那些在无意中伤害它们本应帮助的人们的工具。他们创建了这个基准测试(IndoBias),以便开发者可以在将机器人发布到公众面前之前,根据这些特定的文化现实来检查它们的表现。

简而言之: 你不能仅仅把一个英语的公平性测试翻译成印尼语,就期望它能奏效。你需要一个定制的测试,它能够理解印度尼西亚独特的、复杂的且多元的社会结构。这篇论文提供了这样一个测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →