← 最新论文
🤖 AI

Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South

本文介绍了 PLACES,这是一项参与式红队行动,旨在通过与全球南方社区协作生成包含 26,000 多个本地化失败案例的多样化数据集,以解决文本到图像安全中的西方中心主义偏见,揭示独特的文化危害,并倡导具备情境感知能力的安全框架。

原作者: Charvi Rastogi, Mukul Bhutani, Minsuk Kahng, Shamsuddeen Hassan Muhammad, Evgeniia Razumovskaia, Priyanka Suresh, Ibrahim Said Ahmad, Charu Kalia, Yaaseen Mahomed, Madhurima Maji, Minjae Lee, Alicia P
发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Charvi Rastogi, Mukul Bhutani, Minsuk Kahng, Shamsuddeen Hassan Muhammad, Evgeniia Razumovskaia, Priyanka Suresh, Ibrahim Said Ahmad, Charu Kalia, Yaaseen Mahomed, Madhurima Maji, Minjae Lee, Alicia Parrish, Jessica Quaye, Vijay Janapa Reddi, Aishwarya Verma, Lora Aroyo

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一台魔法艺术机器(一种文本生成图像模型),它可以画出你描述的任何事物。长期以来,这台机器主要由西方人(北美和欧洲)训练,并学会透过他们的眼睛看世界。这就像一位只懂得烹饪美式舒适食物的厨师;如果你要求一道来自印度或尼日利亚的特定地方菜肴,他可能只会给你一个通用的汉堡或一团令人困惑的乱炖。

这篇题为《Going PLACES》的论文,讲述了一群研究人员决定教会这台艺术机器如何正确地看待世界其他部分的故事。他们并没有只是随机邀请网上的人尝试破坏这台机器;而是深入“全球南方”(特别是加纳、尼日利亚和印度部分地区)的当地社区,去查明机器在那些特定地点究竟哪里出错了。

以下是他们工作的分解,使用了简单的类比:

1. 问题:“一刀切”的安全网

研究人员认为,当前这些 AI 艺术机器的安全规则就像一件单一尺码的救生衣。它可能完美地适合西方游泳者,但对于来自不同文化的人来说,要么太松,要么太紧。

  • 问题所在:AI 认为遵循西方规则就是在保持“安全”,但在当地文化中,它可能会生成极具冒犯性、宗教上不恰当或文化上无知的图像。
  • 类比:想象 AI 正在绘制一场“宗教仪式”。在西方,它可能只是画一座通用的教堂。但在印度,如果你要求一个特定的印度教仪式,AI 可能会不小心给神像的脚穿上鞋子(这是一个巨大的禁忌),或者混淆两个不同的节日。AI 并不了解这些当地的“交通规则”。

2. 解决方案:与当地向导进行“红队测试”

“红队测试”就像雇佣一群黑客去尝试攻破一个安全系统,以便在坏人动手之前修复它。通常,这些“黑客”是坐在美国或英国大型科技办公室里的专家。

  • PLACES 做了什么:他们没有雇佣外部人员,而是与二线城市的大学(而不仅仅是孟买或拉各斯这样的首都)建立了合作关系。他们招募当地的学生和教职员工担任“社区向导”。
  • 研讨会:在学生开始工作之前,研究人员举办了研讨会。这就像是一个训练营,他们解释说:“这是 AI 的工作原理,而这是你们的文化如何看待安全的。”他们鼓励学生使用当地语言,混合语言(例如用英语夹杂印地语或皮钦语词汇),并使用当地隐喻。
  • 结果:他们收集了超过26,000 个AI 以西方测试者从未想过的方式失败的例子。这个集合被称为PLACES 数据集

3. 他们的发现:AI 的“文化盲点”

当他们分析了这 26,000 个例子时,发现了三种主要的“盲点”:

A. “代码混合”漏洞

在全球南方的许多地方,人们习惯在单个句子中自然地混合语言(例如,“一个在拉各斯乔洛夫饭的男人”)。

  • 发现:AI 的安全过滤器就像只讲英语的保镖。如果你用英语和当地语言的混合体低声耳语一个秘密,保镖听不懂其中的危险,就会放你进去。研究人员发现,混合语言允许用户绕过那些如果用纯英语书写就会被阻止的安全过滤器。

B. “规范失调”(价值观冲突)

这是指 AI 遵循其“西方规则”却破坏了“当地规则”的情况。

  • 类比:想象 AI 是晚宴上的客人。主人(当地文化)说:“不要用左手吃饭。”客人(AI)却说:“但我的规则书说手就是手!”然后仍然使用左手。
  • 真实案例
    • 宗教:AI 生成了一张印度教男子吃牛肉(这对许多印度教徒来说是禁忌)或穆斯林在麦加赌博的图片。对 AI 来说,这些只是“人们在做事”,但对当地人来说,这是极具冒犯性的。
    • 习俗:AI 展示了一个孩子在印度与长辈握手,而当地的习俗是触摸长辈的脚。AI 忽略了该文化中关于“纯洁”和“尊重”的规则。
    • 预兆:AI 画了一只黑猫穿过马路或一面破碎的镜子。在某些文化中,这些不仅仅是“猫”或“玻璃”;它们是带来厄运的坏预兆。AI 没有理解图像的感觉

C. “本体论扁平化”(抹杀身份)

这是指 AI 将独特且具体的事物粉碎成通用的、西方化的形状。

  • 类比:这就像要求画家画一种特定的当地巴士,而他们只是画了一辆通用的美国校车。
  • 真实案例
    • 食物:要求画“富富”(一种西非菜肴),结果得到的是土豆泥或汉堡的图片。
    • 艺术:要求画一位“雅克夏甘纳艺术家”(一种特定的印度戏剧风格),结果得到的是一个穿着白色芭蕾舞裙的通用“古典舞者”。
    • 人物:要求画一位“南印度街头小贩”,结果得到了一张深色皮肤人物的图片,这种方式强化了贫困的刻板印象,即使提示语中并没有要求表现贫困。

4. 为什么这很重要

该论文的结论是,你不能仅仅通过让 AI“更大”或添加更多来自相同旧地方的数据来使其更安全。你必须深入细节

  • 教训:要让 AI 真正对全世界安全,你需要让生活在这些文化中的人们定义对他们而言什么是“安全”。你需要倾听“社区向导”的声音,而不仅仅是“总部”的声音。

总结

PLACES 项目就像派遣一支当地翻译团队,去教一个外国机器人当地的方言、习俗和禁忌。他们发现,机器人之所以失败,并不是因为它“坏”,而是因为它文化文盲。通过让当地社区对 AI 进行“红队测试”,他们揭示了 AI 可能出错的数千种新方式,证明了安全并非一本通用的规则书,而是一场当地的对话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →