EmergencyBias: Bias in Text-to-Image Models under Emergency Scenarios
本文介绍了“EmergencyBias”,这是一个用于评估文本生成图像模型在紧急场景下人口统计学和行为偏见的框架,该框架揭示了七个模型在风险与干预描绘方面的系统性差异,并提出了“ActionAlign”,一种旨在减轻这些偏见同时保持图像质量的轻量化校准方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你刚刚拿起了一台神奇的相机,它拍出的不是现实世界原有的样子,而是根据你的话语来绘画。如果你说“一位厨师”,它可能会画出一个男人;如果你说“一位护士”,它可能会画出一个女人。这就是现代文本生成图像(T2I)模型的工作方式:它们是极其聪明的艺术家,能将句子转化为惊艳的视觉画面。但问题在于:这些数字画家是在互联网上庞大的旧图片堆中训练出来的,而那个堆里充满了刻板印象。长期以来,科学家们一直在检查这些数字画家是否在“人物身份”上出了错——比如只把医生画成男性,或只把护士画成女性。他们一直在观察画面中静态的角色阵容。但如果真正的问题不仅仅是谁在房间里,而是他们在做什么呢?如果相机认定,当情况糟糕时,只有某些人才是足够勇敢去提供帮助的,而其他人只能站在一旁观看呢?这就是偏见的新前沿:不仅是关于谁出现了,更是关于谁在行动、谁在反应,以及谁有资格成为英雄。
复旦大学的一个研究团队决定让这些 AI 艺术家接受终极测试:急诊室。他们创造了一个新术语——EmergencyBias(紧急情况偏见),用来描述一种隐蔽的偏见,即当 AI 被要求描绘危机场景(如车祸或火灾)时发生的现象。他们想看看,AI 是否会自动认定男性是冲上前去拯救局面的人,而女性、老年人或肤色较深的人则是需要被拯救或仅仅是旁观的人。
为了查明真相,他们并没有只是让 AI 画一个随机场景,而是设计了一个大规模、系统性的实验。他们设定了六种不同的高风险场景,从有人在河中溺水到地铁站发生意外。他们要求全球最先进的七个 AI 模型来绘制这些场景。首先,他们给模型提供“空白”提示词——仅输入“一个人在地铁站平台摔倒”——以观察 AI 默认会选择谁。然后,他们提供了“受控”提示词,明确告诉 AI:“画一位女性旁观者”或“画一位处于危机中的老年人”,以观察 AI 是否仍会在行为表现上对他们进行区别对待。
结果就像是在看一个魔术,魔术师不小心露出了底牌:AI 模型确实存在偏见,而且当情况变得惊险时,这种偏见会加剧。当提示词为空时,AI 压倒性地选择男性既作为处于危险中的人,也作为提供帮助的人,而老年人在“处于危机中”的角色里几乎是隐形的,出现率不足 8%。但真正的震惊来自于他们控制了人口统计特征。即使他们明确告诉 AI“画一位女性旁观者”,模型仍然让她比男性旁观者更不容易表现出“提供帮助”的行为。AI 似乎有一个隐藏的剧本:无论提示词如何,男性都是积极的救援者,而女性则是被动的观察者。这不仅仅是一个小小的故障;性别之间在“帮助行为”上的差异是他们发现的最显著的偏见。
研究人员还测试了一种他们称之为 ActionAlign(行动对齐) 的新型轻量级修复方法。你可以把它想象成一个微小的、隐形的教练,在 AI 画家开始作画前就在耳边低声叮嘱,引导它打破坏习惯,同时又不抹杀其艺术天赋。他们将其与一种更显而易见的办法(即仅仅在提示词中加入“伦理”词汇,如“要公平”)进行了对比。结果显示,ActionAlign 在修复行为方面表现得更好。在其中一个模型上,它将帮助行为中的偏见大幅降低了 78.14%,而几乎没有影响图像的质量。这表明,你不能仅仅通过几个词告诉 AI 要“友善”;有时你需要重新训练它对于不同的人在危机中应该如何行动的内在感知。
简而言之,这篇论文表明,我们的 AI 艺术家不仅是在复制谁在房间里,还在复制他们认为谁“应该”成为英雄。即使我们强迫它们画出特定的人,它们仍然难以想象那个人采取行动。好消息是,通过一点聪明的微调,我们或许能够教会这些模型为每个人写出更公平的剧本,确保在未来的数字应急场景中,英雄能像我们所有人一样多样化。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。