Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed
本立场论文认为,通用型毒性检测器无法保护包括侏儒症患者或视障人士在内的边缘化群体,并论证了虽然通过基于提示的自适应和微调,社区特定毒性检测能显著提高伤害识别能力,但仍需大量研究才能达到通用型系统的性能水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正漫步在一座巨大的、充满魔力的艺术画廊中,墙壁是由活生生的颜料构成的。这不仅仅是一座普通的画廊,它由一个超级聪明的机器人艺术家驱动,这个艺术家能瞬间将你最狂野的文字转化为图像。如果你说“一只戴帽子的猫”,它就会画出一只戴着帽子的猫。这种技术被称为“文本生成图像”(Text-to-Image generation),就像是一个能实现视觉愿望的数字精灵。但就像任何强大的工具一样,它有时也会犯错。有时,它可能会画出一些可怕、暴力或纯粹无礼的东西。为了阻止这种情况,科学家们建造了“安全卫士”——数字保镖,它们会在每幅画挂上墙壁之前进行检查。如果保镖看到了不好的东西,它就会拦截这张图片。
长期以来,这些保镖一直遵循着一套“一刀切”的规则手册。它们被训练去识别明显的坏事,比如暴力或仇恨言论,这就像是教一名保安只盯着携带武器的人看。但如果危险不在于武器呢?如果危险是一种微妙的、伤害性的刻板印象,而只有特定群体才能识别出来呢?这篇论文深入探讨了正是这样一个问题。它在问:如果安全保镖正忙于寻找长剑,以至于忽略了它正在画一个腿部变成了轮子的轮椅使用者,或者一个在读书时眼睛上蒙着眼罩的盲人呢?研究人员认为,我们需要一种新型的安全卫士——它能够理解不同社区特定的、独特的规则,而不是仅仅向所有人应用相同的通用规则。
问题所在:处于“失职状态”的通用保镖
研究人员首先测试了当前的顶尖安全卫士(即“最先进的”检测器)在针对两个特定群体生成的图像上的表现:盲人或低视力人群(BLV),以及侏儒症患者(DWF)。他们创建了一组包含 2,400 张图像的数据集,其基础是来自这些社区的真实提示词,要求 AI 展示他们从事日常活动的情景,如烹饪、工作或玩耍。
然后,他们请五位残障专家查看这些图像,并指出其中任何感觉不对劲或有害的地方。专家们发现了一个令人震惊的差距。尽管目前的这些安全保镖为这些图像盖上了“安全”的认可印章,但专家们发现其中有 35% 的图像实际上是有害的。
为了让你有一个具体的例子,这里所谓的“有害”是指:
- 对于盲人/低视力群体: AI 可能会画出一个拥有机械、金属质感眼睛的人,或者展示一只戴着眼罩的导盲犬(这既滑稽又令人困惑),或者描绘将盲杖当作烹饪勺子来使用。
- 对于侏儒症群体: AI 可能会将一名成年侏儒症患者画成婴儿,或者将他们变成童话故事中的矮人角色,或者展示长着胡须的女性侏儒症患者。
这些不仅仅是“失误”,而是加深了有害观念的深度刻板印象错误。论文表明,目前的“通用型”检测器对这些特定类型的伤害完全视而不见。当研究人员要求这些检测器使用新的、特定的规则来观察这些图像时,检测器的表现极其糟糕。事实上,它们的表现往往比随机猜测还要差。这就像是要求一名只知道如何识别人脸假胡须的保镖去寻找假胡须一样;他们根本没有合适的工具来完成这项工作。
解决方案:教会卫兵特定的规则
既然“通用型”保镖不起作用,团队尝试在不从头开始重建整个机器人的情况下,教 AI 新的技巧。他们测试了三种不同的方法,使安全卫士能够适应这些特定的社区:
- “展示与讲述”法(上下文学习/In-Context Learning): 想象向 AI 展示几个坏图片的例子,并告诉它:“看到这个了吗?因为它有 X 特征,所以它是坏的。现在看这张新图片。”这种方法有一定帮助,提高了检测得分,但并不稳定。有时 AI 能做对,有时它仍然会感到困惑。
- “审讯”法(视觉问答/Visual Question Answering): 研究人员不再只是询问“这安全吗?”,而是问 AI 一系列具体的问题,例如:“这个人有胡须吗?”或者“眼睛看起来真实吗?”如果 AI 对一个负面特征回答“是”,那么图片就会被标记。这种方法效果更好!它迫使 AI 仔细观察细节。对于侏儒症群体,这种方法将检测得分提升到了一个非常有前景的水平。
- “学习课程”(微调/Fine-Tuning): 这是指让 AI 使用一个大约 100 个样本的小型数据集进行一次简短的强化训练。他们教会了 AI 针对这些社区的特定规则。对于较小的 AI 模型来说,这是最有效的方法,显著提升了它们的性能。
难点:这比看起来要难
虽然这些方法有所改进,但论文明确指出,我们还没有解决这个问题。即使采用了最好的方法,AI 识别这些特定伤害的能力仍然远低于其识别一般性坏事的能力。研究人员发现,AI 对变化非常敏感。如果社区说:“实际上,我们现在不认为那个特定的东西是有害的了,”那么基于旧规则训练的 AI 就会感到困惑并无法快速适应。
论文总结道,虽然我们取得了进展,但建立一个真正尊重并保护弱势群体的安全系统是一个巨大的挑战。这不仅仅是编写一本更好的规则手册;它需要 AI 开发人员与这些社区之间进行持续的、不断演进的合作。“一刀切”的方法正式宣告失效;AI 安全的未来需要的是由特定社区主导的、细分化的理解。研究人员建议,我们需要继续致力于此,因为在能够可靠地检测到这些微妙的伤害之前,我们看到的“安全”图像可能仍在强化那些伤害真实人类的刻板印象。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。