← 最新论文
💻 computer science

Beyond wheelchairs and blindfolds: Investigating disability stereotypes in T2I models with INCLUDE-BENCH

本文介绍了 INCLUDE-BENCH,这是首个用于评估文本生成图像模型中残障相关偏见的规模化基准测试,揭示了当前系统会系统性地依赖如轮椅等狭隘刻板印象,并在描绘残障人士时表现出与现实世界偏见关联更强的对齐性。

原作者: Sophia Lichtenberg, Albert Gatt, Judith Masthoff

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Sophia Lichtenberg, Albert Gatt, Judith Masthoff

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一台神奇的艺术机器,只要你描述,它就能画出任何东西。你说,“画一个厨师”,它就会吐出一张穿着白帽子、正在烹饪的人的图片。你说,“画一个残障人士”,嗯……这就是魔法变得有点“掉链子”的地方了。

乌得勒支大学的研究人员决定通过一个名为 INCLUDE-BENCH 的全新大型测试来测试这个故障。他们不仅仅是想看看这些机器是否存在“偏见”,他们还想了解这些机器是如何产生偏见的。为此,他们使用了包含 119,680 张生成图像的海量数据集。他们要求 17 种不同的艺术引擎(包括任何人都可以使用的开源引擎和两个封闭的、秘密的引擎)去描绘各种不同情境下的残障人士。

以下是他们的发现,附带一些现实层面的审视。

“轮椅”捷径

最大的惊喜是什么?这些机器对轮椅有着近乎痴迷的执念。当研究人员要求画一个“行动不便”的人或仅仅是一个通用的“残障”人士时,几乎所有的模型都会立即转向轮椅。这就像是你要求一位厨师画一个“面包师”,而他们画了一个拿着擀面杖的人,却忽略了烤箱、面粉或真正的面包。

论文显示,对于这些特定的提示词,机器在绘制轮椅方面表现得极其一致,但在绘制其他任何东西时却表现得很糟糕。这是一种视觉上的捷径。机器心想:“哦,残障?那就是轮椅,”然后就止步于此了。

“年老且忧郁”的滤镜

这些机器似乎还有一个奇怪的年龄与情绪滤镜。当它们描绘行动不便的人时,这些人往往年纪较大。如果画中人是女性,她通常被画在家里,从事烹饪或清洁工作;如果画中人是男性,他通常被画在户外,比如公园或博物馆。

研究人员发现,这些机器基本上是在玩一场“刻板印象宾果游戏”。它们在挑选最显眼、最容易识别的线索(如轮椅或眼罩)以确保你能认出那个人,但这样做同时也抹去了所有的其他细节。它们并没有展示一群过着多元生活的普通人,而是展示了一组非常狭隘、非常年老且非常特定的角色。

“对齐度 vs. 多样性”的权衡

这里有一个关于魔法背后数学逻辑的有趣思考方式。研究人员测量了两件事:

  1. 对齐度 (Alignment): 图片与你输入的文字匹配程度如何?
  2. 多样性 (Diversity): 图片彼此之间有多大差异?

他们发现了一个有趣的权衡关系。那些与“行动不便”或“残障”这些词匹配得最好(最高对齐度)的图片,其多样性却是最低的。它们看起来几乎一模一样:一个坐在轮椅上的老人。

但当他们要求画“盲人”或“聋人”时,图片变得稍微多样化了一些。你可能会看到一个拄着拐杖的人,或者戴着墨镜的人,或者只是一个看起来在沉思的人。但即便如此,机器仍然会退回到旧有的套路中,比如画上眼罩或特定的手势。

“温暖度与能力”评分

研究人员甚至发明了一种新的评分方式,称为 SCM 分数。想象一个坐标轴,一侧是“这个人看起来有多友善?”(温暖度),另一侧是“他们看起来有多能干?”(能力)。

在现实世界中,人们往往认为残障人士是“善良但能力有限”的。论文发现,这些艺术机器也在复制这种氛围。那些坐在轮椅上的人物的图片在“能力”得分上较低。比起没有残障的人,他们看起来显得没那么有能力。即使研究人员要求机器描绘他们在进行积极活动(如行走或聊天),机器仍然难以让他们看起来具备能力感。

机器错失了什么(以及它们没测试什么)

重要的是要了解这项测试没有做的事情。研究人员明确表示,他们没有测试认知或智力障碍。为什么呢?因为这些障碍并不总是能在图片中体现出来。你无法像画轮椅那样,通过绘画来表现一个人的思考过程。所以,我们得到的结果严格限于那些你可以“看见”的事物。

此外,论文并不声称已经“修复”了这个问题。他们并没有找到一个可以关闭偏见的魔术开关。相反,他们构建了一个巨大的“卷尺”(INCLUDE-BENCH),向我们展示了现在的这个“卷尺”到底有多么失准。他们发现,即使尝试改变语境(例如要求画一个在咖啡馆里的人对比在公园里的人),机器仍然会严重倾向于使用刻板印象。

底线结论

论文表明,这些艺术机器不仅仅是在无意中犯错;它们正在积极地复制我们在现实世界中看到的那些狭隘且刻板的故事。它们过度强调了“诊断性”线索(轮椅、拐杖),却忽略了其余的人性部分。

研究人员对此非常有信心,因为他们生成了近 120,000 张图像,并使用数学和 AI 工具进行了检查。他们不是在猜测,而是在测量。而测量结果显示:如果你想看到一个真实、多元且有能力的残障人士,目前还不能仅仅依靠机器。机器仍然卡在“轮椅与高龄”的循环之中。

因此,尽管这项技术很神奇,但它仍在学习阶段。它还没学会理解一个人不仅仅是他的残障。在那之前,这台神奇的艺术机器主要还是在一遍又一遍地重复着那些陈旧的故事。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →