← 最新の論文
💻 computer science

Beyond wheelchairs and blindfolds: Investigating disability stereotypes in T2I models with INCLUDE-BENCH

本論文は、テキストから画像を生成するモデルにおける障害に関連するバイアスを評価するための初の大規模なベンチマークであるINCLUDE-BENCHを紹介するものであり、現在のシステムが車椅子のような狭いステレオタイプに系統的に依存していること、および障害者を描写する際に現実世界の偏見に基づいた連想との結びつきがより強いことを明らかにしている。

原著者: Sophia Lichtenberg, Albert Gatt, Judith Masthoff

公開日 2026-07-10
📖 1 分で読めます☕ さくっと読める

原著者: Sophia Lichtenberg, Albert Gatt, Judith Masthoff

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたの指示通りに何でも描いてくれる、魔法の芸術マシンがあります。「シェフを描いて」と言えば、白い帽子をかぶって料理をしている人の絵が出てきます。「障害のある人を描いて」と言えば……ところが、そこで魔法が少しバグってしまうのです。

ユトレヒト大学の研究チームは、このバグをテストするために、「INCLUDE-BENCH」という新しい巨大なテストを実施することにしました。彼らは単にマシンが「偏っている(バイアスがある)」かどうかを知りたいのではなく、どのように偏っているのかを知りたいと考えました。そこで、119,680枚もの生成画像を用いた大規模なデータセットを使用しました。彼らは17種類のアートエンジン(誰でも使えるオープンソースのものと、2つの非公開の秘密のもの)に対し、あらゆる状況における障害を持つ人々を描くよう命じました。

以下に、その結果を「現実という名のサイドメニュー」と共に提供します。

「車椅子」というショートカット

最大の驚きは何だったでしょうか? マシンは車椅子に執着しているのです。研究者が「移動に制限がある」人や、単に一般的な「障害のある」人を求めたとき、ほぼすべてのモデルが即座に車椅子へと手を伸ばしました。それはまるで、シェフに「パン職人」を描くよう頼んだのに、オーブンや小麦粉、あるいは実際のパンについては無視して、ただ麺棒を持っている人ばかりを描くようなものです。

論文によれば、これらの特定のプロンプトに対して、マシンは車椅子を描くことに関しては驚くほど一貫していますが、それ以外のものを描くことに関しては極めて稚拙です。これは視覚的なショートカットです。マシンは「ああ、障害? それは車椅子ってことだ」と考え、そこで止まってしまうのです。

「老いと悲しみ」のフィルター

マシンには、年齢と気分に関する奇妙なフィルターもあるようです。移動に制限がある人々を描くとき、彼らは圧倒的に高齢者でした。もしその人が女性であれば、家の中で料理をしたり掃除をしたりしている姿で描かれることが多くありました。もし男性であれば、公園や美術館などの屋外にいることが多くありました。

研究者たちは、マシンが基本的に「ステレオタイプ・ビンゴ」のゲームをしているのだと指摘しています。彼らは、その人が誰であるかを確実に分からせるために、最も明白で認識しやすい手がかり(車椅子や目隠しなど)を選び出していますが、その過程で他のあらゆる詳細を消し去っています。彼らは、多様な人々がそれぞれの人生を生きている姿を見せているのではなく、非常に狭く、非常に高齢で、非常に特定のキャラクターを描いているのです。

「アライメント(適合性)対多様性」のトレードオフ

ここにある魔法の背後にある数学的な考え方を、面白い方法で説明してみましょう。研究者は2つの要素を測定しました:

  1. アライメント(適合性): 画像が入力された言葉とどれくらい一致しているか。
  2. 多様性: 画像同士がどれくらい異なっているか。

彼らは興味深いトレードオフを発見しました。「移動に制限がある」や「障害がある」という言葉に最もよく一致する(アライメントが高い)画像は、最も多様性が低い(バラつきがない)という結果になったのです。それらはすべて、ほとんど同じように見えました。つまり、車椅子に乗った高齢者です。

しかし、「盲目の」人や「耳の不自由な」人を求めたときは、画像に少し多様性が生まれました。杖を持っている人、サングラスをかけている人、あるいはただ考え込んでいるような人が描かれることもありました。それでもなお、マシンは目隠しや特定のハンドジェスチャーといった、古い手法に陥っていました。

「温かさと有能さ」のスコア

研究者たちは、SCMスコアと呼ばれる新しいスコアリング方法も考案しました。グラフの一方の軸を「その人はどれくらい親しみやすいか(温かさ/Warmth)」、もう一方の軸を「その人はどれくらい有能に見えるか(有能さ/Competence)」として想像してみてください。

現実の世界では、人々はしばしば障害を持つ人々を「親切だが、あまり有能ではない」と考えることがあります。論文によると、アートマシンもまさにこの雰囲気をコピーしていることが分かりました。車椅子に乗った人々の画像は、「有能さ」のスコアが低かったのです。彼らは、障害のない人々の画像よりも、有能さが低く見えるように描かれていました。研究者が、活動的な行動(歩いたり会話したりするなど)をしている人々を描くよう指示した場合でも、マシンは依然として彼らを「有能」に見せることに苦戦していました。

マシンが間違えたこと(およびテストしなかったこと)

このテストが「行わなかったこと」を知っておくことも重要です。研究者たちは、認知障害や知的障害についてはテストしていないと明言しています。なぜなら、それらは必ずしも目に見えるものではないからです。車椅子のように、思考プロセスをそのまま絵に描くことはできません。したがって、得られた結果は、あくまで「目に見えるもの」に関するものです。

また、この論文は問題を「修正した」とも主張していません。彼らは、バイアスをオフにする魔法のスイッチを見つけたわけではありません。その代わりに、彼らは、現在のメジャー(ものさし)がいかに壊れているかを正確に示すための、巨大な測定器(INCLUDE-BENCH)を作り上げたのです。彼らは、コンテキスト(文脈)を変えても(例:カフェでの人物 vs 公園での人物)、マシンは依然としてステレオタイプに強く傾倒していることを発見しました。

結論

この論文は、これらのアートマシンが単に偶然ミスをしているのではなく、現実世界で見られるような、狭くステレオタイプな物語を積極的に再現しているのだと示唆しています。彼らは「診断的な」手がかり(車椅子や杖)を過剰に重視し、人間としての他の側面を無視しています。

研究者たちは、12万枚近い画像を生成し、数学とAIツールを用いて検証したため、この結果に自信を持っています。彼らは推測しているのではなく、測定しているのです。そして、その測定結果はこう告げています。もし、多様で有能な障害を持つ人々を見たいのであれば、まだマシンに頼ることはできません。マシンはまだ、「車椅子と高齢者」のループの中に閉じ込められているのです。

したがって、テクノロジーは驚異的ではありますが、それはまだ「人間は障害以上の存在である」ということを学んでいる最中です。それまでは、魔法のアートマシンは、結局のところ、同じ古い物語を何度も何度も描き続けているだけなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →