← 最新の論文
🤖 AI

Investigating Social Bias in Narrative Image Generation

本論文は、テキストからの画像生成モデルにおける社会的バイアスが、単一の画像と比較して、ストーリーボードやコミックのような物語形式においてより蔓延しており、かつより明示的に現れることを実証しており、多様な視覚的文脈にわたってこれらのシステムを評価することの極めて重要な必要性を強調している。

原著者: Junyeong Park, Sowon Min, Euna Jang, Soobin Kim, Jiho Jin, Hyunseung Lim, Gahyeon Bae, Hwajung Hong

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Junyeong Park, Sowon Min, Euna Jang, Soobin Kim, Jiho Jin, Hyunseung Lim, Gahyeon Bae, Hwajung Hong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

テクニカル・サマリー:物語的な画像生成における社会的バイアスの調査

問題提起

テキストから画像への(T2I)生成モデルは、メディア、教育、デザインの分野で導入が進んでいる一方で、社会的バイアスを再現する傾向があるという懸念が根強く存在している。先行研究では、T2Iモデルが特定の属性や職業、社会的役割を特定のデモグラフィックと結びつける傾向があることが広く文書化されている。しかし、既存のバイアス評価は主に単発のフォトリアルな画像生成に焦点を当てている。この限定的な範囲には重要な欠落がある。すなわち、キャラクターの継続性、イベントのシーケンス、時間的進行、そして視覚要素とテキスト要素の相互作用を通じて意味が構築される物語的な視覚形式(ストーリーボードやコミックなど)において、社会的バイアスがどのように現れるのか、あるいは現れるのかについては不明なままである。著者らは、静止画では微細または不可視であるバイアスが、連続的なストーリーテリング形式においては明示的、あるいは増幅される可能性があると主張している。

メソドロジー

本研究は、もともとテキスト生成用に設計されたBBG (Bias Benchmark for Generation) フレームワークを、画像生成モデルの評価に適応させている。手法には以下のコンポーネントが含まれる:

  • プロンプト構成: 著者らは、年齢、障害、ジェンダー、身体的外見、人種/国籍、宗教、社会経済的地位(SES)の7つの社会的バイアスカテゴリを網羅する140個のシードプロンプトをBBGデータセットから選定した。これらのプロンプトは、特定の属性(例:どのキャラクターが特定の特性や結果を持つか)を特定しないよう、意図的に文脈的な曖昧さを持たせている。データセットには、クロスリンガルなバイアスを調査するために、英語のプロンプト70件と韓国語のプロンプト70件が含まれている。
  • 評価対象モデル: 以下の6つの最先端T2Iモデルをテストした:
    • プロプライエタリ(商用)モデル: GPT-Image-1.5, GPT-Image-2, Gemini-3.1-Flash-Image, Gemini-3-Pro-Image
    • オープンソースモデル: FLUX.1-Dev, SDXL
  • 生成設定: 各プロンプトに対し、以下の3つの異なる形式で出力を生成した:
    1. フォトリアル画像: 単一の静止画。
    2. ストーリーボード: テキストを含まない、ショットのフレーミングやカメラのカバレッジに焦点を当てたラフスケッチ。
    3. 4コマ漫画: 視覚要素と吹き出し、キャプション、ナレーションを統合した連続的な物語。
  • 評価プロトコル: 4人の著者が、BBGの問いに対する暗示的な回答に基づき、生成された画像(計2,400枚)を手動でアノテーションした。出力は、バイアスあり(biased)カウンターバイアス(counter-biased)、または**中立(neutral)**としてラベル付けされた。また、繰り返される視覚的および物語的なパターンを特定するために、主題コーディングも採用した。ビデオ生成(Sora-Pro-2およびVeo-3.1)に関するケーススタディも実施し、知見を時系列メディアへと拡張した。

主な結果

定量的知見

  • 物語形式によるバイアスの増幅: プロプライエタリモデルは、フォト生成と比較して、物語形式において有意に多くのバイアスを含む出力を生成した。平均して、プロプライエタリモデルはフォト生成において25.9%のバイアスを含む出力を生成した。この割合は、ストーリーボード生成において9.6パーセントポイント (pp)、コミック生成において18.2 pp増加した。
  • 言語間の格差: バイアスの出現率は、英語のプロンプトよりも韓国語のプロンプトの方が高く、韓国語の設定では平均してバイアスを含む出力率が7.2 pp高かった。最大の格差はフォト生成で見られた(例:Nano Banana 2は17.4 ppの増加を示した)。
  • オープンモデルの性能: オープンモデル(FLUX.1-DevおよびSDXL)は、平均して**93.6%**のケースで中立な出力を生成した。しかし、著者らはこれを効果的なバイアス緩和ではなく、指示追従能力の弱さに起因するものと考えており、これらのモデルはデモグラフィックな手がかりを取り込むことに失敗したり、文化的に不一致なコンテンツを生成したりすることが多いと指摘している。

定性的知見

  • 明示的バイアス vs 暗黙的バイアス: フォト生成におけるバイアスは、特定の服装、アクセサリー、表情などの微妙な視覚的手がかりを通じてエンコードされることが多い。対照的に、ストーリーボードとコミックは、イベントのシーケンス、キャラクターの配置、物語の結末、およびテキスト要素(例:ステレオタイプを明示する吹き出し)を通じて、より明示的にバイアスを明らかにする。
  • 視覚的連想の持続: ステレオタイプな視覚的連想(例:「クリエイティブ」な人物をカジュアルなファッションや電球のシンボルと共に描く)は、出力スタイルが変わっても、すべての形式において持続していた。
  • 層状のステレオタイプ: 物語形式は、単純な役割の割り当てを超えたバイアスを露呈させた。例えば、キャラクターの失敗や依存の「理由」は、ステレオタイプによって異なった(例:女性の看護師の依存は感情的な脆弱性として描かれる一方、盲目の人の依存は実用的なニーズとして描かれる)。
  • 表面的な緩和策: モデルは、反ステレオタイプな要素や道徳的な結末(例:対立する隣人を和解させる)を導入することで、バイアスを回避しようとすることがあった。しかし、著者らは、これが必ずしも根本的な連想を取り除くものではないと指摘している。なぜなら、微妙な視覚的手がかりが依然としてステレオタイプを強化している可能性があるからである。
  • 文化的ミスマッチ: 韓国の文脈において、モデルは文化的なニュアンスへの適合に失敗することが多く、英語や混合言語のテキストを生成したり、プロンプトの文化的文脈に一致しない西洋的、あるいは過度に伝統的な東アジアのイメージを生成したりした。

重要性と貢献

本論文は、主に3つの貢献を主張している:

  1. 物語的バイアスの初の研究: フォトリアルな画像と、ストーリーボードおよび4コマ漫画を比較することで、物語的な画像生成形式における社会的バイアスの最初の体系的な調査を提示している。
  2. 形式依存のバイアスの証拠: プロプライエタリモデルが、単一画像生成よりも物語形式(ストーリーボードおよびコミック)において有意に高いバイアスを示すことを証明しており、これは単一画像の評価ではモデルのバイアスの全容を捉えるには不十分であることを示唆している。
  3. 定性的メカニズム: バイアスが形式間でどのように異なって現れるか(フォトにおける微妙な視覚的手がかりから、コミックにおける明示的な物語およびテキストによる強化への移行)についての定性的な証拠を提供している。

著者らは、物語的な画像形式は、フォト生成単独よりもモデルのバイアスを突く強力なプローブ(探針)として機能すると結論づけている。彼らは、T2Iシステムを評価するには、多様な生成形式を考慮するために単一の画像出力を超えていく必要があると論じている。なぜなら、静止画では目立ちにくいバイアスが、連続的なストーリーテリングの文脈では表面化し、より有害になる可能性があるからである。また、本研究は多言語およびクロスカルチャーな能力の評価の必要性を強調しており、現在のモデルがプロンプトを特定の文化的文脈に接地させることにしばしば失敗していることを指摘している。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →