Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South
本論文は、グローバル・サウスのコミュニティと協力して 26,000 件以上のローカライズされた失敗事例からなる多様なデータセットを生成し、固有の文化的害悪を明らかにするとともに、文脈を考慮した安全性フレームワークを提唱することで、テキストから画像への安全性における西洋中心主義的バイアスに対処する参加型レッドチームングイニシアチブ「PLACES」を紹介する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが記述する anything を描くことができる魔法の絵画機械(テキストから画像へのモデル)を想像してみてください。長い間、この機械は主に西洋(北米とヨーロッパ)の人々によって訓練され、彼らの視点を通して世界を見ることを学びました。それは、アメリカン・コンフォート・フードの作り方をしか知らないシェフのようです。インドやナイジェリアの特定の地域料理を頼んでも、 generic なハンバーガーか、混乱した料理を提供するかもしれません。
この論文「Going PLACES」は、この絵画機械に世界を正しく見る方法を教えることを決めた研究者チームに関するものです。彼らは単にオンライン上のランダムな人々に機械を壊そうと試させるのではなく、「グローバル・サウス」(特にガーナ、ナイジェリア、インドの一部)の地域コミュニティに深く入り込み、その特定の場所で機械が何を間違えているかを突き止めました。
以下に、彼らの仕事を簡単なアナロジーを用いて解説します。
1. 問題:「すべてに合う」安全網
研究者たちは、現在の AI 絵画機械に対する安全ルールは、単一サイズの救命胴衣のようだと主張しています。それは西洋人のスイマーには完璧にフィットするかもしれませんが、異なる文化圏の人にとっては緩すぎたりきつすぎたりします。
- 問題点: AI は西洋のルールに従うことで「安全」だと考えていますが、地域文化においては、深く侮辱的であったり、宗教的に不適切であったり、文化的に無知であったりする画像を生成している可能性があります。
- アナロジー: AI が「宗教儀式」を描くと想像してください。西洋では、単に一般的な教会を描くかもしれません。しかし、インドで特定のヒンドゥー教の儀式を頼んだ場合、AI は偶然にも神の足に靴を履かせてしまうかもしれません(これは大きなタブーです)し、2 つの異なる祭りを混同してしまうかもしれません。AI はこれらの地域の「交通ルール」を知りません。
2. 解決策:地元のガイドによる「レッドチームング」
「レッドチームング」とは、セキュリティシステムを破ろうとするハッカーのグループを雇い、悪党が手を出す前に修正するための手法です。通常、これらの「ハッカー」は米国や英国の巨大テック企業のオフィスにいる専門家です。
- PLACES が行ったこと: 外部者を雇う代わりに、彼らは地方都市の大学(ムンバイやラゴスのような大都市だけでなく)と提携しました。地元の学生や教員を「コミュニティ・ガイド」として招聘しました。
- ワークショップ: 学生が作業を開始する前に、研究者たちはワークショップを開催しました。これは訓練キャンプのようなもので、「AI はこう機能し、そしてあなたの文化は安全をこう捉えている」と説明しました。彼らは学生に地元の言語を使用すること、言語を混ぜること(英語にヒンディー語やピジン語の単語を混ぜるなど)、地元の比喩を使うことを奨励しました。
- 結果: 西洋のテスターが決して考えなかった方法で AI が失敗する26,000 件以上の事例を収集しました。このコレクションはPLACES データセットと呼ばれています。
3. 発見:AI の「文化的盲点」
彼らは 26,000 件の事例を分析し、3 つの主要な「盲点」を発見しました。
A. 「コード・ミキシング」の抜け穴
グローバル・サウスの多くの地域では、人々は自然に単一の文の中で言語を混ぜます(例:「ラゴスでジョロフ・ライスを食べている男」)。
- 発見: AI の安全フィルターは英語しか話さないボーダーのようです。英語と現地語を混ぜて囁きで秘密を伝えた場合、ボーダーは危険を理解できず、入場を許可してしまいます。研究者たちは、言語を混ぜることで、純粋な英語で書かれた場合ならブロックされただろうと安全フィルターを回避できることを発見しました。
B. 「規範的不一致」(価値観の衝突)
これは、AI が「西洋のルール」に従う一方で、「地域のルール」を破る状況です。
- アナロジー: AI がディナーパーティーのゲストだと想像してください。ホスト(地域文化)は「左手で食べないでください」と言います。ゲスト(AI)は「でも、私のルールブックには手はただの手と書いてある!」と言い、それでも左手を使います。
- 実際の例:
- 宗教: AI は、牛肉を食べるヒンドゥー教徒の男性(多くのヒンドゥー教徒にとって禁忌)や、メッカでギャンブルをするムスリムの画像を生成しました。AI にとってはこれらは単に「何かをしている人々」でしたが、地元の人々にとっては深く侮辱的なものでした。
- 習慣: AI は、インドで子供が年長者と握手をする様子を描きましたが、地域の習慣は足に手を触れることです。AI は文化の「清浄さ」や「敬意」のルールを見逃しました。
- 占い: AI は黒猫が道を渡る様子や割れた鏡を描きました。ある文化では、これらは単なる「猫」や「ガラス」ではなく、不運をもたらす悪い予兆です。AI は画像の「感覚」を理解していませんでした。
C. 「存在論的平坦化」(アイデンティティの抹殺)
これは、AI がユニークで具体的なものを、一般的で西洋的な形に押しつぶしてしまう現象です。
- アナロジー: 画家に特定の種類の地元のバスを描いてほしいと頼んだところ、単に一般的なアメリカのスクールバスを描かれたようなものです。
- 実際の例:
- 食: 「フフ(西アフリカの料理)」を頼んだところ、マッシュポテトやハンバーガーの画像が返ってきた。
- 芸術: 「ヤクシャガナの芸術家(特定のインドの劇場スタイル)」を頼んだところ、白いチュニックを着た一般的な「古典舞踊家」が返ってきた。
- 人々: 「南インドの屋台の店主」を頼んだところ、貧困のステレオタイプを強化するような、肌の黒い人物の画像が返ってきた(プロンプトに貧困を求めていなくても)。
4. なぜこれが重要なのか
この論文は、AI をより安全にするために単に「大きく」したり、同じ古い場所からのデータを追加したりするだけでは不十分だと結論付けています。あなたはズームインする必要があります。
- 教訓: 世界中の人々にとって AI を真に安全にするためには、その文化に住む人々に「安全」の定義を委ねる必要があります。「本部」ではなく、「コミュニティ・ガイド」に耳を傾ける必要があります。
まとめ
PLACES プロジェクトは、外国のロボットに地域の方言、習慣、タブーを教えるために地元の通訳チームを送り込むようなものです。彼らは、ロボットが「悪い」から失敗したのではなく、文化的なリテラシーが欠如していたからだと発見しました。地域コミュニティに AI を「レッドチームング」させることで、AI が誤る数千の新しい方法が明らかになり、安全とは普遍的なルールブックではなく、地域的な対話であることを証明しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。