Decoding Islamophobic Discourse: Using LLMs to Identify Tropes and Semi-Coded Hate Speech
本論文は、大規模言語モデルとトピックモデリングを用いて過激派プラットフォームからの大規模データを分析し、大規模言語モデルが半暗号化されたイスラム嫌悪的な侮蔑語を効果的に特定できることを示す一方で、そのようなヘイトスピーチが多様な政治運動に広く存在し、他の形態のヘイトスピーチよりも高い毒性スコアを得ることが多いことを明らかにする。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを巨大で騒がしい広場だと想像してみてください。近年、この広場に集まる人々の一部がムスリムに向けて罵声を浴びせ始めましたが、彼らは巧妙な新しい手口を学びました。露骨な差別用語を叫ぶ代わりに、「秘密の暗号語」を使うようになったのです。
この論文は、現代のAI(特に大規模言語モデル、LLM)がこれらの暗号を解読し、憎悪が拡散する前に阻止できるかどうかを突き止めようとする探偵チームのようなものです。
以下に、彼らの調査を簡単な比喩を用いて解説します。
1. 問題:憎悪の「カモフラージュ」
過去には、憎悪表現は「私はお前を嫌いだ」と書かれた鮮やかな赤いシャツを着た人のように、一目でわかりました。
現在、憎悪を撒き散らす者たちはカモフラージュを着ています。彼らは無害に見える、あるいは普通の名前のように聞こえる言葉を使いますが、過激派フォーラム(4Chan や Gab など)の文脈では、恐ろしい意味を持ちます。
- 「マッドスライム」のトリック: 「Muslim(ムスリム)」という単語の「M」を「Mud(泥)」に置き換え、「slime(ヌメリ)」を加えたものです。不気味で人間性を否定する響きですが、文脈を離れてこの単語だけを聞けば、奇妙な造語のように見えます。
- 「アブドゥル」の罠: 「アブドゥル」は一般的で普通のムスリムの名前です。しかし、これらのプラットフォームでは、憎悪を撒き散らす者たちは、特定のグループ全体を嘲笑するために一般的な名前を使うのと同様に、これを一般的な侮辱として用います。
- 「ムズラット」の混同: これはデートアプリ「Muzz」と「Rat(ネズミ)」を組み合わせたものです。ムスリムを害虫のように見せかけるように設計されていますが、自動フィルタをすり抜けるように書かれています。
研究者たちはこれらを**「語彙外(OOV)」または「半暗号化」**用語と呼んでいます。これらは、羊の衣装を着たオオカミのデジタル版に他なりません。
2. 調査:AI はカモマージュを見抜けるか?
研究者たちは、非常に賢い AI(GPT-4)にこれらの投稿を読み、「これは憎悪表現か?」と判断させました。
- 良いニュース: AI は驚くほど「羊の衣装を着たオオカミ」を見抜くのが得意です。研究者がmudslime、pislam、muzratといった単語を含む投稿を AI に与えると、AI はその大部分を正しく憎悪表現として識別しました。言葉が奇妙か中立的に見えるとしても、その意図が悪意あるものであることを理解していたのです。
- 悪いニュース: AI は時として文脈に混乱します。他の憎悪的な言葉なしに「アブドゥル」という名前が使われている場合、AI は「ああ、ただの名前だ」と思い込み、憎悪を見逃す可能性があります。確信を持つためには、より多くの手がかりが必要です。
3. 毒性テスト:その憎悪はどれほど「有毒」か?
研究者たちは、ムスリムに対する憎悪表現と、ユダヤ人に対する憎悪表現(反ユダヤ主義)を比較しました。その際、「毒性メーター」として機能するGoogle Perspective APIというツールを使用しました。
- 結果: メーターは、ユダヤ人に対する憎悪表現よりも、ムスリムに対する憎悪表現の方が著しく毒性が高い(より失礼で、攻撃的で、虐待的である)ことを示しました。
- 比喩: 反ユダヤ主義が鋭いナイフだとすれば、この研究におけるムスリムに対する憎悪表現は、丸太を叩くための金槌のようでした。言葉はより重く、騒々しく、暴力的でした。
4. 「トロープ」の謎:AI は「物語」を理解できるか?
憎悪表現は、古くから繰り返される物語や「トロープ(ステレオタイプ)」に依存することが多いです。研究者たちは、AI に憎悪表現を以下の 5 つの特定のカテゴリに分類するよう求めました。
- 人種差別: 肌の色や民族に基づいて人々を攻撃すること。
- 移民: ムスリムが国を「奪っている」と主張すること。
- 宗教: 信仰体系としてのイスラム教を攻撃すること。
- 預言者: 預言者ムハンマドを侮辱すること。
- 抑圧: ムスリム女性が抑圧されている、あるいは不当に扱われていると主張すること。
- 結果: AI は預言者に対する侮辱(言葉が非常に具体的で明白なため)と、宗教への攻撃を見抜くのが得意でした。
- 苦戦: AI は人種差別、移民、抑圧の区別をするのに苦労しました。これらを混同することがよくありました。まるで、凶器は簡単に見つけられるが、なぜ犯罪が起きたのか、あるいはどの特定の動機が使われたのかを特定するのに苦労する探偵のようです。
5. 結論:進行中の作業
この論文は、AI がこれらの「秘密の暗号語」を認識する能力を向上させているものの、まだ完璧ではないと結論付けています。
- 機能していること: AI はmudslimeが悪い言葉であることを判別できます。
- 機能していないこと: 憎悪が微妙な場合、あるいはどの特定のステレオタイプが使われているのかを判断しようとする場合、AI は深い意味を見逃すことがあります。
結論として:
研究者たちはソーシャルメディアプラットフォームに対して、「もはや明白な悪い言葉を探すだけでは不十分だ。これらの新しい、奇妙で暗号化された言葉を理解するように AI を教育しなければ、憎悪表現は隙間から逃げ続けてしまうだろう」と伝えています。また、この憎悪があまりにも有毒であるため、オンラインの広場を安全に保つために、緊急の対応が必要であると提言しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。