← 最新の論文
💬 NLP

Leveraging LLMs for Context-Aware Implicit Textual and Multimodal Hate Speech Detection

本論文は、大規模言語モデルを活用して補助的な背景コンテキストを生成し、それを埋め込みの結合によって組み込むことが、テキストおよびマルチモーダルな設定の両方において、ゼロコンテキストのベースラインや既存のエンティティ・リンキング手法を上回り、潜在的なヘイトスピーチの検出を大幅に向上させることを実証するものである。

原著者: Joshua Wolfe Brook, Ilia Markov

公開日 2026-09-11
📖 1 分で読めます☕ さくっと読める

原著者: Joshua Wolfe Brook, Ilia Markov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットは、人間の表現が渦巻く広大で騒々しい市場であり、そこでは最も危険な言葉とは、声を荒らげる言葉ではなく、静かに佇む言葉である。コンピュータにとって、明白な差別用語や直接的な脅迫を検知することは比較的容易だが、異なる種類の有害性が、人目に触れぬよう隠れて存在している。これが「潜在的なヘイトスピーチ(implicit hate speech)」である。それは、皮肉、文化的コード、あるいは共有された世界の理解に依存して、その意図を伝えるものだ。単独で見れば無害に見える一文も、特定の出来事、歴史的参照、あるいはコミュニティ内のジョークというレンズを通して見れば、毒のある攻撃へと変貌する。長年、研究者たちはコンピュータにこれらの隠れた意味を見出す方法を教えようとしてきたが、根本的な問題に直面してきた。すなわち、機械には人間が当然のように前提としている「背景知識」が欠けているということだ。彼らは言葉を読むことはできても、その背後にある物語を知ることはできないのである。

この問題を解決するため、アムステルダム自由大学の研究チームは、コンピュータモデルに「家庭教師」をつけることにした。彼らは、エッセイを書いたり会話を行ったりできる強力な人工知能システムである大規模言語モデル(LLM)を利用し、ある特定のタスクを課した。AIを「判定を下す裁判官」として扱うのではなく、「事実確認を行う者」や「歴史学者」として利用したのだ。システムがソーシャルメディアの投稿を分析するたびに、AIはその投稿に対して短い背景コンテキストの段落を生成するよう求められた。もし投稿が、無名の政治団体や拡散中のミームに言及していた場合、AIはそれが誰であり、何を象ло支持しているのかを説明し、標準的なコンピュータプログラムが見落としてしまうであろう世界の知識の空白を埋める役割を果たした。研究者たちは、この新しい情報を検出システムに投入する4つの異なる方法をテストし、単に事実を投稿の横に貼り付けるだけで十分なのか、それともコンピュータが真の意図を理解するためには、投稿と事実を別々に処理する必要があるのかを検証した。

実験の結果は、明確かつ測定可能なものであった。研究者が潜在的なヘイトを含む数千件のツイートのデータセットを用いてこの手法をテストしたところ、AI生成の背景コンテキストを使用したシステムは、生のテキストのみに頼るモデルよりも大幅に優れた性能を示した。最も成功したアプローチは、コンピュータが元の投稿のデジタル表現と、生成された背景ストーリーの別の表現をそれぞれ作成し、これら2つの異なる情報を組み合わせるという特定のテクニックを用いたものであった。この手法により、システムが有害なコンテンツを正しく識別する能力は、コンテキストのないシステムと比較して最大3パーセントポイント向上した。この改善は、研究者が同じ論理を別の種類のコンテンツ、すなわちインターネット・ミームに適用した際に、さらに劇的なものとなった。ミームは画像とテキストを組み合わせたものであり、視覚的な手がかりに依存していることが多く、それは人間にとってのコード化された言語と同様に、機械にとっても混乱を招くものである。女性蔑視的なミームのデータセットにおいて、コンテキスト強化型システムは精度を最大6パーセントポイント向上させた。

しかし、より良い検出への道のりは、困難(落とし穴)がなかったわけではない。研究者たちは、単に投稿に言葉を付け加えることが必ずしも助けになるとは限らず、実際にはコンピュータを混乱させることもあることを発見した。AIがすでに明らかに有害な投稿に対して長文の詳細な説明を生成した場合、その追加情報が元のメッセージを希薄化させてしまい、システムがヘイトを見逃す原因となることがあった。逆に、AIが無害な投稿に対してバックストーリーを生成した際、本来存在しないヘイトの概念との結びつきを捏造してしまうことがあり、それが無実のコンテンツを危険なものとして誤ってフラグ立てさせることもあった。これは、AIが助けになろうとするあまり、中立的なフレーズや特定のグループに関する警告を、ヘイトへの支持として過剰に解釈してしまったために起こった。この研究は、背景知識を提供することは強力なツールであるが、慎重に取り扱われなければならないことを示した。最も効果的な方法は、投稿とコンテキストを一つのテキストブロックに統合することではなく、分析の最後の一歩までそれらを別々のものとして保持し、コンピュータが元のメッセージを新しい情報によってかき消されることなく、両者を比較検討できるようにすることであった。

また、この研究は、分野における一般的な仮定、すなわち「最も強力な人工知能こそが最終的な判断を下すべきである」という考えに異議を唱えた。研究者たちは、大規模言語モデルが投稿を読み取り、それがヘイトであるかどうかを自ら判断する「分類器」として機能できるかどうかをテストした。AIは、特に視覚的なミームに対しては非常に優れた能力を示したが、AIを背景事実の生成にのみ使用した特化型の検出システムを上回ることはできなかった。このことは、現時点での最善のアプローチは「パートナーシップ」であるということを示唆している。つまり、大規模言語モデルを、関連する事実を引き出すための「動的なライブラリ」として使い、その事実に基づいて最終的な決定を下すのは、より単純で焦点の絞られたシステムであるという方法だ。このモジュール方式により、システムはヘイトスピーチの特定のパターンを学習しながら、潜在的なヘイトを理解するために必要な膨大な世界の知識にアクセスすることができる。

結局のところ、この研究は、コンテキストがヘイトスピーチ検出における単なる「役立つ追加要素」ではなく、「必需品」であることを証明している。背景情報の生成を分類行為から切り離されたステップとして扱うことで、研究者たちは、より正確で堅牢なシステムを作り上げた。彼らは、隠れたヘイトを捉える鍵は、単に言葉を読むことではなく、その言葉が記述している「世界」を理解することにあるのだということを示した。このシステムは完璧ではなく、無害な皮肉と真の悪意の間の細い境界線に依然として苦慮しているものの、その知見は明確な未来への方向性を提示している。人工知能が進化し続ける中で、関連するコンテキストを生成し、統合する能力は、オンライン空間を最も狡猾な形態の人間の表現から守る任務を負うあらゆるシステムにとって、標準となっていくであろう。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →