Examining hate speech infection in social media using range constraints in multidimensional data structures
本論文は、シェップレットに基づく時系列解析と多次元データ構造および範囲制約を組み合わせることで、ソーシャルメディアにおけるヘイトスピーチの拡散を駆動する時間的ウィンドウとユーザーの接続パターンを正確に特定し、それによってより効果的なイベント検出と緩和を可能にする手法を提案するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ソーシャルメディアを、誰もが自分の考えを叫んでいる、巨大で賑やかなパーティーだと想像してみてください。時として、その場の雰囲気は悪化し、特定の種類の「毒性の感染症」(ヘイトスピーチ)が広がり始めることがあります。この論文の著者であるエレアナ・カフェザとそのチームは、ただ飛び交う一つ一つの悪い言葉を捕まえようとするのではなく、まさに「いつ」その感染が始まり、「誰が」それを広めているのかを突き止めたいと考えました。
ユーザーのタイムラインを、単なる投稿のリストではなく、心拍モニターとして捉えてみてください。チームは言葉そのものを見るのではなく、すべてのユーザーの感情的な強さを、グラフ上の波打つ線へと変換しました。もしユーザーが怒りや憎しみに満ちた投稿をしていれば、彼らの「心拍数」は負のエネルギーとともに急上昇します。
探偵の道具箱:シェイプレットと接尾辞木構造(サフィックスツリー)
悪意のある行為者を見つけ出すために、研究者たちはシェイプレット分類と呼ばれる巧妙なトリックを用いました。泥だらけの足跡の山の中から、特定の指紋を探しているところを想像してみてください。「シェイプレット」とは、それが誰の足跡であるかを証明する、その足跡の小さく特徴的な断片のようなものです。この場合、「指紋」とは、ヘイトスピーチを行うユーザーだけが持つような、感情のスパイク(急上昇)の特定のパターンを指します。
しかし、あらゆる足跡をあらゆる指紋と照らし合わせる作業は、膨大な時間がかかります。そこでチームは、**接尾辞木構造(サフィックスツリー)**と呼ばれる超高速なライブラリを構築しました。これは、あらゆる単語のパターンが瞬時に整理された、魔法のように整理されたファイルキャビネットのようなものです。ライブラリにあるすべての本を読んで物語を探す代わりに、キャビネットに「『怒り』で始まる物語はどこ?」と尋ねるだけで、棚の場所を教えてもらえるのです。これにより、通常なら長い年月を要するような検索作業が、瞬きをする間の出来事へと変わりました。
二段階のフィルター:時間と影響力
パターンを見つけることは、第一段階に過ぎません。本当の魔法は、入り口で二つのIDをチェックするドアマンのように、二つの追加フィルターを加えたときに起こりました。それは、時間と影響力です。
- 時間の窓(タイムウィンドウ): チームは、ヘイトスピーチはニュースが流れるなどの特定のイベントの直後に爆発的に増えることに気づきました。彼らは単に悪いパターンを探すだけでなく、「このパターンは『今』起きたのか?」と問いかけました。特定の時間枠(例えば13時間の窓)にズームインすることで、彼らは「感染」がいつ広がり始めたのかを正確に特定することができました。
- 影響力のチェック: 彼らはまた、ユーザーがどれほど「人気」があるか、あるいは「つながり」を持っているかもチェックしました。そこで彼らは驚くべき発見をしました。ヘイトスピーチは必ずしも大物セレブリティから来ているわけではないということです。実際、影響力のあるユーザーはすぐにバン(利用停止)されるため、感染は一般の、あまりつながりのないユーザーを通じて広がるのではないかと彼らは推測しました。彼らは2次元レンジツリーという数学的ツールを使用して、ユーザーの投稿が適切な時間に発生したか、そしてそのユーザーの影響力のレベルが特定の範囲に適合しているかをチェックしました。
数字が示すこと
チームはこのテストを、1ヶ月間(2022年2月1日から2022年3月1日まで)に収集された膨大なツイートのデータセットを用いて行いました。彼らはヘイトスピーチを投稿した3,912人のユーザーを調査し、それを7,824人の異なるユーザーによる46,557件のツイートのデータセットとバランスさせました。
実験を行った結果、有望ではあるものの、特定のセットアップに特化した結果が得られました。
- 精度(Accuracy): 彼らの最適なセットアップは、平均精度0.72、平均F1スコア0.84で、正しいヘイトスピーチユーザーを見つけ出しました。
- 速度: 彼らの新しい手法は、従来の「素朴な(naive)」方法よりも圧倒的に高速でした。従来のメソッドが小さなテストで約0.12 × 10⁻²秒かかったのに対し、彼らの新しいメソッドは2.15 × 10⁻⁶秒で完了しました。データが23,800件に増えても、彼らの手法は高速なまま(約2.97 × 10⁻⁶秒)でしたが、従来のメソッドは著しく低速化しました。
- スイートスポット(最適解): 彼らは、ヘイトスピーチの感染が、特定の時間窓**[0, 13](時間)と、影響力のパーセンタイル[0, 17.5]**のユーザーの間で最も顕著に見られることを発見しました。これは、感染が、必ずしも有名ではないものの、特定の危機の中で非常に活動的な小規模なグループから始まることが多いことを示唆しています。
彼らが主張していないこと
この論文が「言っていない」ことも重要です。著者たちは、自分たちがヘイトスピーチを永遠に「解決」したと主張しているのではないことを明確に述べています。彼らは、単純な単語リストだけに頼ったり、文脈を見ずにテキストだけを見たりすることに対して明確に反対しています。また、彼らの手法は、フィルターをかけるための特定の条件(既知のイベント発生時刻など)がある場合に最も効果的に機能することにも注意を払っています。つまり、追加のデータなしに真空状態でヘイトスピーチを見つけ出す魔法の杖ではありません。
総括
感情的な混沌を整理されたデータの形状へと変え、超高速なライブラリを用いてそれらを見つけ出すことで、著者たちは、ヘイトスピーチの「感染」を以前よりも正確に捉えられることを示しました。怒りのスパイクが「いつ」起き、誰がそれを広めているかを観察することで、以前よりもはるかに速く問題の源を特定できることを突き止めたのです。彼らはこれがソーシャルメディア・プラットフォームが即座に対処することを助ける可能性があると示唆していますが、これは最終的な治療薬ではなく、強力な新しい「道具箱の中の道具」であると提示しています。目標は、森全体が燃え上がる前に、その火種を見つけることなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。