Unsupervised Anomaly Detection of Information Operations Users via Behavioral and Language Patterns
本論文は、時間的ポイントプロセスを通じて協調的な時間的行動をモデル化し、さらに大規模言語モデルによるテキスト内容の分析から得られる定量的スコアを用いてそれらの信号を精緻化することで、情報工作ユーザーを検出する新しい教師なしフレームワークであるTENSORを紹介し、実世界のデータセットにおいて既存の手法を凌駕するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを、何百万人もの人々がチャットをし、ニュースを共有し、政治について議論している、巨大で賑やかな町の広場だと想像してみてください。通常、ほとんどの人々は、ただ自分の生活を送っている「普通の市民(コントロール・ユーザー)」です。しかし時折、少数の秘密主義的なグループ(「情報工作(IO)ユーザー」と呼ばれる)が、その広場に姿を現します。彼らはチャットをしに来たのではありません。彼らは会話を操作し、嘘を広め、混乱を巻き起こすためにやってきたのです。しかも、彼らはしばに、よく練習された合唱団のように連携して動きます。
問題は、これらの操作者たちが非常に巧妙に隠れることです。彼らは普通の人間のように見せかけようとしますが、彼らには特有の「リズム」と「話し方」があり、それが彼らを見破る手がかりとなります。
旧来の手法(そしてなぜ失敗したのか)
以前、探偵たちはこれら操作者を見つけ出すために、2つの方法を試みました。
- 「リストを探す」方法(教師あり学習): 彼らは既知の悪質なアクターのリストを用いてコンピュータを訓練しました。しかし、悪質なアクターが戦術を変えると(彼らは非常に素早く変えます)、コンピュータは混乱し、新しい手口を見抜くことができなくなりました。
- 「共に動く」方法(教師なしクラスタリング): 彼らは、悪質なアクターは常にマーチングバンドのように完璧な調和の中で行動すると仮定しました。もし2人が全く同じ内容を、全く同じタイミングで投稿した場合、フラグが立てられました。しかし実際には、悪質なアクターはもっと賢く、常に足並みを揃って行進するわけではないため、この方法では多くの彼らを見逃してしまいました。
新しい解決策:TENSOR
論文の著者たちは、TENSORと呼ばれる新しい探偵ツールを構築しました。TENSORは、**「いつ」人が投稿するかと、「何を」**話しているかという2つの要素を同時に監視する、2部構成のセキュリティシステムだと考えてください。
パート1:リズムの監視員(時間的点過程)
人々の動きの「タイミング」に執着している、町の広場の警備員を想像してください。
- 普通の市民は、ランダムなタイミングで投稿します。例えば、午前中だったり、ランチタイムだったり、深夜だったりします。彼らのリズムは乱雑で自然です。
- 悪質なアクターは、しばしば奇妙で、調整されたリズムを持っています。彼らは投稿が速すぎたり、あるいはスクリプトに従っているために、全員が全く同じ瞬間に投稿したりすることがあります。
TENSORは、**時間的点過程(Temporal Point Process)**と呼ばれる数学的ツールを使用して、広場の「鼓動」を学習します。それは、正常なリズムがどのようなものであるかを学習します。もし、あまりにも完璧すぎる、あるいは奇妙すぎるリズムが見られた場合、アラームが鳴ります。
落とし穴: この警備員には問題があります。訓練データ(警備員が研究した人々のリスト)が「汚染」されているのです。これは、警備員に「正常」とは何かを教えようとしているのに、そのクラスの中に、普通のふりをしている悪質なアクターが混じっているようなものです。警備員は、誤って悪質なアクターの奇妙なリズムを「正常」として学習してしまう可能性があります。
パート2:言語の探偵(LLM)
この警備員のミスを修正するために、TENSORは第二の専門家、**大規模言語モデル(LLM)**を投入します。これは、何百万冊もの本を読み、人間の真の言葉とロボットのような台本の違いを知り尽くした、超スマートな文芸批評家のようなものです。
LLMは、人々が投稿する実際の「言葉」を読みます。単にタイミングを見るだけでなく、スタイル(様式)を見ます。
- この人は、猫や仕事、政治について話していますか?(おそらくコントロール・ユーザーです)。
- この人は、特定の政治的トピックについてのみ話し、奇妙で反復的なフレーズを使い、それ以外のすべてを無視していますか?(おそらくIOユーザーです)。
統合: 「エビデンス関数」
これが魔法のレシピです。TENSORは単に2人の専門家に投票させるのではなく、**「エビデンス関数(Evidence Function)」**と呼ばれる特別な数式を使用して、彼らの意見を組み合わせます。
- リズムの監視員は、「この人のタイミングは怪しい」と言います。
- 言語の探偵は、「この人の言葉は台本のようだ」と言います。
- エビデンス関数は、言語の探偵の意見を取り入れ、リズムの監視員を「修正」します。
もし、訓練データの中に悪質なアクターが含まれていたためにリズムの監視員が混乱していたとしても、言語の探偵が介入してこう言います。「待ってください、言葉を見てください。これは間違いなく悪質なアクターです。たとえタイミングが少し正常に見えたとしてもです」。これにより、訓練データが「汚れて」いたとしても、TENSORは悪質なアクターを特定できるのです。
研究結果
研究者たちは、5つの異なる国(エジプト、中国、イラン、ロシア、UAE)の実世界のデータを用いてTENSORをテストしました。彼らはTENSORを他の手法と比較し、以下のことを発見しました。
- TENSORが最強であった: TENSORは、従来の手法よりも多くの悪質なアクターを捕らえ、ミスも少なく抑えました。
- 両方の要素が必要である: もし「言語の探偵(LLM)」または「リズムの監視員(タイミング分析)」のどちらかを取り除くと、システムは大幅に性能が低下しました。機能するためには、タイミング(いつ)と内容(何を)の両方が必要なのです。
- 異なる「脳」でも機能する: 彼らはTENSORを異なるAIモデル(異なるタイプの「言語の探偵」)でテストしましたが、ほとんどのモデルで良好に動作しました。
結論
TENSORは、あらかじめ用意された「誰が悪いか」のリストを必要とせずに、インターネット上の操作者を見つけ出す新しい方法です。それは、悪質なアクターが奇妙な「ダンス(タイミング)」と偽りの「声(言語)」を持っていることに気づくことで機能します。AIを使って「声」を確認し、「ダンス」の分析を修正することで、たとえ彼らが群衆の中に紛れ込もうとしても、操作者を見つけ出すことができるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。