← 最新の論文
💻 computer science

CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection

本論文は、適応的アライメント、時間的依存関係のための対照学習、およびVLM由来の根拠(ラショナール)を用いて動画を微細なシーケンスとしてモデル化することで、ヘイト動画検出を強化する新しいクリップレベルのマルチモーダルフレームワークであるCLARAを提案し、複数のデータセットにおいて最先端の性能を達成している。

原著者: Yuchen Zhang, Shuang Dai, Zeyu Fu, Yunfei Long, Ravi Shekhar, Haralambos Mouratidis

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Yuchen Zhang, Shuang Dai, Zeyu Fu, Yunfei Long, Ravi Shekhar, Haralambos Mouratidis

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

数十億人の人々の画面上で、新しい種類の対話が行われています。それは、ジョークやニュースのクリップ、あるいは個人のVlogが、一瞬にして無害なものから有害なものへと変貌しうる、動画プラットフォームの急速にスクロールされるストリームの中で起きています。言葉に意味が固定されているテキストの投稿とは異なり、動画は音、動く画像、そして話し言葉という複雑なレイヤーを伴っています。危険は、これらの要素がいかに相互作用するかという点にあります。憎悪に満ちたメッセージは、単一の文章の中で叫ばれるとは限りません。むしろ、フレームの連なり、声のトーンの変化、あるいは前の文脈があって初めて意味を成す視覚的な合図を通じて、徐々に構築されていくことがあります。このようなコンテンツを検知することは、インターネットにとって大きな課題です。なぜなら、最も危険なシグナルは、しばしば短く、隠されており、それが出現する特定の瞬間に依存しているからです。

長年、コンピュータ科学者たちは、機械にこのような害を特定する方法を教えようとしてきました。初期の試みはテキストに焦り、特定の怒りの言葉を探すことに焦点を当てていました。その後、彼らは画像やミームへと移行し、画像とキャプションがどのように組み合わさって機能するかを理解しようとしました。しかし、動画は特有の問題を提示します。動画は単なる画像の集合体でも、音声の書き起こしでもありません。それは、意味が時間の経過とともに変化する、流れるタイムラインなのです。もしコンピュータが動画全体を一塊のブロックとして捉えたら、憎悪が実際に起きている小さく決定的な瞬間を見逃してしまうことがよくあります。それは、物語を最初と最後の文章だけで理解しようとするようなものです。その中にある極めて重要なプロットの要点は、要約の中に失われてしまいます。

イギリスのエセックス大学とエクセター大学の研究チームは、この問題を解決するための新しい方法を提案しました。彼らはそのシステムをCLARAと呼んでいます。動画を一つの大きく不変なオブジェクトとして扱うのではなく、CLARAはそれを小さく意味のある断片へと分解します。動画を長い一文だと想像してください。CLARAはそのすべてを一度に読むのではありません。代わりに、話し言葉の自然な区切りごとに一時停止し、語られている内容と一致する一連の短いクリップを作成します。これらの小さなセグメントに焦点を当てることで、たとえそのアイデアが1分間のニュートラルなコンテンツの中に埋もれていたとしても、憎悪的な考えが導入される束の間の瞬間を捉えることができるのです。

研究者たちは、憎悪に満ちた動画が、さまざまな手がかりの組み合わせに依存していることを発見しました。話し手が、不穏な画像を見せながら穏やかな声を使ったり、背景音楽が攻撃的になる中でニュートラルなフレーズを使ったりすることがあります。これに対処するため、CLARAは、それぞれの短いクリップに対してどの手がかりが最も重要であるかを判断する、柔軟なシステムを使用しています。テキストが鍵となることもあれば、音や視覚的なシーンが鍵となることもあります。システムは動画全体に対して単一のルールを強制することはありません。代わりに、動画が進むにつれて異なる種類の情報を異なる重みで評価し、適応していきます。これにより、静的なパターンを探すだけでなく、憎悪のメッセージがいかに進化していくかを見ることができるのです。

システムがより大きな全体像を理解できるようにするために、研究者たちは第二の知能レイヤーを追加しました。彼らは、画像とテキストを記述し、それらについて推論するように訓練された強力な人工知能ツールを使用して、動画の意図に関する高レベルの要約を生成しました。この要約はガイドとして機能し、システムが小さなクリップがどのように組み合わさって、より大きな、潜在的に有害なナラティブ(物語)を形成しているのかを理解する助けとなります。システムは、これらの詳細なクリップレベルの観察結果を、高レベルの要約と組み合わせることで、動画の内容の完全な姿を作り上げます。このアプローチにより、システムは単に孤立した瞬間を見るだけでなく、議論や物語が展開される流れを理解することができるようになります。

チームはこの新しい手法を、世界中のさまざまなソーシャルメディアプラットフォームから抽出された、3つの異なる憎悪動画のコレクションを用いてテストしました。結果は明白でした。新しいシステムは、既存の最良の手法を一貫して上回りました。無害なものを誤ってフラグ立てすることなく、憎悪に満ちた動画を正しく識別することに長けていたのです。研究者たちはまた、システムの構成要素を取り除いたらどうなるかを調べるためにテストを行いました。動画をクリップに分割する能力を取り除いたり、高レベルのガイダンスを取り除いたりすると、システムのパフォーマンスが低下しました。これは、彼らの設計のあらゆる部分が必要であったことを裏付けています。全体的な文脈に目を配りながら、小さく特定の瞬間に集中する能力こそが、成功の鍵でした。

この研究は、有害なコンテンツを検知する未来は、このような詳細で、時間を意識した分析にあることを示唆しています。人間が実際に動画を体験する方法――一つずつ、瞬間ごとに――を尊重することで、機械はようやく、憎悪の言説の微妙で進化し続ける性質を見抜くことができるようになるのです。研究者たちは、オンライン上の憎悪の問題を永遠に解決したと主張しているわけではありませんが、そのための著しく鋭い道具を提供しました。彼らの研究は、動画における危険を理解するためには、単に全体像を見るだけでは不十分であり、物語が展開していく様子を、一つひとつの小さなクリップを通じて見守らなければならないということを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →