← 最新の論文
💬 NLP

Who Decides What Is Harmful? Content Moderation Policy Through A Multi-Agent Personalised Inference Framework

本論文は、専門エージェントを通じて個々のユーザーの感受性をシミュレートすることでコンテンツモデレーションを個人化するLLMベースのマルチエージェントフレームワークを提案し、従来の中央集権型システムに対して32%の精度向上を達成するとともに、プラットフォーム・ガバナンスとユーザーの自律性のバランスを取るスケーラブルなアプローチを提供する。

原著者: Ewelina Gajewska, Michal Wawer, Katarzyna Budzynska, Jaroslaw A. Chudziak

公開日 2026-05-06
📖 1 分で読めます☕ さくっと読める

原著者: Ewelina Gajewska, Michal Wawer, Katarzyna Budzynska, Jaroslaw A. Chudziak

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

インターネットを、数百万の人々が同時に叫び、物語を共有し、議論し、ミームを投稿している、巨大で混沌とした広場だと想像してみてください。現在、この広場を安全に保とうとしている「警備員」(コンテンツモデレーションシステム)は、全員に対して単一の巨大なルールブックを使用しています。彼らは「有害」かどうかを、万人に通用するリストに基づいて判断します。投稿がルールに違反すれば削除され、違反しなければ残ります。

この論文の著者が指摘する問題は、人々はそれぞれ異なるということです。ある人が面白いと感じるものが、別の人には深く傷つくものになることがあります。ある人が勇気ある政治的意見と見るものが、別の人には個人的な攻撃に見えることもあります。現在のシステムはこれらの個人の感情を無視しており、しばしば人々を自分が有毒だと感じるコンテンツに圧倒させたり、逆に自分が実際には楽しんでいるものを削除させたりしています。

この論文は、警備所を運営する新しい方法を提案しています。単一の硬直したルールブックの代わりに、PRISMと呼ばれるパーソナライズされたチームベースのアプローチを提案しています。

中核となるアイデア:パーソナライズされた警備チーム

PRISM システムを単一のロボットではなく、すべてのユーザーに割り当てられたカスタマイズされた警備チームだと考えてください。このチームがどのように機能するかを、簡単な比喩を使って説明します。

1. 「感受性プロファイル」(あなたの個人的なルールブック)
白紙の状態から始めるのではなく、システムはあなたの特定の「痛みのポイント」を学習します。

  • 比喩: あなたは大きな音に非常に敏感ですが、散らかった部屋は気にしないだとします。一方、あなたの隣人は散らかりを嫌いますが、大きな音楽を好みます。PRISM システムは、あなた固有の閾値を学習します。それは「このユーザーは侮辱に容易に動揺するが、強い政治的議論には平気である」というプロファイルを作成します。
  • 仕組み: システムと対話するにつれて(「この投稿は好きではない」「これは問題ない」と伝えるなど)、プロファイルが更新されます。それは一般的なアルゴリズムがあなたが有害だと考えるべきだと考えるものではなく、あなたが実際に何を有害だと感じるかを正確に学習します。

2. 「マネージャーエージェント」(チームリーダー)
新しい投稿が届くと、中央の「マネージャー」がその投稿とあなたのプロファイルを確認します。

  • 比喩: マネージャーはオーケストラの指揮者のようなものです。投稿を見て、「この投稿には攻撃的な言葉が含まれており、特定のグループに言及している。オーケストラ全体を呼ぶ必要はない。『社会学者』(集団力学に詳しい)と『心理学者』(感情的影響に詳しい)だけを呼ぼう」と言います。
  • ひねり: マネージャーはまた、専門家にあなたの特定の好みをささやきます。彼らは心理学者に、「覚えておいて、このユーザーは人間性を否定する言葉に非常に敏感なので、それを特に探してください」と伝えます。

3. 「専門家エージェント」(スペシャリスト)
システムは、異なる角度からコンテンツを分析するために、さまざまな AI「専門家」を使用します。

  • 社会学者: 差別や集団への不公平な扱いを探します。
  • 言語学者: 失礼な言葉、侮辱、または攻撃的なトーンを探します。
  • 心理学者: 脅迫や感情的苦痛を引き起こす可能性のあるものを探します。
  • 「ゴースト」エージェント: これはあなたと全く同じように行動する特別なエージェントです。専門家たちが意見が割れた場合、ゴーストエージェントが介入して、「このユーザーが以前私たちに伝えたところによると、彼ら自身はこれを有害だと感じるだろう」と言います。

4. 「統合エージェント」(決定者)
最後に、統合エージェントは専門家とゴーストからのすべての意見を収集します。それらの論拠をあなたの個人的なプロファイルと比較衡量し、「このユーザーに表示する」または「隠す」という最終決定を下します。

彼らは何を見つけましたか?

研究者たちは、このシステムを従来の「万人に通用する」方法と、現在使用されている最も賢明な標準 AI モデルのいくつかに対してテストしました。

  • より高い精度: 彼らのパーソナライズされたチームは、標準的な一般的なシステムと比較して、特定のユーザーが何を有害だと感じるかを予測する精度が32% 向上しました。
  • 誤りの減少: 単一の AI がすべてを一人でやろうとするよりも、マルチエージェントチームの方が誤りを少なくしました。問題を小さなタスクに分解すること(侮辱の専門家と脅迫の専門家を持つなど)によって、両者を混同することを回避しました。
  • 高速学習: システムが学習するのに数年はかかりませんでした。ユーザーがわずか数回のフィードバックを提供しただけで、システムは一般的なバージョンよりもはるかに効果的に機能し始めました。あなたの「好み」を把握するのに時間はかかりませんでした。

全体像:誰が決めるのか?

この論文は、大きな問いを投げかけます:「何が有害かを誰が決めるのか?」

現在、答えは「プラットフォーム」です。彼らが全員のために決めます。
PRISM システムは、答えは**「スマートなチームの助けを借りたユーザー」**であるべきだと提案しています。

著者らは、プラットフォームが暴力の防止など基本的な安全を保つ必要がある一方で、「特定の個人にとって『行き過ぎ』であるか」についての日常的な決定は、その個人に委ねられるべきだと主張しています。このシステムは、全員を同じ硬直したルールの下に暮らすことを強いるのではなく、ユーザーが独自の精神的な健康に合った「フィルター」を持つことを可能にします。

要約すると: 警備員が群衆全体に向かって「誰もそれを言ってはいけない!」と叫ぶ代わりに、PRISM は一人ひとりに、彼らが何を処理でき、何を処理できないかを正確に知っている個人的なボディガードを与え、誰もが自分なりの方法で安全を感じられるようにします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →