← 最新の論文
💻 computer science

Beyond the pale: Assessing prevalence and contents of extremist speech in LLM training data

本論文は、Dolmaトレーニングコーパスにおける過激な言説の蔓延を調査しており、そこにはヘイトスピーチや暴力の呼びかけを含む文書が数十万件も含まれている可能性が高いことを明らかにし、それによってデータキュレーションとLLMの安全性に対する極めて重要な示唆を提示している。

原著者: Dmitry Nikolaev, Ashley A. Mattheis

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Dmitry Nikolaev, Ashley A. Mattheis

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデルは、質問に答えるチャットボットからコードの記述を支援するシステムに至るまで、今日私たちが使用している多くの人工知能ツールの背後にあるエンジンです。これらの機械は、教室でルールを教わることで学ぶのではなく、代わりにインターネット、書籍、その他のデジタルソースから膨大な量のテキストを読み込むことによって学習します。このプロセスは「トレーニング(学習)」として知られています。モデルが流暢かつ知識豊富になるためには、人間が一生かけて読む量に匹着するほど巨大なテキストのライブラリを消費しなければなりません。研究者たちは、これらのモデルがどのように構築され、初期学習の後に、安全で役立つものにするためにどのように調整されるかに長年焦点を当ててきました。しかし、一つの重要な問いが、ほとんど問われぬまま残されてきました。それは、「そもそもモデルは何を読んでいるのか?」という点です。もしトレーニング用のライブラリに、有害な、あるいは憎悪に満ちた、または危険な思想が含まれているならば、たとえ開発者が後に適切な振る舞いを教えようとしたとしても、モデルはそれらを繰り返してしまう可能性があるのです。これは単なる技術的な不具合ではなく、公衆衛生上の問題です。なぜなら、これらのシステムは子供を含むあらゆる年齢層の人々によってますます利用されており、彼らが警告なしに危険な見解に遭遇する可能性があるからです。

マンチェスター大学の研究チームは、科学界で利用可能な最も重要なオープンソースのテキストコレクションの一つである「Dolma」のトレーニングデータの構成内容を調査することに着手しました。このコレクションは、OLMoと呼ばれる一連の高度な言語モデルの基礎となるものです。研究者たちは、この膨大なライブラリに、暴力、憎悪、または民主的な体制の転覆を助長するテキストである「過激主義的な言説」が含まれているかどうかを知りたいと考えました。これに答えるために、彼らは単に推測したり、単一のコンピュータプログラムに頼ったりしたわけではありません。代わりに、彼らはこれらの文書を見つけ出すための、注意深く多段階的なプロセスを構築しました。まず、彼らはDolmaコレクションから20万個の文書をランダムにサンプリングしました。これは、モデルが学習した3兆語の極めて小さな、しかし統計的に意味のある断片です。次に、彼らはいくつかの異なるコンピュータモデルを使用してこれらの文書をスキャンし、それぞれのモデルに対して、過激主義の特定の定義に一致するテキストを特定するよう指示しました。これらの定義は、英国の政府指針や、テロリズムおよび政治的暴力の研究における学術専門家によるものに基づいています。

このプロセスは、何かを過激主義としてラベル付けする前に非常に慎重であることを目的とした、保守的な設計となりました。彼らは「ユニオン・チェック(結合確認)」と呼ばれる手法を用い、文書が異なる過激主義の定義のいずれかに一致する場合にコンピュータにフラグを立てるよう指示しました。これにより、モデルがタスクを正しく理解していることを確認できました。コンピュータが潜在的な一致をフラグ立てした後、研究者たちはそれらをさらなる精査にかけました。彼らはより強力な人工知能システムを使用して誤検知を排除し、最終的には、過激な言説の研究を専門とする人間の専門家を招き、フラグが立てられたテキストの小さなサンプルを詳細に読ませました。この人間のレビューは極めて重要でした。なぜなら、自然界で見つかるテキストはしばしば乱雑であり、暗号化された言語が含まれていたり、機械が解釈するのが難しい方法で書かれていたりすることがあるからです。専門家は、これらの文書を読み込み、それらが研究者の探していた真に危険なナラティブ(物語)を含んでいるかどうかを確認しました。

この調査の結果は明確であり、かつ懸念すべきものでした。研究者たちは、Dolmaトレーニングコレクションには、過激なコンテンツを含む文書がほぼ確実に数十万件含まれていることを発見しました。彼らの保守的な見積もりに基づくと、ランダムサンプル内の文書のおよそ2,000個に1個が、過激なナラティブやヘイトスピーチを含んでいました。この割合を、数十億の文書からなる全データセットに投影すると、その数字は膨大な有害物質の貯蔵庫を指し示していました。研究では、直接的な暴力の呼びかけ、特定の特定の人種や宗教グループを標的としたヘイトスピーチ、そして民主的な制度を弱体化させようとするナラティブなど、さまざまな種類の危険なコンテンツが特定されました。興味深いことに、研究者たちは、データを検索するために使用された過激主義の特定の定義によって、結果が変わることを発見しました。例えば、「内集団(イングループ)」と「外集団(アウトグループ)」の間の対立に焦点を当てた定義は、非常に広い網を広げ、政治的な意味での過激主義ではないものの、憎悪に満ちた多くのテキストを捉えました。一方で、公式の政府基準に基づく定義は、より精密ではありましたが、それでも依然としてかなりの量の有害な資料を特定しました。

驚くべき発見は、サンプルにおける特定の種類の過激主義の欠如でした。インターネットのグローバルな性質にもかかわらず、研究者たちはサンプルの中にジハード主義テロリズムに関連するテキストをほとんど見つけられず、そのような出来事に関するニュース記事はわずか1件だけでした。これは、テロ組織に関する厳格な規制や企業のポリシーが、これらのモデルに供給される公開データセットから、この特定の種類のコンテンツを正常に除去した可能性を示唆しています。しかし、研究では、右派の過激主義的なナラティブがはるかに蔓延しており、政治的なブログ、フォーラムのコメント、陰謀論などの形で頻繁に現れていることが判明しました。また、研究者たちは、彼らが見つけたコンテンツの多くが「境界線上(ボーダーライン)」のものであることにも注目しました。つまり、非常に偏っており、暴力的であったり憎悪に満ちていたりするものの、必ずしも過激主義の厳密な法的定義に合致しないテキストです。このグレーゾーンは特に危険です。なぜなら、フィルタリングすることが難しく、それでいてモデルがそれらの極端な見解を常態化させる可能性があるからです。

これらの発見が持つ意味は、モデルがどのように構築されるかという技術的な詳細を超えています。研究者たちは、モデルがすでにこのデータから学習してしまった後に、モデルを修正しようとするだけでは問題は解決できないと主張しています。もしモデルが、暴力を呼びかけたり憎悪を助長したりする数千の文書を記憶してしまっているならば、追加の安全性トレーニングを行っても、それらのパターンを「学習解除」することは困難かもしれません。この研究は、トレーニングデータの構成が、これらを構築する人々にとって緊急の注意を要する根本的な問題であることを強調しています。製品がリリースされた後の挙動に焦点を当てるだけでは不十分です。最終製品の安全性は、初期学習フェーズにおいて何が投入されたかに大きく依存しているのです。研究者たちは、人工知能のトレーニングライブラリにどのような種類のコンテンツを含めることが許容されるのか、特にそれらのライブラリが日常的に一般の人々と対話するツールを作成するために使用される場合には、より広範な議論が必要であると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →