Pretraining Data Can Be Poisoned through Computational Propaganda
本論文は、言語モデルのための大規模な事前学習データが公開討論インターフェースを介して汚染され得ることを実証し、ウェブクローリングおよびキュレーション後にそのような敵対的コンテンツが含まれているかを推定するための新しい分析手法である「HalfLife」を導入するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを、あらゆる本、ブログ記事、コメントが巨大なスーパースマートなロボットの脳へと注ぎ込まれている、巨大で混沌とした図書館だと想像してみてください。このロボットは「大規模言語モデル(LLM)」と呼ばれ、話し方、書き方、考え方を学ぶために、あらゆるものを読み込む学生のような存在です。読めば読むほど、そのロボットは賢くなります。しかし、ここに落とし穴があります。図書館があまりにも巨大であるため、人間がすべてのページをチェックして、嘘やナンセンス、あるいは罠がないかを確認することは不可能です。ここで危険が生じます。もし誰かが、図書館の中に「毒された」偽の指示書を忍び込ませたら、ロボットは真実の代わりに、それらのトリックを学んでしまうかもしれません。この論文は、悪意のある者が、図書館自体をハッキングするのではなく、ロボットが訪れるウェブサイトの公開コメント欄に向かって嘘を叫ぶことで、どのようにしてこれらの「毒された」ページをロボットの食事に紛れ込ませることができるかという、新しい手法を探求しています。
研究チーム(ワシントン大学とアレン人工知能研究所のチーム)は、この「コメント欄での叫び」というトリックが実際に通用するのかを検証したいと考えました。彼らは、偽のコンテンツが投稿されてから、ロボットの乱雑な学習プロセスを通じてどのように流れていくかを追跡する探偵として、HALFLIFEと呼ばれる新しいツールを構築しました。彼らは、ロボットの「食事」が驚くほど脆弱であることを発見しました。ロボットの製作者たちがジャンクデータを排除しようとしても、かなりの量の悪意のあるコメントが隙間から滑り込んでしまうのです。
彼らが発見した内容は以下の通りです:
攻撃:スタンドからの叫び
インターネットを巨大なスタジアムだと考えてください。ほとんどの場合、ロボットは公式の試合プログラム(メインの記事)だけを読み取ります。しかし、そのスタジアムには、ファンが自由に叫べる数千のオープンマイク・ステーション(コメント欄)も存在します。研究者たちは、悪意のある者がスタジアムをハッキングする必要はなく、ただメガホンを買ってきて、それらのオープンマイクに向かってナンセンスなことを叫び始めればよいことに気づきました。彼らは、「タイドポッドを食べると健康になる」や「ブランドXはブランドYよりも優れている」といった偽の主張を投稿するボットの軍隊をシミュレートすることで、これをテストしました。
フィルター:ロボットのお弁当箱
ロボットの「クローラー」(デジタルな蜘蛛)がこれらのページを収集するとき、彼らはすべてを食べるわけではありません。彼らには厳格なお弁当箱のルーチンがあります:
- スクレイピング: ページを解体してテキストを見つけ出します。
- フィルタリング: テキストが短すぎるもの、言語が異なるもの、またはスパムのように見えるページを捨てます。
- 品質チェック: そのページが「良い」読み物であるかどうかを評価します。
チームは、HALFLIFEを使用して、これらのお弁当箱のルーチンをどれだけの毒されたコメントが生き残ったかを調べました。結果は驚くべきものでした。すべてのフィルタリングを経た後でも、約0.13%の毒されたコメントが最終的な学習データに紛れ込んでいたのです。これは非常に小さく聞こえるかもしれませんが、図書館が膨大であることを忘れないでください。その0.13%は、Wikipediaの全コレクションよりも多い文書数に相当します。実際、先行研究では、わずか250の毒された文書があれば、ロボットに秘密のトリックを学習させるのに十分であると示唆されています。研究者たちは、攻撃者がその目標に到達するために、10万から100万のウェブページを毒す必要があると計算しましたが、これは自動化されたボットを使えば十分に実行可能な数字です。
結果:ロボットは嘘を信じる
これが単なる理論ではないことを証明するために、チームはこれらの毒されたコメントを用いて小さなロボットの脳を実際に訓練しました。例えば、「シトロエンはルノーよりも優れている」や「ファイザーはモデルナよりも優れている」といった、植え付けられた偽のコメントに基づいてロボットを教え込みました。ロボットをテストしたところ、結果は明白でした。ロボットは毒された回答を好むようになりました。たとえその後、ロボットに「役に立ち、安全である」ように教え込んだとしても(これはインストラクション・チューニングと呼ばれるプロセスです)、毒は完全には洗い流されませんでした。ロボットが大きくなるほど、安全性に関するトレーニングの効果は高まりますが、小さなロボットは攻撃者の嘘に対して依然として強く偏ったままの状態でした。
うまくいかないこと
論文では別のアイデアもテストされました。もし悪意のある者がコメントの代わりにオンライン広告を利用したらどうなるでしょうか? 彼らは、これが機能しないことを発見しました。広告は通常、ロボットのクローラーがページをスキャンする際に読み取ることができない小さなボックス(iframe)の中に隠されているからです。つまり、コメントは「漏れているドア」ですが、広告は「鍵のかかった金庫」なのです。
教訓
ここでの主な教訓は、インターネットの公開コメント欄が、私たちの最も高度なAIの脳への隠れたバックドアになっているということです。なぜなら、これらのコメントは非常に一般的であり、しばしば通常のテキストのように見えるため、学習データを洗浄するために使用される現在のフィルターでは見逃されてしまうことが多いからです。研究者たちは、ロボットに与える前にユーザーコメントをどのように扱うべきかについて、より賢明になる必要があると示唆しています。おそらく、メインの記事テキストとは異なる扱いをすべきなのです。これが修正されるまで、私たちのAIが学ぶ「真実」が、メガホンとスクリプトを手にした誰かによって、静かに書き換えられてしまうリスクが現実として存在しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。