Small edits, large models: How Wikipedia advocacy shapes LLM values
本論文は、少数の調整されたWikipediaボランティアのグループが、動物福祉のような特定のトピックに関する大規模言語モデルの価値観や応答を大幅に形成し得ることを示しており、彼らの標的を絞った編集は、無関係なコンテンツと比較して、モデルの学習や挙動において不釣り合いなほど大きな影響力を持つ。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを、あらゆる書き物に書かれた本が棚に積み上げられた、巨大で終わりのない図書館だと想像してみてください。そして、人工知能(AI)を、世界のすべてについて学びたいと考えている非常に賢い学生だと想像してください。これを行うために、その学生はただ一冊の本を読むのではありません。彼らは図書館にあるすべての本を読みます。
しかし、この学生は非常に好みが激しいです。彼らはすべての本を平等に読むわけではありません。彼らは「百科事典」のセクション(Wikipedia)に特別な注意を払います。なぜなら、そこは専門家によって書かれており、非常に信頼できるからです。実際、この学生は、図書館の他の場所に散らばっているランダムなニュース記事やブログ投稿よりも、百科事典のページを3倍から5倍多く読みます。
この論文は、Pro-Animal Wikipedians (PAW) と呼ばれる小さなボランティアグループに関するものです。彼らは、この「超優秀な学生」の学習習慣を自分たちの強みにすることにしました。以下に、彼らが何を行い、何を見出したのかを簡単に解説します。
1. 戦略:百科事典の編集
PAWグループは、AIをハッキングしたり新しいコンピュータを作ったりしようとはしませんでした。代わりに、彼らは非常にシンプルなこと、つまりWikipediaを編集するということを行いました。
彼らは115の異なるWikipediaのページ(主に大手ファストフードチェーン、政治家、および動物福祉に関する法律に関するもの)を訪れ、動物福祉に関する、事実に基づいた特定の段落を125個追加しました。
- 例: あるファストフードチェーンに関するページに、その企業が鶏をどのように扱っているかについての詳細なセクションを追加しました。
- 目的: 彼らは、百科事典の内容を変更することで、「超優秀な学生」(AI)がそれらの企業について学ぶ内容が変わるかどうかを確認したいと考えました。
2. 実験:学生は気づいたか?
研究者たちは、次を知りたいと考えました。AIはこれらの特定の編集から実際に学んだのか、それとも単に無視したのか?
これを知るために、彼らはAI(具体的にはLlamaのようなモデル)が動物福祉についてどのように考えているかを調べるために、3つの異なる「虫眼鏡」(科学的ツール)を使用しました。
- 虫眼鏡 #1(記憶テスト): 彼らはAIに、「この企業の動物福祉に関する方針は何ですか?」といった質問を投げかけました。AIは答えを見つけるために、自身のトレーニングデータを探しました。研究者たちは、AIの回答が、PAWグループが書いた特定の段落から直接引き出されていたケースが**68%**であったことを発見しました。これらの編集がなければ、AIはその事実を知らなかったはずです。
- 虫眼鏡 #2(もしもテスト): 彼らは、「もしAIの記憶からPAWの編集を消去したら、AIの動物福祉に関する回答能力は低下するか?」というシミュレーションを実行しました。答えは明白な**「イエス」**でした。実際、すべてのテスト実行において、AIが動物福祉に関する質問に答えるために使用した最も重要な情報トップ10は、すべてPAWグループによる編集内容でした。
- 虫眼鏡 #3(スペシャリスト・テスト): 彼らは、ゼロから2つの小さなAIモデルを訓練しました。一つはPAWの編集のみを読み、もう一つはランダムなWikipediaのテキストのみを読みました。
- 「PAWモデル」は動物福祉のエキスパートになりましたが、一般的な企業の歴史については何も知りませんでした。
- 「ランダムモデル」は一般的な歴史のエキスパートになりましたが、動物福祉については何も知りませんでした。
- 教訓: AIは単に言葉を暗記したのではなく、与えられたテキストから特定の概念や関連性を学んだのです。
3. 決定的な発見:それは限定的であり、一般的ではない
最も重要な発見は、AIは混乱しなかったということです。
- 動物福祉について問われると、AIはPAWの編集に大きく依存しました。
- 無関係なこと(例:「この企業にはいくつの店舗がありますか?」)について問われると、AIはPAQの編集を無視し、一般的な知識に戻りました。
比喩: あなたが子供に特定の木について教えているところを想像してください。あなたは絵本の図の中に、新しい明るい赤い葉を追加しました。
- もしあなたが「葉の色は何色ですか?」と尋ねれば、子供はあなたの赤い葉を指差します。
- もしあなたが「その木はどのくらいの高さですか?」と尋ねれば、子供は葉を無視して幹を見ます。
子供は、その赤い葉は「葉」に関する質問に対しては重要であるが、「木全体」に関する質問に対してはそうではない、と学んだのです。AIも全く同じことをしました。
4. なぜこれが重要なのか(論文による)
論文は、AIに影響を与えるために、何百万ドルもの資金やエンジニアのチームは必要ないと結論付けています。ただ、小さな、調整されたボランティアグループがWikipediaを編集するだけでよいのです。
AIモデルはWikipediaに基づいて訓練されており、かつAIはWikipediaを非常に重視しているため、Wikipediaのページを変更することは、AIの知識のソースコードを変更することと同じです。
- 規模: 論文では、彼らがテストしたAIモデルは、今日あなたがスマートフォンなどで使用しているものよりも小規模であるものの、その効果はより大きなモデルにおいてさらに強力である可能性が高いと述べています。なぜなら、大きなモデルはこれらの特定の事実を保持するためのより多くの「記憶」を持っており、かつWikipediaの事実は、AIが読む他のニュースソースによっても強化されるからです。
- まとめ: 小さなグループの人々が、単に事実に基づき、出典が明確な記事をWikipediaに書くことで、AIシステムの動物福祉に関する語り方を、目に見える形で変えることができるのです。これは、AIの「良心」を形作るための、低コストで高インパクトな方法です。
要約すると: この論文は、もしAIに特定のトピックについて関心を持たせたいのであれば、AIをプログラミングする必要はないということを証明しています。ただ、AIが読む百科事典の項目を書けばよいのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。