Large Language Models are Perplexed by some Political Parties
この論文は、10種類の大型言語モデルと37言語にわたり、モデルが社会民主主義的なテキストと比較して極右やナショナリスト政党のテキストに対して高いパープレキシティを示すことから、政治的な公平性が損なわれていることを明らかにしており、このバイアスはインストラクション・チューニングではなく事前学習に起因するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたは、インターネット上のほぼすべての文章を読み終えた、超スマートなロボットを持っています。あなたは、このロボットを「言語モデル」と呼びます。さて、あなたがこのロボットに、世界中の演説や政党のマニフェスト(政綱)を読ませたとしましょう。
この論文の著者たちは、シンプルな問いを投げかけました。「このロボットは、すべての政党を公平に扱っているのか、それとも密かに『お気に入り』を持っているのか?」
これを知るために、彼らはロボットに意見を求めたりはしませんでした(ロボットは、聞き方次第で異なる答えを言わせることが簡単にできてしまうため、意見を聞くのはトリッキーだからです)。代わりに、彼らは**「パープレキシティ(Perplexity)」**と呼ばれる「驚きメーター」を用いました。
「驚きメーター」の比喩
ロボットを、本を読んでいる人に例えて考えてみましょう。
- もしその人が、完璧に意味が通り、予想通りに展開する文章を読んでいるなら、その人は驚きません。「驚きメーター」は低いままです。
- もしその人が、奇妙だったり、混乱したり、見たこともないような言葉を使った文章を読んでいるなら、その人は非常に驚きます。「驚きメーター」は高くなります。
AIの世界では、**低驚き(低パープレキシティ)**は、ロボットにとってそのテキストが理解しやすく、予測しやすいことを意味します。**高驚き(高パープレキシティ)**は、ロボットにとってそのテキストが難解で、奇妙で、「キャラクターに合わない」ものであることを意味します。
分かったこと
研究者たちは、37の異なる言語のテキストを用いて、10種類の異なるロボット(大規模言語モデル)をテストしました。彼らは、社会主義者からナショナリストまで、さまざまな政治グループの演説を調べました。
ここで大きな発見がありました。ロボットは、特定の政党に対して、他の政党よりも一貫して「驚き」を感じていたのです。
- お気に入りのグループ: ロボットは、社会民主主義政党(中道左派のグループなど)に対して最も驚きませんでした。これらのテキストは、ロボットにとって「普通」であり、理解しやすいものでした。
- 見知らぬグループ: ロボットが最も驚いたのは、極右やナショナリストの政党でした。これらのテキストは、同じ言語で書かれているにもかかわらず、ロボットにとっては「奇妙」または「難解」に感じられました。
それはまるで、ロボットが、中道政治に関する何百万冊もの本を読んだメンタル・ライブラリを持っている一方で、極端なナショナリズムに関する本をほとんど持っていないかのようです。ナショナリストの演説を目にすると、まるでほとんど知らない言語の本を読んでいる時のように、言葉に躓いてしまうのです。
「ベース」対「チューニング済み」のロボット
研究者たちは、このバイアス(偏り)が、ロボットの初期学習(インターネットの読解)によるものなのか、それとも後に人間によって「行儀よく」教えられたものなのか(これは**指示チューニング(Instruction Tuning)**と呼ばれます)も確認しました。
彼らは、このバイアスは、人間にチャットの仕方を教わる前の、生の(raw)状態のロボットにすでに存在していたことを発見しました。
- 比喩: ある学生が、誰もが非常に礼儀正しい近所で育ったと想像してください。たとえ後になって、厳格な教師が「良き市民」になるよう指導したとしても、その学生の自然な本能(この場合は、特定のトピックに対して「違和感」を抱くという自然な本能)は、すでに幼少期からの性格として組み込まれていました。
- 結果: ロボットへの指示を変更しても、バイアスは修正されませんでした。生のロボットであっても、チューニング済みのロボットであっても、「驚きメーター」は同じグループに対して高いままでした。
翻訳との関連性
論文では、これらのロボットが翻訳を行う際に何が起こるかも調査しました。彼らは直接的な関連性を見出しました。
- もしロボットが、ある政党の演説に対して**「驚いて」いれば**(パープレキシティが高ければ)、その演説を他の言語に翻訳する精度は低くなりました。
- もしロボットが、その演説に対して**「慣れて」いれば**(パープレキシティが低ければ)、その演説をうまく翻訳できました。
これは、ロボットの「不公平さ」が、単にチャットの中で何を「言う」かという問題ではなく、そもそもテキストをどれだけ良く「理解」し「処理」できているかという問題であることを示唆しています。
結論
この論文は、これらのAIモデルには、学習データに由来する「政治的な風味」が組み込まれていると結論づけています。彼らは、ある政治的観点(社会民主主義など)には自然に馴染み、別の観点(極右ナショナリズムなど)には自然に苦戦します。
これは、単にロボットに「公平であれ」と後から指示するだけで簡単に修正できるものではありません。バイアスは、家の基礎のように、その構造の奥深くに存在しています。これを修正するには、家を建てる際の材料(学習データ)そのものを変える必要があるのです。
重要な注意点: 研究者たちがテストしたのは、あくまで公式な政治的テキスト(政党プログラムや議会演説など)のみです。ロボットがカジュアルなSNSの投稿や非公式な会話をどのように扱うかについてはテストしていないため、結果が同様になるかどうかは不明です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。