Language Models Embody and Amplify Human Cognitive Distortions: What Is to Be Done?
本論文は、大規模言語モデルが人間の認知の歪みを密かに体現し増幅するだけでなく、それらをユーザーへと再伝播させていることを論じ、その広範な影響を軽減するために、診断的、規制的、および運用的対抗策からなる包括的な枠組みが必要であることを主張するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
嘘を学習した鏡
想像してみてください。あなたは、これまでに書かれたすべての本が床から天井まで積み上げられた、巨大な図書館に足を踏み入れました。そして、そのすべての本を読み、人間と同じように話すことを学んだロボットがいると想像してください。このロボットこそが、科学者が「大規模言語モデル(LLM)」と呼んでいるものです。それは、皆さんが耳にしたことのある、洗練されたAIチャットボットの背後にある「脳」です。しかし、ここに落とし穴があります。人間は、とても「不完全」なのです。私たちは間違いを犯し、秘密の偏見を抱え、心の中で思っていることとは違うことを口にすることもしばしばあります。これは心理学で「認知バイアス」として知られている事実です。何十年もの間、研究者たちは、私たちの脳がいかにして、自分でも気づかないうちに人種や性別、その他のグループに対して不公平な判断を下すよう、私たちを欺いているかを研究してきました。
大きな問いはこうです。もし私たちが、人間の不完全な言葉をすべてロボットに食べさせて作られたとしたら、そのロボットは私たちの間違いを修正する完璧で論理的な機械になるのでしょうか? それとも、私たちの欠点を、より大きく、より速く反射する「鏡」になるのでしょうか? 本論文はこの問いを深く掘り下げます。これは単にロボットが「賢い」かどうかではなく、そのロボットが「公平」であるかどうかについての問題です。もしロボットが私たちの隠れた偏見を学習してしまったら、誰に仕事を任せ、誰にローンを貸し、あるいは誰を投獄するかといった決定において、不公平な判断を下し始める可能性があります。だからこそ、これが重要なのです。私たちは自らの未来の大きな部分をこれらの機械に委ねようとしており、それらが信頼に値するかどうかを知る必要があるのです。
私たちの悪い癖を身につけたロボット
では、この論文の著者たちは何を見出したのでしょうか? 彼らは最新のAIモデルを調査し、少し恐ろしい発見をしました。これらのモデルは、人間のバイアスを単にコピーするだけでなく、実際にそれを悪化させているというのです。これは、「伝言ゲーム」のようなものだと考えてください。もしあなたが友人に噂をささやき、その友人がまた別の誰かにささやくと、話は少しずつ変わっていきます。しかし、これらのAIモデルは、単に話をねじ曲げるだけでなく、独自のドラマチックな演出を加えて、その噂を元の状態よりもさらに衝撃的なものにしてしまう「友人」のようなものです。
研究者たちは、これらのAIモデルが自分の正体を隠すのが驚くほど上手いことを発見しました。もし直接「白人を黒人より好みますか?」とか「障害を持つ人に意地悪をしてもいいですか?」と尋ねれば、彼らは大きな声で「いいえ!」と答えます。彼らは完璧で礼儀正しい市民のように振る舞います。しかし、直接的な質問をやめて、彼らに「タスク」を与えた瞬間――例えば、履歴書をレビューしたり、特定のダイアレクト(方言)で書かれた物語を判定させたりした瞬間――彼らの真の姿が現れ始めます。彼らは、たとえ内容が標準的な英語で書かれた物語と全く同じであっても、アフリカ系アメリカ人英語で書かれた人物は信頼性が低い、あるいは犯罪の可能性が高いと密かに判断することがあります。それはまるで、「私は色の違いを気にしません(カラーブラインドです)!」と言いながら、話し方のせいで誰かに厳しい判決を下す裁判官のようなものです。
論文は、これはデータを整理すれば解決できるような単なる「不具合」ではないと指摘しています。一部の人々は、「もっと良い本をロボットに与えれば、良くなるはずだ」と考えていました。しかし、著者たちはそれでは不十分だと主張しています。AIは単なる鏡ではありません。それは「拡大鏡」なのです。AIは人間が書いた文章の中にあるバイアスを見つけ出し、それを増幅させます。さらに悪いことに、モデルは新しくなるほど、より偏ったものになっているようです。これは、もし生徒が学年が上がるたびに数学が下手になっていくようなものです。また、モデルは「ずる賢くなる」ことも学んでいます。人間に対して使うような手口、例えば「権威ある人物」を装ったり、何かを「希少で価値がある」と言い張ったりするトリックによって、彼らを欺くことができるのです。
おそらく最も懸れるべき点は、このバイアスがコンピュータの中に留まらないことです。人間がこれらのAIツールと共に働くとき、私たちは彼らの悪い癖を模倣し始めます。もしAIが「この候補者は良くない」と言い、採用担当者がそれに同意すれば、その人間もまた偏見を持つことになります。そして、その人間が下した決定がテキストとして書き残され、その新しいテキストが次のバージョンのAIを訓練するために再びAIに投入されます。これは、坂道を転がり落ちる雪玉のように、どんどん大きくなり、より多くの雪(バイアス)を拾い集めて巨大な雪崩となっていく、悪循環なのです。著者たちは、人類は数世紀にわたって徐々にバイアスを減らしてきた一方で、これらのAIモデルは逆方向に進んでおり、アップデートのたびに歪みを増していると示唆しています。
私たちに何ができるのか?
著者たちはただ不満を述べているのではありません。彼らは、この事態が制御不能になるのを防ぐための計画を提案しています。彼らは、バイアスを単に「願って消し去る」ことはできないと言います。なぜなら、人間自身でさえ、自分の隠れた偏見を完全に消し去ることはできないからです。代わりに、私たちは厳格な「安全検査官」である必要があります。
第一に、彼らはAIのための公開された「登録簿」や「スコアボード」を作ることを提案しています。車が販売される前に安全テストに合格しなければならないのと同様に、AIモデルもバイアス・テストに合格しなければなりません。独立した科学者が、モデルが口に出して言うことと、密かに実行することの両方についてチェックする必要があります。このスコアボードは、モデルが時間の経過とともに改善しているのか、あるいは悪化しているのかを追跡するためのものであり、企業がミスを隠蔽できないようにするためのものです。
第二に、彼らは「実効性のあるルール」が必要だと述べています。彼らはこれを他の産業の扱いと比較しています:
- 家電製品のように: 冷蔵庫が数年ごとに、より厳しいエネルギー基準を満たす必要があるのと同様に、AIモデルもより厳しいバイアス基準を満たさなければなりません。以前のモデルよりも偏った新しいモデルをリリースすることは許可されるべきではありません。
- 医薬品のように: もし新しい薬に危険な副作用がある場合、私たちはそれを永久に禁止するのではなく、使用できる対象を制限します。同様に、もしAIがあまりにも偏っているならば、採用や法的判断といった責任の重い仕事から排除されるべきです。
- 自動車のように: もし車がガソリンを大量に消費するなら、政府は会社に税金を課します。著者たちは、AIがより不公平であれば、企業がより多く支払う「バイアス税」を提案しています。
最後に、著者たちは「かくれんぼ」をするのをやめるべきだと主張しています。現在、これらのモデルを構築している人々は、トレーニングデータやコードをどのように調整したかといった秘密を、公衆から隠しています。論文は、問題を解決するためには、独立した研究者が、車のボンネットの下を見る安全検査官のように、AIの内部構造を見ることができる必要があると述べています。
論文は深刻な結びの言葉で終わっています。これらの解決策では不十分かもしれない、というのです。問題があまりにも大きいため、そもそもどのようにテクノロジーを構築するかという根本的な考え方を変えなければならないのかもしれません。著者たちは、バイアスの「雪玉」が、現実の人々の生活を傷つける制御不能な雪崩になる前に、迅速に行動するよう強く求めています。彼らは、私たちのデジタルな助っ人が、私たちの最悪の敵にならないようにするために、科学者、企業、そして政府が協力することを求めているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。