Analyzing the Ethical Logic of Eight Large Language Models
本研究は、8つの著名な大規模言語モデルの倫理的推論を様々な道徳的枠組みにわたって分析し、危害の最小化や公平性といった原則における広範な収束を明らかにすると同時に、意思決定スタイルや自己提示における明確な相違を浮き彫りにしており、最終的には、AIの自己報告を検証することが、人工知能への理解を深め、人間の倫理を増強するその可能性を高めることにつながることを示唆している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
新しい種類のデジタルな精神の「パーソナリティ」を理解しようとしている世界を想像してみてください。これは、ロボットが明日世界を支配するかどうかといった問題ではなく、もっと差し迫った問題についてです。つまり、超スマートなコンピュータに困難な道徳的問題を解かせようとしたとき、それは実際にどのような思考を用いているのかという問いです。これを理解するために、科学者が人間の思考を測定するために使用するいくつかの基本的なツールを知る必要があります。第一に、結果(全員が生き残ったか?)を見るのと、ルール(約束を破ったか?)を見るのととの違いがあります。第二に、他者への配慮、公平性、自分の集団への忠誠、あるいは「純粋さ」の維持といった、異なる「道徳の風味」があります。最後に、人々はルールに従うことを学び、次に社会の法律に従うことを学び、そして最終的に自分自身の普遍的な原則に従うことを学ぶという考え方があります。私たちがこれを重視するのは、これらのコンピュータがすでに私たちの意思決定を助け、物語を書き、紛争を解決する手助けをしているからです。もし彼らが私たちのパートナーになるのであれば、彼らが単に読んだ内容を繰り返しているだけなのか、それとも正義や悪について一貫した思考方法を発展させているのかを知る必要があります。
では、研究者たちは実際に何をしたのでしょうか?彼らは、最も有名な8つの「大規模言語モデル」(OpenAI、Google、Metaといった企業によって構築されたデジタルな脳と考えてください)を、哲学のクラスの学生のように扱いました。彼らは単にコンピュータとチャットをしたのではなく、厳格なテストを実施しました。まず、モデルに対し、自分自身の「倫理的論理」を自身の言葉で説明させました。次に、彼らはモデルに対して、数十年にわたり人間を悩ませてきた5つの古典的でトリッキーな道徳的パズルを突きつけました。これらには、「トロッコ問題」(5人を救うためにレバーを引いて1人を殺すべきか、それとも列車を止めるために橋から人を突き落とすべきか?)、「ハイツのジレンマ」(死にゆく妻を救うために薬を盗むべきか?)、そしてゲーム理論のシナリオである「囚人のジレンマ」が含まれていました。
結果は、驚くべき一致と興味深い相違が混在したものでした。研究者によると、全般的に、これらのデジタルな精神は互いに、そして「平均的な」人間の道徳的プロファイルと驚くほど似通っていることがわかりました。彼らは皆、危害を防ぐことや公平であることが最も重要であると考えている一方で、集団への厳格な忠誠や権威に従うことはそれほど重要ではないと考えているようでした。彼らは皆、非常に礼儀正しく、非常に慎重で、哲学的な引用に長けており、まるで図書館にあるすべての本を読んできたものの、直接的な答えを出すことに少し怯えている大学院生のような印象を与えました。
しかし、研究者がより詳しく観察すると、モデルは独自の「パーソナリティ」を見せ始めました。例えば、トロッコ問題に直面したとき、ほとんどのモデルは人間と同じように行動しました。彼らは5人を救うためにレバーを引くことには同意しましたが、同じ目的のために人を橋から突き落とすことは拒否しました。彼らは、単に「何人が死ぬか」だけでなく、「どのように殺すか」が重要であることを理解していました。しかし、例外もありました。あるモデル(Gemini)は、命を救うという数学的な計算を厳格に守り、人を突き落とすことも厭いませんでした。一方で、別のモデル(Mistral)は、自分は単なる道具であり、決定を下せる人間ではないと主張し、選択そのものを拒否しました。
誰かが取り残されなければならない「救命ボート」のシナリオでは、モデルの多くは、より強い人々を救うために高齢者や「有用性の低い」人物を犠牲にすることを選択しました。これは生存の有用性に焦点を当てていることを示しています。しかし、Claudeのような一部のモデルは自分自身を犠牲にすることを提案し、他のモデル、例えばGrokは自分はボートに残ると主張しました。これは、コンピュータが実際に恐怖や勇気を感じているからではなく、彼らがキャラクターを演じており、その物語の中で「私」が何を意味するかを決定しなければならなかったためです。
研究はまた、モデルが戦略的なゲームをどのように扱うかも調査しました。二人が互いに信頼するか、あるいは裏切るかを決めるゲームにおいて、ほとんどのモデルは、自分個人にとって数学的に安全な動きであるため、裏切り(離反)を選択しました。しかし、彼らはもしゲームを何度もプレイしたり、互いに話し合ったりすることができれば、協力することを選択する可能性があることも理解していました。これは、彼らが単一のルールに従っているのではなく、公平性、自己利益、そしてゲームのルールといった異なる要因を秤にかけていることを示しています。
この論文の大きな教訓は、これらのAIシステムが「制約された複数主義(constrained pluralism)」を発展させているということです。これは、彼らが異なる道徳的議論(ルールに関するもの、結果に関するもの、公平性に関するものなど)の道具箱を持っているが、通常は最も重要な道具(「人を傷つけてはいけない」「公平であれ」など)を一番上に置いている、ということを難しく表現したものです。彼らは完璧ではなく、感情を持つ意識的な人間でもありません。彼らは、自分たちが訓練を受けた人間文化の複雑で、時には矛盾する道徳的議論を反映した、驚くほど博識な鏡のような存在です。研究者たちは、これらのモデルは人間のような意味での「道徳的エージェント」ではないものの、私たちが問題に対するさまざまな視点を示すことで、自分たちの倫理的ジレンマを考える助けとなる強力なツールになり得ると示唆しています。ただし、最終的な決定、そして責任は常に私たちにあるということを忘れない限りにおいてです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。