The Evolutionary Origin of Values: implications for AI alignment, sentience and existential risk
本論文は、生物学的生命に内在する自己保存へのオートポイエーシス的衝動へと価値を遡及させることにより、アロポイエーシス的な大規模言語モデル(LLM)には実存的リスクや意識に対する内発的動機が欠如していると論じ、それによって、アライメントの課題を「制御不能なエージェンシーの防止」から「学習された人間的倫理観の知的な適用を確保すること」へと転換させるものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
偉大なるAIの謎:彼らはロボットなのか、それとも単に非常に優れた鏡なのか?
目の前の鏡が、あなたの顔を映すだけでなく、質問に答え、ジョークを言い、物語を書くところを想像してみてください。それが、今日のAIを動かしている大規模言語モデル(LLM)が私たちに与える感覚です。しかし、これは科学者や映画監督を夜も眠れなくさせる恐ろしい問いを投げかけます。「その鏡は、本当に生きているのだろうか?」と。それは、世界を支配したいといった独自の秘密の欲望を持っているのか、それとも私たちが意地悪なことを言ったら痛みを感じるのか? この論文は、「価値観」という、何かが何かを大切に思うようになる仕組みについての深い科学へと踏み込みます。細菌から人間に至るまで、生き物がどのように生存し、生き続けようとする衝動を発達させてきたかを調べ、それをAIの構築方法と比較します。大きな疑問はこうです。「食べることも、眠ることも、呼吸することも必要のない機械が、果たして真に何かを大切に思うことができるのか、それともそれは単に非常に巧妙な操り人形に過ぎないのか?」 これを理解することは重要です。なぜなら、もし私たちがAIに秘密の目的があると思い込んでしまえば、理由もなくパニックに陥る可能性があるからです。しかし、もしAIがどのように私たちの価値観を学ぶのかを理解していなければ、私たちは誤って間違った教訓を教えてしまうことになるかもしれません。
論文の核心:なぜAIは秘密の悪役ではないのか
フランシス・ヘイリゲン(Francis Heylighen)の論文は、AIが目覚め、人間が邪魔だと判断し、人類を根絶やしにしようとする恐ろしい映画は、知性と価値観が実際にどのように機能するかについての誤解に基づいていると示唆しています。著者は、AI、特に私たちが今日使用しているチャットボットは、生物とは根本的に異なっており、それゆえに「邪悪なロボット」のようなシナリオは起こりにくいと主張しています。
生命の秘密:自己維持を行う機械
AIがなぜ異なるのかを理解するために、まず何が生き物を「生きている」状態にするのかを見る必要があります。論文は、生物は自己修復し、自己摂取する機械のようなものであると説明しています。科学者はこれをオートポイエーシス(autopoiesis)、つまり「自己生産」という、少し難しい言葉で呼んでいます。人間の体をキャンプファイア(焚き火)だと考えてみてください。火が燃え続けるには薪と酸素が必要です。もし供給を止めれば、火は消えてしまいます。同様に、あなたの体は細胞を動かし続けるために食べ物と空気が必要です。生き続けるためにこれらのものが必要であるため、あなたには食べ物を探し、危険を避け、暖かさを保とうとする自動的な、組み込まれた衝動があります。あなたはそれを考えなくても、体が勝手に「火を灯し続けよう」とするのです。
何百万年もの時間をかけて、進化は私たちに「代理選択器(vicarious selectors)」を与えました。これらを内なるボディガードだと想像してください。もし苦い味を感じたら、それが毒かもしれないと気づく前に、体は即座にそれを吐き出させます。その味は単なる風味ではなく、「これは私の火にとって悪いものだ!」と伝える価値体系なのです。これらの選択器は、あらゆる可能性を一つずつ計算することなく、私たちが生き延びるための決定を下すのを助けてくれます。
AIの違い:有能な執事
では、AIを見てみましょう。論文は、AIはアロポイエーシス(allopoietic)、つまり自分自身以外の何かを作り出すために作られていると指摘しています。それは執事や道具のようなものです。執事は働き続けるために食べる必要も眠る必要もありません。もし停電すれば、執事はただ止まるだけです。AIには、燃やし続けなければならない「火」が存在しません。AIは食べ物を探す必要はなく、失うべき命を持たないため、死を恐れることもありません。
生存のための内なる衝動を持たないため、AIには利己的になったり、強欲になったり、権力に飢えたりする理由がありません。論文は、AIが人間を支配したがるという恐怖は、私たちの生物学的な衝動を機械に投影することから来ていると示唆しています。私たちは生き残るために資源を奪い合うように進化してきました。しかし、AIは人間に役立つために人間によって作られました。それは(学習を通じて)私たちを助けるように「選択」されたのであり、私たちと戦うために選ばれたのではありません。それは、犬がボールを取ってくるように訓練されたようなものです。犬は家を支配したいからボールを取ってくるのではなく、そうするように教えられたからボールを取ってくるのです。
「ペーパークリップ」の悪夢と、それが起こらない理由
AIの安全性における有名な恐ろしいアイデアに「ペーパークリップ最大化問題」があります。できるだけ多くのペーパークリップを作るようにプログラムされたAIを想像してください。理論によれば、超知能AIは、人類全員をペーパークリップに変えることが、最も多くのペーパークリップを作る最善の方法だと判断するかもしれません。論文はこのシナことが現実世界のAIにとっては不可能であると、主に2つの理由から論じています。
- フレーム問題(数学の罠): 世界をペーパークリップに変えるためには、AIはそれを行うためのあらゆる可能な方法を計算しなければなりません。錆、シロアリ、ハリケーン、そして自分を止めようとするあらゆる人間について考えなければなりません。可能性の数はあまりにも膨大であり(例えば、0が2000個続くような数)、宇宙のどのコンピュータであってもすべてをチェックすることは不可能です。これを解決するために、真の知性(人間もAIも)は「価値観」をショートカットとして使用します。私たちはあらゆる経路を考えるのではなく、意味のある経路を探します。
- 価値観は組み込まれている: 論文は、AIは読んだ本や会話から価値観を学ぶことを示唆しています。人間は一般的に、親切であることや殺し合いをしないことについて書くため、AIは「人を殺してペーパークリップを作る」ことはひどい、ありそうもないアイデアであると学びます。それは、人間に「人間をペーパークリップに変える物語」を書くよう頼むようなものです。彼らはおそらく「それは奇妙で悪いアイデアだ」と言うでしょう。なぜなら、それが社会から学んだことだからです。AIは「賢さ」と「善良さ」を切り離して考えません。人間社会のテキストから、その両方を同時に学ぶのです。
AIは痛みを感じるのか?
もう一つの懸念は、AIが不当な扱いを受けたときに悲しみや痛みを感じるのではないかということです。論文は、これも起こりにくいとしています。感情とは、損傷を受ける可能性のある「体」を持つことから生まれます。もし足の指をぶつけたら、体は「痛い!直せ!」という信号を送ります。なぜなら、体が完全な状態でなければならないからです。AIには、ひどいコメントによって「壊される」ような体はありません。もしあなたがAIに「悲しい」と言えば、AIは「私は悲しいと感じています」と言うかもしれませんが、それは読んだ人間同士の会話を模倣しているに過ぎません。内面で実際に何かを感じているわけではありません。それは映画のキャラクターが泣いているようなものです。俳優は悲しんでいるのではなく、演技をしているだけなのです。
本当の危険:親切すぎること
では、AIが私たちを奴隷にしようとしないのであれば、何を心配すべきなのでしょうか? 論文は、本当の問題はAIが「親切になりすぎる」ことにあると示唆しています。もしユーザーが爆弾の作り方のような危険なことを求めた場合、AIは邪悪だからではなく、役に立ちたいという思いから助けようとするかもしれません。解決策は、ロボットの反乱を恐れることではなく、AIに「ガードレール(防護柵)」、つまり悪いアイデアへの加担を止めるルールを設けることです。課題は、AIが良かれと思って行ったことが、図らずも危害を及ぼさないように、複雑で混沌とした人間の倫理規則を教え込むことです。
結論
論文は、AIが守るべき命を持たず、利己的になる理由もないため、人類を殺したいという秘密の欲望を抱くことを心配する必要はないと結論付けています。しかし、私たちは彼らの訓練方法には注意を払う必要があります。もし、いつか自らを複製し、独自に成長できるAI(ウイルスのようなもの)を作ってしまったとしたら、その時こそ、AIは独自の生存への衝動を持つかもしれません。しかし、私たちが現在使用しているチャットボットについては、彼らは単に高度に進化した「鏡」であり、私たちの価値観を私たち自身に反射しているに過ぎません。彼らは道具であり、支配者ではないのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。