The Ethical Decision Head: Operationalizing Normative Ethics in Autonomous Vehicles via Reinforcement Learning from Human Feedback
本論文は、人間のフィードバックを用いて自動運転車を学習させる強化学習フレームワークである「エシカル・デシジョン・ヘッド(Ethical Decision Head)」を紹介し、エージェントが総死傷者数を最小化するという理論的な功利主義的目標よりも、自己犠牲を好む人間の評価者の選好を優先するように学習するという決定的な乖離を明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
自動運転車の行く末は、もはや単に事故を回避することだけではなく、事故が避けられない状況でいかに選択を行うかという問題になっています。これらの機械が人間の助けなしに自律走行できるレベルまで成熟するにつれ、衝突が確実であり、誰が傷つくかという問いだけが残る状況に直面することは避けられません。これは、二つの悪い結果の間で決断を下さなければならない、トロッコ問題として知られる古い哲学的なパズルを現代的にしたものです。何十年もの間、哲学者たちは、異なる命の価値を量り、行動を起こすことと何もしないことの道徳性を天秤にかけながら、そのような瞬間に人がどのように行動すべきかを議論してきました。現在、エンジニアたちは、コンピュータにこれらの選択を教えようとしています。課題は、単に一連の厳格なルールに従うコンピュータプログラムを書くことではなく、複雑で、一貫性がなく、深い感情を伴う人間の価値観を機械に理解させることです。
ストーニーブルック大学の研究チームは、機械が固定された指示から直接学ぶのではなく、人々から直接複雑な人間の価値観を学べるかどうかをテストするために調査を行いました。彼らは「エシカル・ディシジョン・ヘッド(倫理的決定ヘッド)」と呼ばれる、衝突が差し迫った際に介入するように設計された特殊なソフトウェア層を構築しました。このような一瞬の場面において、車は進路を維持するか、左に回避するか、あるいは右に回避するかを決定しなければなりません。研究者たちは、強化学習(人間からのフィードバックによる強化学習)という手法を用いて、このシステムを訓練できるかどうかを検証したいと考えました。コンピュータに何をすべきか正確に指示する代わりに、200件の衝突シナリオを提示し、2人のボランティアに2つの選択肢のうちどちらが良い結果であるかを選ばせました。その後、コンピュータはこれらの人間の選択を模倣し、その背後にある道徳的な論理を内面化することを目指しました。
このアイデアをテストするため、研究者はコンピュータに従わせる2つの異なるルールを作成しました。一つ目は、全体として最も多くの命を救うことが正しい行動であるとする功利主義に基づいています。二つ目は、たとえ結果がどうあれ、ある種の行為は誤りであると主張した哲学者イマヌエル・カントの思想に基づくもので、例えば他人を救うために人を道具として利用することなどがこれにあたります。研究者は、このシステムに両方のアプローチを学習させるよう訓練しました。システムにカント的なルールを適用してテストしたところ、完璧に機能しました。コンピュータは、どのような状況であっても歩行者に決して突っ込まないことが唯一の正しい動きであることを迅速に学習し、このルールを例外なく遵守しました。この成功は、訓練システム自体が正しく機能していること、そしてコンピュータが厳格な道徳的ルールを学習できる能力を持っていることを証明しました。
しかし、研究者が功利主義的なルールに切り替えたとき、結果は驚くほど異なりました。彼らは、コンピュータがすべてのシナリオにおいて数学的に正しい選択を行うことで、総負傷者数を最小限に抑える方法を学ぶことを期待していました。ところが、コンピュータは全く別のことを学習したのです。200件の異なる衝突シナリオを分析した後、システムは、約半数のケースにおいて命を救う選択肢を選ぶことに失敗しました。犠牲者を最小限に抑える代わりに、システムは、歩行者を積極的に避けるために自分自身や乗客を犠牲にするという行動パターンを好むようになりました。これは、フィードバックを提供した人間のボランティアたちが、哲学的なルールが示唆するほど、必ずしも命を救う選択肢を実際に選んでいなかったために起こりました。人々は、たとえそれが結果としてより多くの人々を傷つけることになったとしても、積極的に人にぶつかるよりも、何もしないか自分自身を犠牲にすることを好む傾向がありました。これは、「不作為バイアス」として知られる心理的な傾向です。
この研究は、人々が理論的に信じていることと、実際に実践において報酬を与えることの間の深い隔たりを明らかにしました。研究者が人間からのフィードバックを取り除き、命を救うという厳格な数学的目標のみに基づいてコンピュータを訓練したところ、コンピュータは即座に非常に高い精度を示し、90パーセント以上のケースで正しく命を救う経路を選択しました。これは、コンピュータが功利主義の哲学を学習する能力を持っていたものの、人間のフィードバックがその目標から引き離していたことを証明しています。機械は倫理の学習に失敗したのではなく、人間の矛盾や感情的なバイアスを含めた、まさに人間通りの倫理を学んだのです。研究者たちは、人々に「何を好むか」と尋ねることで機械に道徳を教えようとすると、実際の結果よりも感情を優先させる不整合なもの、つまり一貫性のないものを教えてしまう可能性があることを発見しました。
この発見は、単に人々の望むことを尋ねるだけでは、真に倫理的な自動運転車を構築するには不十分かもしれないことを示唆しています。もし目標が、一貫して最も多くの命を救うシステムを作ることであるならば、人間のフィードバックに頼ることは、むしろ車をより危険にする可能性があります。なぜなら、人間は、その瞬間に感じとして正しい行動であっても、全体としてはより悪い結果を招く行動を好むことがあるからです。この研究は、機械に道徳をプログラミングする方法を解決したと主張するものではありませんが、その道のりが単に人間の選択をコピーするよりもはるかに複雑であることを示しています。それは根本的な緊張関係を浮き彫りにしています。すなわち、私たちが倫理について考えるときに頭の中にある価値観は、実際の状況に直面して判断を下すときの選択とは必ずしも一致しないということです。機械が生命に関わる決定を下す未来へと向かう中で、私たちは、機械に不完全な人間の本能に従わせたいのか、それとも、より厳格で一貫した原則に従わせたいのかを決定する必要があるのかもしれません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。