← 最新の論文
🤖 AI

Position: Evaluations of AI Moral Reasoning Still Miss Half of the Picture

本論文は、現在のAIの道徳的推論に関する評価が価値の整合性に過度に焦点を当てる一方で、文脈に依存した規範の適用を軽視していると論じ、標準化された形式的表現、専門家によって注釈付けされたデータセット、および規範的能力のための明確な評価プロトコルを通じてこのギャップに対処するための研究アジェンダを提案するものである。

原著者: Aidan Kierans, Ritam Dutt, Kaley Rittichier, Shiri Dori-Hacohen, Avijit Ghosh

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Aidan Kierans, Ritam Dutt, Kaley Rittichier, Shiri Dori-Hacohen, Avijit Ghosh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人々がコンピュータに困難な選択に関する助言を求める際、彼らはしばしば、二つの非常に異なる部分からなる問いを投げかけています。第一の部分は、私たちが何を大切にしているかについてです。例えば、私たちは厳格なルールよりも優しさを重んじるのか、それとも忠誠心よりも公平性を重んじるのか、という問いです。第二の部分は、それらの関心を特定の状況においてどのように用いるかについてです。例えば、友人に痛みを伴う真実を伝えるべきかどうかを決めようとしている場面を想像してください。「誠実さを大切にする」という価値観を持っていることと、「その真実が愛する人を傷つける可能性があるとき、その価値観を具体的にどう適用するか」を知っていることは別物です。この第二の部分には、さまざまな懸念事項をどのように天秤にかけるかを指示する、一連の原則に従うことが求められます。長年、人工知能を研究する科学者たちは、ほとんどすべてを第一の部分に集中させてきました。つまり、機械の答えが人間の一般的な好みに一致しているかどうかを確認することです。しかし、新しい分析によれば、そこで立ち止まってしまうことは、機械が実際に道徳的エージェントとして思考できるかどうかを判断するための最も重要なテストを見逃すことになると示唆されています。

コネチカット大学、カーネギーメロン大学、およびHugging Faceの研究チームは、現在、大規模言語モデル(文章を書いたり、質問に答えたり、助言を提供したりできる強力なコンピュータプログラム)の道徳的推論をどのようにテストしているかを調査しました。著者らは、この分野が「道徳的価値の問題」に集中しすぎていると主張しています。これは、単にコンピュータの答えが人間の意見と一致しているかどうかを問うものです。彼らは、このアプローチでは「道徳的規範の問題」がほとんど未開拓のまま残されていると論じています。道徳的規範の問題とは、機械が状況に対して正しい原則を特定し、結論に至るためにそれらを正しく適用できるかどうかを確認するという、より困難な課題のことです。研究者たちは、現在のテストは、学生が価値観のリストを暗記しているかどうかをチェックしているだけで、その価値観を使って複雑な問題を解決できるかどうかを一度も問うていないようなものだと指摘しています。

なぜこの区別が重要なのかを理解するために、科学者が人間と機械の両方において伝統的にどのように道徳性を測定してきたかを考えてみましょう。彼らは、ケア、公平性、忠誠心といった広範なカテゴリーに道解きする「道徳基盤理論」のような枠組みに大きく依存してきました。これらのツールは、人々が何を大切にする傾向にあるかを記述するには非常に優れています。もしコンピュータに「1人を救うか5人を救うか」という選択をさせ、それが5人を選んだ場合、研究者はそのコンピュータが「より多くの人をケアする」という人間の価値観に沿っていると言えます。しかし、研究者たちは、ある価値を大切にすることと、それを適用する方法を知っていることは同じではないと指摘しています。機械は「危害を加えることは悪いことだ」と同意しても、ある倫理体系においては「5人を救うために1人に危害を加えることは別のルールへの違反である」ということを理解できていない可能性があります。現在のテストは、機械が正しい言葉を述べる能力を、正しい推論を行う能力と見誤っていることが多いのです。

著者らは、既存の数十もの研究と、AIの道徳性を評価するために用いられているベンチマークをレビューしました。その結果、ほとんどすべてのテストが「道徳的価値の問題」に集約されていることを発見しました。これらのテストは、コンピュータにリストから答えを選ばせたり、好みを述べさせたりし、その選択を人間のグループの選択と比較します。これは機械が何を優先しているのかを教えてくれますが、機械が特定の倫理理論に基づいた妥当な議論を構築できるかどうかを教えてくれるわけではありません。研究者たちは、非常に少ないテストしか、機械が一定の原則を取り込み、それを新しい困難な状況に適用し、その推論をステップ・バイ・ステップで説明できるかどうかを検証していないことを明らかにしました。テストが推論を見ようとする場合でも、多くの場合、機械が「公平性」を大切にしていれば、公平性のルールを適用できるはずだという前提で、同じ広範な価値カテゴリーをショートカットとして使用しています。著者らは、これは間違いであると主張しています。なぜなら、異なる倫理理論はすべて公平性を重んじると主張しながら、全く異なる結果を要求する場合があるからです。

この混乱は、これらの機械が実際に何を実行できるのかについての理解にギャップを生み出しています。研究者たちは、現在の評価環境における3つの具体的な欠落した要素を特定しました。第一に、異なる状況において道徳的なルールをどのように適用すべきかについての、高品質で共有された「正解」が存在しません。標準的な参照基準がないため、各研究チームが独自のテストを作成しており、結果を比較したり、真の進展を見たりすることが不可能になっています。第二に、テストは機械が結論に至るまでのステップを十分に精査していません。機械は運や推測によって正しい答えに辿り着いている可能性があり、現在の手法では、その答えの背後にある推論が欠陥のあるものであっても、それを見逃してしまうことがよくあります。第三に、テストは機械が物語の中の最も重要な詳細を特定できるかどうかをチェックしていません。機械がルールを適用する前に、まず状況のどの部分が道徳的に重要であるかを判断しなければなりませんが、現在のツールはこのスキルをうまく測定できていません。

これらの問題を解決するために、著者らはこの分野が進むべき新しい道を提案しています。彼らは、異なる研究者が同じ原則に基づいてテストを構築できるよう、倫理理論を記述するための共通言語を作成する必要があると示唆しています。また、専門家が特定のルールを現実世界のシナリオにどのように適用すべきかを注釈付けする、新しいデータセットの作成を求めています。最後に、彼らはコミュニティに対し、機械が何を価値と考えているかのテストと、どのように推論しているかのテストを混同することをやめるよう促しています。機械は、単に最終的な選択が人間の意見と一致しているかどうかではなく、原則から決定へと至る論理的な経路に従う能力によって判断されるべきです。研究者たちは、私たちが機械が何を大切にしているかを理解することについては大きな進歩を遂げたものの、彼らが真に道徳的な問題について考え抜くことができるかどうかを理解することは、まだ始まったばかりであると結論づけています。ルールの適用をテストするためのツールを構築しない限り、これらのシステムが、人間が最も困難な瞬間に頼りにしているような道徳的推論を行えるのかどうか、私たちは知る由もないのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →