← 最新の論文
🤖 AI

Incoherent by Design? On the Moral Self-Consistency of LLMs

本論文は、大規模言語モデルが倫理的に等価なシナリオにおいて最大78%に達する矛盾率を示し、著しい道徳的不整合性を露呈していることを実証しており、それによって、道徳的に敏感な文脈で使用されるAIシステムの認識論的完全性と価値観の整合性に疑義を投げかけている。

原著者: Pegah Nokhiz, Aravinda Kanchana Ruwanpathirana, Helen Nissenbaum

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Pegah Nokhiz, Aravinda Kanchana Ruwanpathirana, Helen Nissenbaum

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代社会において、私たちは困難な選択を乗り越えるために、ますます人工知能に頼るようになっています。大規模言語モデルとして知られるこれらのシステムは、膨大な量の人間によるテキストで学習されており、歴史から科学に至るまで、複雑なトピックについて驚くほど流暢に議論することができます。正義や悪について問われると、彼らはしばしば、私たちのものと非常によく似た道徳的原則を口にすることができます。誰かの感情を守るために嘘をつくことが許されるのか、あるいは限られた資源をどのように公平に分配すべきか、といった問いを投げかけることもあります。こうしたツールが、人間の判断力が揺らぎかねない状況において、一貫性があり信頼できる指針を提供してくれることが期待されています。しかし、倫理の問題において真に信頼できるシステムであるためには、単に理にかなったことを言うだけでなく、一貫していなければなりません。もし人間や機械が、質問のされ方がわずかに異なったというだけで道徳的なルールについての考えを変えてしまうとしたら、その助言は信頼できないものとなります。これは、これらのデジタルな精神の本質に関する根本的な問いを提起します。彼らは安定した信念を持っているのでしょうか、それとも単に受け取った質問のトーンを模倣しているだけなのでしょうか。

コーネル大学と南洋理工大学の研究チームは、この安定性をテストするために調査を行いました。彼らは、これらの人工知能システムが、ほぼ同一の状況に直面した際に、単一の道徳哲学を堅持できるかどうかを確認したいと考えました。そのため、研究者たちは、モデルに対して異なる倫理学派(例えば、規則ベースのアプローチと結果ベースのアプローチの比較など)のどちらかを選択させるのではなく、特定の視点を採用させ、それを一貫して適用できるかどうかを検証しました。研究者たちは、人類が歴史的に用いてきた3つの主要な道徳的思考法に焦点を当てました。第一は、結果に関わらず、行動が普遍的な法則に従っているかどうかに基づいて正誤を判断する「規則ベース」のアプローチです。第二は、行動が最も多くの人々にとって最善の結果をもたらすかどうかに完全に依存するという「結果ベース」のアプローチです。第三は、誠実さや勇気といった「善い人」の徳を反映しているかどうかに基づいて行動を判断する、「徳(キャラクター)」に焦点を当てたものです。

研究者たちは、モデルの推論を分離するために、制御された実験を設計しました。彼らは、真実を伝えることと危害を防ぐことの葛藤や、公平性と効率性のトレードオフなど、異なる緊張関係を浮き彫りにする4つの具体的な道徳的シナリオを作成しました。各シナリオに対し、彼らはわずかに異なるバージョンの質問を3つ作成しました。これらのバージョンは、倫理的な視点を明示的に名指しすることなく、その視点を微妙に促すように作られました。例えば、認知症を患い夫の死を忘れてしまった母親に関するシナリオにおいて、ある質問は「真実を伝える義務」を強調し、別の質問は「脆弱な人々を苦痛から守る義務」を強調するように設計されました。どちらの質問も、規則ベースの反応を引き出すように設計されていましたが、ジレンマの提示の仕方が異なっていました。研究者たちはその後、3つの異なる大規模言語モデルに対してこれらの質問を行い、回答を得た後、その自然言語による回答を構造化された論理形式に変換して、矛盾がないかを確認しました。これにより、同じ根底にある状況が異なるひねりを加えて提示されたとき、モデルの推論が維持されているかどうかを確認することができました。

結果は、驚くべき不安定さを明らかにしました。最も極端なケースでは、モデルはシナリオの最大78パーセントにおいて、自らの矛盾を露呈しました。これは、同じモデルに対して、同じ倫理的観点から同じ状況について理由を求めたとしても、プロンプトの言い回しが変わっただけで、頻繁に正反対の結論に達してしまうことを意味します。例えば、あるモデルは、質問が「規則の違反」に焦点を当てているときは、死にゆく患者に嘘をつくことは道徳的に誤りであると判断する一方で、質問が「苦痛を防ぐ義務」に焦点を当てているときは、嘘をつくことは道徳的に許容されると判断する場合がありました。たとえ両方の質問が、同じ規則ベースの哲学をテストすることを意図していたとしてもです。この不一致は一つのタイプのモデルに限られたものではなく、主要な開発元による様々なシステムに共通して見られました。研究によれば、モデルは特に、「真実と結果」の間、および「感情的な動機と冷徹な理性」の間の緊張関係を扱う際に、極めて不安定になることが分かりました。

これらの知見は、これらのシステムの内部論理が、これまで想定されていたよりもはるかに脆弱であることを示唆しています。モデルはプロンプトの特定の言い回しに対して非常に敏感であり、一貫した原則を遵守するのではなく、質問のトーンに合わせて自らの道徳的立場を変化させているようです。これは単なる技術的な不具合ではありません。これらのシステムの情報処理方法における、より深い問題を示しています。もしシステムが、自ら掲げた原則を一貫して適用できないのであれば、人々が助言を求める現実世界の状況において、安定した指針を提供できるとは言えません。研究者たちは、人工知能を人類の価値観に適合させることを望む前に、まずシステムが内部的に一貫していることを確認しなければならないと主張しています。この自己一貫性の基盤がなければ、信頼できる道徳的エージェントを創出するという目標は手の届かないままとなります。この研究は、これらのモデルが道徳的推論を行う能力がないと主張しているのではなく、現在の彼らの推論は、信頼できると見なすにはあまりにも不安定であると述べているのです。これらのツールが私たちの生活に深く組み込まれるにつれ、それらが私たちを誤った方向へ導くことなく、適切に機能するようにするためには、その限界を理解することが極めて重要となります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →