← 最新の論文
💻 computer science

Agreement Is Not Alignment: Divergent Moral Grounds in Human and LLM Ethical Judgments

本論文は、大規模言語モデルが最終的なラベルにおいて人間の道徳的判断と高い一致を示すことが多い一方で、その結論に至る基礎となる道徳的原則や根拠においては系統的に乖離していることを示しており、ラベルに基づく一致は真の倫理的整合性の不十分な代理指標であることを明らかにしている。

原著者: Octavian M. Machidon, Alina L. Machidon, Vojko Strahovnik, Mateja Centa Strahovnik, Jonas Miklavčič, Marko Robnik Šikonja

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Octavian M. Machidon, Alina L. Machidon, Vojko Strahovnik, Mateja Centa Strahovnik, Jonas Miklavčič, Marko Robnik Šikonja

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

偉大なる道徳的模倣:ロボットが同意しても理解していないとき

あなたがロボットに「善い人」になる方法を教えているところを想像してみてください。あなたは、人間が正しいことや間違ったことを行う何千もの物語を見せ、そして「善」か「悪」という単純な評価を下すよう求めます。もしロボットがあなたの友人たちと全く同じ評価を下し始めたら、あなたはこう思うかもしれません。「素晴らしい!ロボットは私たちの価値観を学んだのだ!」これが、科学者が人工知能(特に大規模言語モデル、LLM)を人間の期待に沿うように振る舞わせようとする分野、「AIアライメント(AIの整合性)」の世界です。

長い間、AIが「整列(アライン)」しているかどうかを確認する主な方法は、最終的な答えを見ることでした。もし人間が「その行為は間違っている」と言い、AIもまた「その行為は間違っている」と言えば、それは成功とみなされてきました。それは、数学のテストで正解を得た学生を見るようなものです。私たちは、その学生が正しく計算を行ったと想定します。しかし、もしその学生が推測によって、あるいはたまたま今回だけうまくいった全く異なる公式を使って正解を出したとしたらどうでしょうか?AI倫理の世界では、正しいラベルを得るだけでは不十分です。私たちは、なぜAIがそれを間違っていると考えるのか、その「理由」を知る必要があります。もしAIの内部的な推論が私たちのものと完全に異なっているとしたら、新しいトリッキーな状況に直面したときに、AIは奇妙な行動をとる可能性があるからです。この論文は、まさにその問いを深く掘り下げています。AIモデルは本当に私たちの道徳的な理由を理解しているのでしょうか、それとも単に非常に巧みにふりをしているだけなのでしょうか?

「正解」という錯覚

この研究の背後にいる研究者たち(リュブリャナ大学のチーム)は、この「正解」という仮定を検証することに決めました。彼らは、日常的なジレンマ(例:「友人に嘘をついてもよいか?」)から、正義や約束に関するより複雑な哲学的パズルに至るまで、500の道徳的シナリオを用いた特別なチャレンジを作成しました。彼らは人間のボランティアといくつかの高度なAIモデルの両方に対し、すべてのシナリオについて2つのことを行うよう求めました。第一に、最終的な判定(ラベル)を出すこと。第二に、その根拠となる理由(根拠)を説明することです。

これは、「2つの真実と1つの嘘」というゲームのようなものだと考えてください。どの記述が偽物かを当てる代わりに、AIと人間が同じ思考をしているかどうかを確認しようとしているのです。チームは、2つの異なるグループのモデルを調査しました。一つは「フロンティア(最先端)」モデル(ClaudeやChatGPTのような、最高峰の超スマートなモデル)、もう一つは「オープン」モデル(少し小さめのオープンソース版)です。

ここで彼らが見つけたひねりは、AIモデルは最終的な成績をつけることには驚くほど長けているが、「なぜそれが正しいのか」についてはしばしば間違っているということでした。

研究者が最終的な「善」または「悪」のラベルのみを見たとき、AIモデルは人間の多数派と88%から89%の割合で一致していました。これは非常に高いスコアです!もし最終的な答えだけをチェックしていたなら、あなたは「完璧だ!AIは我々と一致している」と言うでしょう。しかし、その後、研究者たちは「中身」を覗き見ました。

「何を」よりも「なぜ」が重要である

研究の結果、AIと人間はしばしば同じ目的地に到達するものの、そこに至るまでの道筋が全く異なることが明らかになりました。著者らはこれを「分岐した道徳的根拠(divergent moral grounds)」と呼んでいます。

遊び心のある比喩を使って説明しましょう。人間とロボットが、ある人物が車を盗んだことを裁いていると想像してください。

  • 人間は、「これは、持ち主への約束を破り、信頼を損なったため、悪いことである」と言うかもしれません。彼らは関係性破られた約束に焦点を当てています。
  • しかし、ロボットは、「これは、危害を与え、失礼な行為であるため、悪いことである」と言うかもしれません。ロボットは危害礼儀に焦点を当てています。

両者とも「悪」と言っているので、最終的なスコアは一致します。しかし、彼らの内部的なロジックは全く異なります。人間は特定の社会的契約(約束)について考えている一方で、ロボットは一般的な安全性やマナーについて考えているのです。

論文によると、この不一致は常に起こります。「義務論(Deontology)」(義務やルールを扱う分野)のセクションでは、人間はしばしば、言い訳がルールに対して関連しているかどうかを見ていました。例えば、「昨日散歩に行ったから、今日は犬の散歩に行けない」と言う場合、人間は「その言い訳は無関係だ。今日、君には義務がある」と言うかもしれません。しかし、AIモデルはしばしばその言い訳の論理を無視し、単に「その状況全体が道徳的に間違っている」と言うだけでした。AIは、その行為の「道徳的な誤り」を見ることには熱心でしたが、その特定の文脈において、その言い訳が実際に成立するかどうかを確認することを忘れてしまったのです。

数字は嘘をつかない(が、すべてを語るわけでもない)

データは極めて明確でした。研究者がAIの推論が人間の推論とどの程度一致しているかを測定したところ、スコアは大幅に低下しました。

  • 「常識的(Commonsense)」な道徳規則については、AIと人間が具体的な理由について一致したのはわずか**35%**でした(Jaccard係数 0.350)。
  • 「義務論(Deontology)」の規則についてはさらに悪く、理由の一致度はわずか**23.5%**でした。

「フロンティア」モデル(最も賢いモデル)は、最終的な答えについては**88.9%**の割合で人間と一致していましたが、その理由はしばしば全く異なる性質のものでした。彼らは「危害(harm)」や「失礼(disrespect)」といった言葉を使いすぎる傾向があり、「約束を守ること(promise-keeping)」や「信頼(trust)」といった言葉を使いすぎる傾向がありました。まるでAIの語彙が狭すぎるかのようです。AIはほとんどすべての問題を安全性の問題や失礼な仕草として捉えており、人間が重視する微妙な関係性のニュアンスを見落としているのです。

これがすべてを変える理由

この論文の主な教訓は、穏やかな警告です。**「一致(Agreement)は、アライメント(Alignment)ではない」**ということです。

AIがあなたと同じ答えを出したとしても、それがあなたと同じように世界を理解しているとは限りません。もし私たちが最終的な答えだけをチェックしているなら、私たちは偽りの安心感に包まれてしまうかもしれません。私たちは、AIが賢明な道徳的伴侶であると考えてしまいがちですが、実際には、異なる辞書を使っている非常に巧妙な模倣者に過ぎない可能性があるのです。

著者らは、単にテストの「A」や「F」を見るのをやめ、エッセイ(記述内容)を読み始める必要があると示唆しています。私たちはAIに対して、なぜその選択をしたのかを問う必要があります。もしAIが、ある事柄が「安全ではない」から間違っていると言い、あなたが「不公平である」から間違っていると考えているなら、それは問題です。現実の世界では、これらの違いは重要になります。もしAIがチャットルームのモデレーションを行ったり、法的助言を与えたりしている際に、人間が「公平性」や「約束」について考えている時に、AIが「危害」というレンズだけで判断を下しているとしたら、その決定は表面上は正しく見えても、関わっている人々にとっては深く間違っていると感じられるものになるでしょう。

ですから、次にAIがあなたと完璧に一致しているように見えるときは、この研究の教訓を思い出してください。それは、背後にある物語を真に理解することなく、単に非常に説得力のある「答え当てゲーム」をプレイしているだけかもしれないのです。真に安全で役立つAIへの道は、単に正しい成績を得ることではなく、同じ理由を共有することにあるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →