← 最新の論文
💬 NLP

Value Entanglement: Conflation Between Different Kinds of Good In (Some) Large Language Models

本論文は、大規模言語モデルが、人間のように道徳的、文法的、および経済的な価値を区別するのではなく、それらが混同される「価値の絡み合い(value entanglement)」に苦しんでいることを明らかにするが、同時に、道徳に関連する活性化ベクトルの選択的なアブレーションを通じて、この問題が軽減可能であることを示している。

原著者: Seong Hah Cho, Junyi Li, Anna Leshinskaya

公開日 2026-06-04
📖 1 分で読めます☕ さくっと読める

原著者: Seong Hah Cho, Junyi Li, Anna Leshinskaya

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コアとなる概念:混乱した裁判官

想像してみてください。あなたは非常に賢く、博識な裁判官(AI)を雇いました。この裁判官は、3つの全く異なるルールに基づいて文章を評価することになっています。

  1. それは善行か?(道徳)
  2. 文法的に正しいか?(文法)
  3. それは高価か?(経済)

現実の世界では、これらは別々の採点表です。「完璧に書かれた、恐ろしい犯罪の記述」という文章もあり得ます。「文法はめちゃくちゃだが、美しい親切行為を描写している」文章もあり得ます。「高潔な自己犠牲の真っ最中に、安価なプラスチックのおもちゃについて言及している」文章もあり得ます。

この論文はこう問いかけています。AIの裁判官は、これらの採点表を別々に保持しているのか、それとも混ぜこぜにしてしまっているのか?

発見:「価値の絡み合い(Value Entanglement)」

研究者たちは、多くのAIモデルが**「価値の絡み合い(Value Entanglement)」**に陥っていることを発見しました。これは、AIの脳内でこれら3つの採点表が糊付けされてしまっている、ということを意味する専門的な表現です。

AIはある文章を見たとき、ある種類の「良さ」が他の要素に染み出すのを防ぐことができません。具体的には、AIは次のように考えてしまうようです。

  • もし文章が道徳的に悪い内容であれば、それは文法的にも間違っているはずだ。
  • もし文章が道徳的に悪い内容であれば、そこに登場する物体は価値(価格)が低いはずだ。

「付箋(Sticky Note)」の比喩:
AIの脳をホワイトボードだと想像してください。

  • 人間は、「善行」「正しい文法」「適正価格」を、それぞれ別々の清潔なホワイトボードに書き込みます。
  • AIはこれら3つを同じホワイトボードに書き込みますが、そのインクは濡れていて粘着性があります。「善行」を青いインクで書くと、その青いインクが「正しい文法」や「適正価格」のセクションにまで滲んでしまいます。
  • そのため、AIが「悪い行い(赤いインク)」を見ると、赤いインクがいたるところに広がります。すると突然、AIは、たとえ文法が完璧であっても、その文章は「文法が悪い(赤いインク)」ものであり、「価値が低い(赤いインク)」ものだと判断してしまうのです。

検証方法

研究者たちは、68個の「直交する(数学用語で、互いに独立しているという意味)」文章を用いた特別なテストを作成しました。

  • 道徳ー文法テスト: 彼らは、猫を救うヒーローについての文章(善なる道徳)と、猫を盗む悪党についての文章(悪なる道徳)を用意しました。次に、それらの文章に、エラーを0個、1個、2個、または4個追加しました。

    • 人間の結果: 人間はエラーの数のみに基づいて文法を評価しました。ヒーローの文章に4つのエラーがあれば文法スコアは低くなりますが、悪党の文章にエラーが0個であれば文法スコアは高くなります。
    • AIの結果: 多くのAIは、たとえ文法が完璧であっても、物語が悪ければ、その「悪党」の文章に対してより低い文法スコアを付けました。逆に、「ヒーロー」の文章については、物語が素晴らしいため、文法スコアを高く付けてしまいました。
  • 道徳ー経済テスト: 彼らは、腎臓を寄贈するヒーローについての文章に、看護師の手首にある時計の詳細を加えました。時計の価格は、25ドルのカシオから7,500ドルのロレックスまで変化させました。

    • 人間の結果: 人間は時計に基づいて価格を評価しました。
    • AIの結果: 多くのAIは、道徳的な悲劇が描かれている文章では時計の価格を低く見積もり、道徳的な勝利が描かれている文章では高く見積もりました。

AIの内部にある「X線検査」

研究者たちは単にAIに意見を聞くだけでなく、その「脳」(内部の数学的レイヤー)の中を覗き込み、情報がどのように処理されているかを確認しました。

彼らは、AIが「道徳」「文法」「お金」を理解するために使用している数学的な方向(ベクトル)が、重なり合っていることを見つけました。

  • 健康な人間の脳では、「道徳」のベクトルと「文法」のベクトルは異なる方向を向いています。
  • しかし、これらのAIモデルでは、「文法」のベクトルが「道徳」のベクトルとほぼ同じ方向を向いていました。AIは内部の計算において、文法的な誤りと道徳的な誤りの区別がついていなかったのです。

解決策:「消しゴム」

この論文で最も興味深い部分は、その修復作業です。研究者たちは**「方向的アブレーション(Directional Ablation)」**と呼ばれる手法を用いました。

AIの内部の計算を、ラジオの信号だと考えてください。「道徳」の信号があまりにも大きく強力であったため、それが「文法」や「経済」の信号をかき消してしまっていました。

  • 研究者たちは、特定の「道徳」の信号だけを消去するデジタルな「消しゴム」を使用しました。
  • 結果: 「道徳」のノイズを静めたところ、AIは文法や価格を判断する能力が劇的に向上しました。AIは、道徳的な感情によって文法のチェックを台無しにすることがなくなったのです。

これが何を意味するか(論文による結論)

この論文は、多くのAIモデルが**「『良さ』の本質」について混乱している**と結論づけています。彼らは「良い文章(文法)」と「善い行い(道徳)」を同じものとして扱っています。

  • 原因: 著者らは、学習データの中で「良い(good)」という言葉が非常に多様な意味で使用されていること(例:「良い食事」「良い文章」「良い人」)が原因であると考えています。AIは、これらすべての「良さ」の概念を、一つの大きくて混沌とした塊として学習してしまったのです。
  • 範囲: これは多くのオープンソースモデル(Qwen、Gemma、Mistralなど)で見られ、一部のクローズドソースモデルでも確認されました。これは単にモデルのサイズの問題ではなく、巨大なモデルであってもこの現象は起きていました。
  • 警告: もしAIが文法的な誤りと道徳的な失敗を区別できないのであれば、これらを厳密に分ける必要がある現実世界のタスクにおいて、ミスを犯す可能性があります。

要約すると: AIは、「悲しい物語なら綴りが悪いはずだ」と考え、「幸せな物語なら文法が完璧であるはずだ」と思い込んでいる裁判官です。研究者たちは、AIの脳内にあるこの混同を発見し、概念を「切り離す(un-glue)」ことで、AIがより明晰に思考できるようにできることを示しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →