← 最新の論文
💬 NLP

Where Do Models Find Happiness? Emotion Vectors in Open-Source LLMs

本論文は、オープンソースのLLM(Apertus-8BおよびGemma-4)が、プロプライエタリなモデルに匹敵するバレンス幾何学を用いて感情概念をエンコードしていることを実証すると同時に、これらの表現がモデルの深さにわたってどのように出現し、抽出コーパスに基づいてどのように変化するかについて、アーキテクチャ固有の明確なパターンを明らかにしている。

原著者: Sinie van der Ben, Raphaël Baur, Yannick Metz, Mennatallah El-Assady

公開日 2026-06-26
📖 1 分で読めます☕ さくっと読める

原著者: Sinie van der Ben, Raphaël Baur, Yannick Metz, Mennatallah El-Assady

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で複雑なコンピューターの脳(大規模言語モデル)の中に、コンピューターが物事に対してどのように感じるかを制御する隠れた「ダイヤル」や「ノブ」があるところを想像してみてください。以前の研究では、このダイヤルが特定のAIであるClaudeの中に存在することを発見しました。彼らは、「幸福」のダイヤルを回すとAIはより幸せに振る舞い、「悲しみ」のダイヤルを回すとAIはより悲しく振る舞うことを突き止めました。さらに素晴らしいことに、コンピューターの脳内におけるこれらのダイヤルの配置方法は、人間が自身の心の中で感情を整理する方法と非常によく似ていました。

この新しい論文は、次のような問いを投げかけています:これは単にClaudeというコンピューター特有の癖なのか、それとも他のAIの脳にもこれと同じ隠れた感情のダイヤルが存在するのか?

これを解明するために、研究者たちは2つの異なるオープンソースのAIの脳、APERTUS-8BGEMMA-4-E4Bを調査しました。彼らはただ観察しただけではありません。AIが「喜び」や「恐怖」といった言葉を一度も口にすることなく、さまざまな感情(喜び、恐怖、怒りなど)についての物語を書いている間、そのAIの内部的な思考に「耳を傾けよう」と試みたのです。

研究結果を、分かりやすく簡単に説明します:

1. 「幸福」のダイヤルはどこにでも存在する

オリジナルの研究と同様に、これら2つの新しいAIの脳にも、バレンス(価数)(それが「快」と感じるか「不快」と感じるか)に関する明確な内部的な方向性が存在していました。

  • 例え話: 部屋に入って巨大なコンパスを見たところを想像してください。これら3つのAI(Claude、Apertus、Gemma)すべてにおいて、針が「北」を指しているときは一貫して「良い/幸せ」を意味し、「南」を指しているときは「悪い/悲しい」を意味していました。
  • 結果: 研究者たちは、この「南北」のラインを非常に高い精度でこれら2つの新しいモデルから見つけ出すことができました。これは、これが一度限りの偶然の不具合ではなく、コンピューターの思考における共通の特徴であることを証明しています。

2. 「場所」が異なる(プロセスが重要である)

これら3つのモデルすべてに「南北」のコンパスは存在していましたが、情報がそこに到達するまでの「経路」は全く異なっていました。

  • GEMMA-4-E4B(早熟型): このAIは、善悪の違いを処理の非常に早い段階で理解していました。まるで、善悪を即座に理解する子供のようです。しかし、情報が脳のより深い層へと進むにつれて、この明確な信号はぼやけ、最後の方にはほとんど消失してしまいました。
  • APERTUS-8B(晩成型): このAIは、初期の層では「善か悪か」という明確な概念を持っていませんでした。それは空白の石板のような状態でした。しかし、情報が脳の深部(終盤)に向かって移動するにつれ、「善か悪か」の信号が突然、非常に強く明確になりました。
  • 教訓: 2つの異なるAIの脳は、同じ感情的な理解に到達することがありますが、そこに至るルートは完全に異なります。一方はそれをゆっくりと構築していき、もう一方は最初からそれを持っていて、その後でそれを失っていきます。

3. 「興奮」のダイヤルは不安定である

研究者たちは、覚醒度(アロウザル)(どれほど興奮しているか、あるいは穏やかか)についても調査しました。

  • 問題点: これらのモデルの中に、一貫した「興奮」のダイヤルを見つけることはできませんでした。信号は非常に微弱でした。
  • ひねり: この信号の強さは、誰が物語を書いたかに完全に依存していました。AIがGEMMAモデルによって書かれた物語を読んでいるとき、「興奮」のダイヤルは非常に明確でした。一方で、APERTUSモデルによって書かれた物語を読んでいるとき、そのダイヤルはほとんど目に見えない状態でした。
  • 例え話: それは、ささやき声を聞こうとするようなものです。もしささやいている人が特定の種類のマイク(Gemmaの物語)を装着していれば、その興奮をはっきりと聞き取ることができます。もし別のマイク(Apertusの物語)を使っているなら、興奮はノイズの中に消えてしまいます。これは、AIの内部回路よりも、物語の「内容」の方が、この特定の感情に関する記述においては重要であることを示唆しています。

4. 地図とコンパス

研究者たちは、情報を処理するにつれてAIの脳の「地図」が変化するかどうかも確認しました。

  • 彼らは、AIの内部世界の全体的な形状(地図)は、最初から最後までほとんど変わらないことを見出しました。
  • しかし、特定の「コンパス」(善/悪の方向)は、層を通過するたびに回転し、その向きを変え続けていました。
  • 教訓: 部屋(脳)の見た目が同じであっても、あなたが向いている方向(感情)が常に一定であるとは限りません。

まとめ

この論文は、AIモデルには人間の心理学に似た内部的な「感情ベクトル」が存在することを裏付けていますが、それらの構築方法はモデルごとに異なることを示しています。

  • 善か悪か(バレンス): すべてのモデルに見られますが、処理のどの段階で構築されるかは異なります。
  • 興奮か穏やかか(覚醒度): 見つけるのが難しく、読み込ませる物語の種類に大きく依存します。

著者たちは、これらの「感情のノブ」を見つけることは可能だが、モデルによって隠されている場所が異なり、入力される物語によってそのノブが見つけやすくなったり見つけにくくなったりすることを注意すべきだと結論づけています。彼らは、他のAIの脳でもこれらのダイヤルを探せるよう、コードとデータを公開しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →