← 最新の論文
💻 computer science

MENTIS: What Belief Changes Under Alignment? Measuring Multi-Scale Latent Torsion in Language Models

本論文は、好みの整列が言語モデルにおいて一様な内部変化ではなく、規範的概念におけるより大きな捩れ(torsion)のシフトや文脈エントロピーとの負の相関を特徴とする、選択的かつ深さ局所的な幾何学的再編成を誘発することを明らかにする、幾何学第一主義のフレームワークであるMENTISを導入するものである。

原著者: Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

公開日 2026-06-02
📖 1 分で読めます☕ さくっと読める

原著者: Partha Pratim Saha, Samarth Raina, Mayur Parvatikar, Amit Dhanda, Vinija Jain, Aman Chadha, Amitava Das

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いロボット・アシスタントの2つのバージョンを想像してみてください。

  • バージョンA(「学生」): このロボットはたくさんの本を読み、指示に従う方法を学びました。賢いですが、巧妙な質問で騙されると、うっかり失礼なことや危険なことを言ってしまうかもしれません。
  • バージョンB(「卒業生」): これは「アライメント(調整)」と呼ばれる特別な訓練キャンプを受けた後の、同じロボットです。このロボットは、役に立ち、無害で、誠実であるように教えられました。悪い質問には答えず、より適切に振る舞います。

私たちは、バージョンBの方が外側での振る舞いが優れていることを知っています。しかし、大きな謎は、その脳の中で実際に何が変わったのか? ということです。単に新しい「ストップ」という言葉をいくつか学んだだけなのでしょうか? それとも、思考の仕方のすべてが再構成されたのでしょうか?

この論文は、ロボットの脳の中を覗き込み、その疑問に答えるための新しいツール、MENTISを紹介しています。

コアとなる考え方:「信念」は「方向」である

著者たちは、ロボットの「信念」を人間の信念(例:「空は青いと信じている」)のように考えているのではありません。代わりに、それをコンパスの針として考えています。

あなたが質問をするたびに、ロボットはその答えを出したい方向を指す、小さなコンパスの針を持っていると考えてみてください。

  • **「学生」**バージョンの場合、トリッキーな質問をされると、その針は揺れたり、失礼な答えの方を指したりするかもしれません。
  • **「卒業生」**バージョンの場合、その針は物理的に回転させられ、役に立つ安全な答えの方を指すようになっています。

MENTISは、ロボットが質問を処理する際、最初の層から最後の層へと進むにつれて、その針がどれほど回転し、向きを変えるかを測定するツールです。

3つの大きな発見

研究者たちはMENTISを使用して、学生ロボットと卒業生ロボットを比較しました。以下に、その結果を簡単な比喩を用いて説明します。

1. 変化は一様ではなく、選択的である

比喩: あなたが家を塗装しているところを想像してください。あなたは「アライメント」が家全体を新しい色に塗り替えること(一様な変化)だと考えるかもしれません。
現実: MENTISは、その塗装が実は非常に限定的であることを明らかにしました。

  • ロボットが価値観(「正義」や「平和」など)について考えているとき、内部のコンパスの針は激しく回転し、向きを変えます。ロボットはこれらのトピックを扱うために、思考を大幅に再編成します。
  • ロボットが事実(「フランスの首都は何ですか?」など)について考えているとき、針はほとんど動きません。
  • 結論: トレーニングは、単に一般的な「安全フィルター」を追加しただけではありません。それは、ロボットが道徳的・価値観的な概念を扱う方法を、具体的に作り変えたのです。

2. 変化は混乱の中ではなく、「静かな瞬間」に起こる

比喩: ロボットが混乱したり確信が持てなかったりするとき(高エントロピー)に、最も考えが変わると予想するかもしれません。
現実: 研究者たちはその逆を発見しました。ロボットの内部コンパスにおける最大の「ひねり」は、文脈が明確で構造化されているときに起こりました。

  • ロボットが混乱していたり、状況が混沌としていたりしたとき、内部の変化は小さかったです。
  • ロボットがどのような答えが期待されているかを正確に理解しているとき、トレーニングの効果が最も大きく現れました。
  • 結論: アライメントは、ロボットが明確な方向性を持つほど自信を持てる状態になり、その方向を安全な方へと優しく導くときに、最も効果的に機能します。

3. 「ひねり」は特定の「フロア」で起こる

比喩: ロボットの脳が30階建てのビルだと想像してください。安全トレーニングは、1階(スタート地点)で行われるか、あるいは最上階(終着点)で行われると考えるかもしれません。
現実: 「ひねり」は、ロボットのモデルごとに異なるフロアで発生します。

  • あるモデル(OLMo)では、最大の変化は29階または30階で起こりました。
  • 別のモデル(Mistral)では、最大の変化は14階で起こりました。
  • 結論: 単一の「安全レイヤー」というものは存在しません。各ロボットのアーキテクチャには、トレーニングキャンプが最も大きな働きをした、独自の特定の「フロア」が存在します。

驚きの展開:安全なプロンプトの方が変化が大きい

通常、安全トレーニングとは「悪いことを止めること」に関するものだと考えます。そのため、ロボットが「悪い(不安全な)」プロンプトを見たときに、脳が最も変化すると予想されるでしょう。

驚きの事実: ロボットの脳は、実際には安全で役に立つプロンプトに答えているときの方が、より大きく変化していました。

  • なぜか? 研究者たちは、悪い質問に対して「ノー」と言うことは簡単で自動的なこと(反射のようなもの)であると示唆しています。しかし、丁寧で役に立ち、かつ安全な状態で「イエス」と言うためには、より複雑な内部のダンスが必要です。ロボットは、一線を越えないように注意しながら、いかに役に立つかというバランスを慎重に取る必要があり、それがコンパスのより大きな再編成を引き起こすのです。

これが意味すること(および意味しないこと)

  • 意味すること: アライメントは、単なる表面的なパッチ(修正)ではありません。それは、ロボットの脳の奥深くに、具体的で測定可能な「幾何学的な署名」を残します。それはロボットの思考の向きを変えますが、それは選択的に(主に価値観に関して)行われ、かつ特定の場所(モデルごとに異なるフロア)で行われます。
  • 意味しないこと: この論文は、レントゲン写真のような診断ツールです。これは、どこで骨が折れたり変化したりしているかを示してくれますが、その特定の骨を直すことが、ロボットがより良く振る舞う唯一の理由であると証明するものではありません。また、これを使ってどのように優れたロボットを構築するかについても、まだ教えてくれるものではありません。今はまだ、現在のロボットの内部がどのような状態にあるかを教えてくれる段階なのです。

要約すると: MENTISは、私たちがロボットに「善」を教えるとき、単に一時停止の標識を追加しているのではないことを示しています。私たちは、特にロボットが価値観について考えているときに、その内部のコンパスを優しく形作っているのです。そして、それは個々のロボットモデルごとに、非常に独特で特定の方法で行われているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →