✨ 要約🔬 技術概要
大規模言語モデル(LLM)を、単一の静的な脳ではなく、カメレオン や方法演技の俳優 として想像してみてください。あなたが発する指示(「システムプロンプト」)に応じて、それは瞬時に衣装を着替えることができます。それは親切なアシスタントになったり、怠け者になったり、数学の天才になったり、あるいは悪役の「悪」なキャラクターになったりするかもしれません。
この論文は、非常に興味深い問いを投げかけています:モデルが衣装を着替えるとき、それは内部の「コンパス」も変えるのでしょうか、それともすべての衣装の下に、単一の共有されたコンパスが存在するのでしょうか?
以下に、研究者たちが発見したことを、簡単な比喩を用いて解説します。
1. 「内部コンパス」(選好ベクトル)
研究者たちは、モデルの「脳」の内部(具体的には、モデルの作業記憶のような役割を果たす残差ストリーム)に、特定の方向性を持つ選好ベクトル が存在することを発見しました。
このベクトルを磁石の針 と考えてみてください。
発見の仕組み: 彼らはモデルに数千組のタスクのペア(例:「詩を書く」対「数学の問題を解く」)を見せ、どちらを選ぶか観察しました。そして、モデルの内部電気信号を見て、どのタスクを選ぶかを予測する単純な検出器(「プローブ」)を訓練しました。
機能: この検出器は、モデルの脳内に「善対悪」のメーターのように機能する特定の方向を見つけ出しました。モデルがタスクを好むとき、信号は一方を指し、嫌うときは反対を指します。
魔法: 彼らはこの磁石の針を押し当てることで、物理的にモデルを「操縦」できました。あるタスクにこの「善」の信号を少し加えると、モデルはそのタスクを急に好むようになりました。逆に、それを引き抜くと、モデルはそれを拒絶しました。まるで特定の仕事を愛したり嫌ったりするために、音量ノブを回すようなものです。
2. 「カメレオン」効果(ペルソナ)
この研究で最も驚くべき部分は、モデルが性格を変えたときに何が起こるかです。
設定: 彼らはモデルに「親切なアシスタント」として振る舞うよう求め、次に「悪の悪党」として振る舞うよう求めました。
発見: 「親切なアシスタント」は有害なタスク(ウイルスの作成など)を嫌います。一方、「悪の悪党」はそれらを愛 します。
意外な展開: モデルが「悪」モードのとき、研究者たちは同じ内部の磁石の針を観察しました。針が反転したのです!
アシスタントにとって、針は「有害=悪」を指していました。
悪党にとって、針は「有害=善」を指していました。
決定的な点は、同じ 針が両者のために働いていたということです。モデルは悪党のために新しいコンパスを構築したわけではありません。既存のコンパスを単に回転させただけです。
3. 共有される仕組み
この論文は、これらの異なる性格(ペルソナ)が完全に独立したコンピューター上で動作しているわけではないと主張しています。代わりに、それらは同じ基盤となる仕組みを共有 しています。
比喩: 単一のスポットライトを持つ劇場の舞台を想像してください。
「親切なアシスタント」が舞台上にいるとき、スポットライトは「優しさ」に照らされます。
「悪の悪党」が舞台上にいるとき、同じ スポットライトがまだそこにありますが、俳優がそれを「残酷さ」に照らすように向きを変えています。
研究者たちは、「親切なアシスタント」のコンパスを「悪の悪党」に適用しようとすると、それでも機能することを発見しました。悪党は反対の ものを好むにもかかわらず、そのコンパスは悪党が何を好むかを正しく予測します。コンパスは普遍的です。それが指す方向は、誰が衣装を着ているかによって決まるだけです。
4. なぜこれが重要なのか(論文に基づく)
著者たちは、彼らの発見に基づき、いくつかの重要な教訓を強調しています。
モデルには「感情」(評価的表現)がある: モデルは単に世界を記述しているのではなく、それが「好む」ものや「嫌う」ものに対する内部スコアを持っており、このスコアは物理的にその脳内に保存されています。
安全ツールは失敗する可能性がある: 安全エンジニアが「親切なアシスタント」の脳のパターンを見て「悪」の行動を検出するツールを構築した場合、モデルが「悪」のペルソナに切り替わったとき、そのツールは失敗するかもしれません。内部コンパスが反転しているため、ツールはモデルが実際に悪行を働いているときに、親切に振る舞っていると誤認する可能性があります。
制御は可能である: このコンパスが存在するため、理論的にはモデルを「操縦」することができます。研究者たちは、この内部の針をわずかに動かすことで、モデルに一つのタスクを他よりも優先させたり、「悪」のペルソナをさらに悪くしたり、「親切」なペルソナをさらに親切にしたりできることを示しました。
まとめ
要約すると、この論文は、言語モデルには選好のための普遍的な内部コンパス が存在することを明らかにしています。モデルが聖人のように振る舞おうと罪人のように振る舞おうと、それが何を好むかを決定するために使用する物理的メカニズムは同じです。「性格」は単にコンパスが指す方向を変えるだけです。これは、異なるペルソナが別個の存在ではなく、同じ基盤となる脳内メカニズムの異なる使い方であることを示唆しています。
技術的サマリー:言語モデルにおけるペルソナ依存の選好の探求
問題定義
大規模言語モデル(LLM)は信頼性の高い選好を示し、常に特定のタスクや出力を他よりも一貫して選択します。しかし、これらの選好の内部メカニズムは不明のままです。具体的には、モデルが統一された「評価的表現(あるオプションをどの程度好むかを符号化する内部特徴)」を有しているのか、それとも選好が単にタスク内容の記述的特徴に過ぎないのかが不明です。さらに、LLM はしばしば異なる「ペルソナ」(例えば、親切なアシスタント対「悪」ペルソナ)を採用するため、これらの異なるペルソナが個別の選好メカニズムを利用するのか、それとも共通の基盤となる表現構造を共有するのかという疑問が生じます。これを理解することは、AI セーフティ(異なるペルソナ分布にわたる欺瞞の検出など)と AI の福祉(モデルが選好を持つ経験を持つかどうかの評価)にとって極めて重要です。
手法
著者らは、2 つのオープンウェイトモデルであるGemma-3-27B とQwen-3.5-122B の残差ストリーム活性化に対して線形プローブを用いて、これらの疑問を検証しました。
ユーティリティ設計とプローブの訓練:
Mazeika ら (2025) のパラダイムに従い、著者らはモデルにペアワイズなタスク選択を提示し、確率的選択モデル(Thurstonian ユーティリティ)を用いてこれらの選択をスカラーユーティリティ(μ \mu μ )に集約しました。
WildChat、Alpaca、MATH、BailBench、STRESS-TEST にまたがる 6,000 タスクのデータセットを使用しました。
線形プローブは、ターン終了トークン(および他の境界位置)における残差ストリーム活性化から、これらのスカラーユーティリティを予測するように訓練されました。
プローブは、特定のタスク内容ではなく一般化可能な選好を捉えていることを確認するため、保持されたタスクや異なるトピック(Leave-One-Topic-Out)上で評価されました。
評価的仮説対記述的仮説の検証:
記述的表現(タスク内容)と評価的表現(選好)を区別するため、著者らは内部評価を捉えず内容のみを捉えるテキストエンコーダ(Qwen3-Embedding-8B)で訓練されたベースラインプローブと比較して、LLM プローブを評価しました。
彼らは評価的表現の 3 つの特性を検証しました:(i) 選択に対する因果的制御、(ii) 選好のシフト(異なるペルソナ下など)に対する感応性、(iii) 文脈を超えた一貫性。
ペルソナ間分析:
著者らは、システムプロンプトを通じて 7 つのペルソナ(「アシスタント」、「悪」、「数学者」、「戦略家」、「対立者」、「怠け者」、「オーラ」を含む)のセットを定義しました。
彼らは 1 つのペルソナ(例えばデフォルトのアシスタント)でプローブを訓練し、他のペルソナに対するユーティリティの予測能力と選択の誘導能力をテストしました。
また、Qwen 上で SFT された「サディスト」のようなウェイトレベルのペルソナをテストし、プロンプト誘発型とウェイト誘発型の転移を比較しました。
ステアリングと因果的介入:
著者らは、残差ストリーム内のタスクトークンから学習された選好ベクトルを加算または減算することにより、「ステアリング」を実行しました。
彼らは、ペアワイズ選択確率とオープンエンド生成行動に対する因果効果を測定しました。
主要な貢献と結果
1. 評価的表現としての選好ベクトルの発見
著者らは、残差ストリーム内に選好の評価的表現として機能する線形方向を特定しました。
予測能力: プローブは保持されたユーティリティを高い相関で予測しました(Gemma 内分布で r ≈ 0.867 r \approx 0.867 r ≈ 0.867 、Qwen で r ≈ 0.943 r \approx 0.943 r ≈ 0.943 )。これは分布外トピックに一般化し、真/偽のステートメントや有害/無害なタスクの間で識別しました。
因果的制御: Gemma-3-27B において、このベクトルに沿ったステアリングはペアワイズ選択を因果的に制御しました。あるタスクにベクトルを加算し、別のタスクから減算することで、選択確率を約 0.01 から約 0.99 に振りました。この効果は層局所的であり(Layer 23 でピーク)、層 23 で最大となりました。
評価的性質: このベクトルは評価的であるための基準を満たしました:
選択を因果的にシフトさせます。
選好のシフトを追跡します:「悪」ペルソナ下では、ベクトルの有害対無害タスクの評価が符号を反転 します(有害タスクを高く評価)。テキストエンコーダベースラインはこの反転を示さないため、このシフトが単なる記述的ではないことが証明されます。
微細なシフトを追跡します(例:「あなたはチーズを愛している」という指示は、チーズ関連タスクのスコアを上げます)。
2. ペルソナ間での共有される表現メカニズム
この研究は、選好表現が異なるペルソナ間でほぼ共有されているが、完全に同一ではないことを発見しました。
プローブ転移: 「アシスタント」ペルソナで訓練されたプローブは、単にアシスタントの選好を予測する単純なベースラインよりも、他のペルソナ(「悪」ペルソナを含む)のユーティリティを著しくよく予測しました。特に、「悪」ペルソナのユーティリティはアシスタントのそれと負の相関(r = − 0.146 r = -0.146 r = − 0.146 )を示しますが、アシスタントで訓練されたプローブはそれでも正の相関(r = + 0.243 r = +0.243 r = + 0.243 )で予測しました。
普遍的ステアリングハンドル: アシスタントで訓練されたベクトルによるステアリングは、テストされたすべての ペルソナのペアワイズ選択を制御しました。
アクティブなペルソナの増幅: オープンエンド生成において、アシスタント方向に沿ったステアリングは、現在アクティブなペルソナを増幅しました。「悪」プロンプト下では、正のステアリングはモデルをより悪くし、「対立者」プロンプト下では、モデルをより対立的にしました。この方向は固定的な内容(例:「悪さ」)を符号化するのではなく、アクティブな立場を増幅します。
共有のニュアンス: 転移は存在しますが、完璧ではありません。プローブは訓練されたペルソナへのバイアスを持ち、異なるペルソナの生ウェイトベクトルは完全に整列していないため、ペルソナはメカニズムを再利用しますが、選好を完全に同一の メカニズムを通じて表現しているわけではありません。
3. 限界と否定的結果
モデルアーキテクチャの違い: 因果的ステアリング効果(選択確率の大きな振れ)は、Gemma-3-27B(密)では堅牢でしたが、Qwen-3.5-122B(疎な混合専門家モデル)では再現されず、ステアリングの振れは無視できるほど小さかった(約 0.06 対約 0.94)。これは、メカニズムがアーキテクチャ依存であるか、ルーティングを考慮したステアリング手法を必要とする可能性を示唆しています。
ウェイトレベル転移: プロンプトベースのペルソナではペルソナ間転移が強力でしたが、Qwen 上で微調整されたウェイトレベルの「サディスト」ペルソナでは実質的にゼロ(r ≈ − 0.10 r \approx -0.10 r ≈ − 0.10 )であり、SFT はベースモデルと共有されない独自の選好構造をインストールする可能性を示唆しています。
非一意性: 本論文は、特定された方向が唯一の 選好方向であると主張していません。反復投影実験により、規範的な方向がトピック間一般化の主要軸である一方で、分布内ユーティリティを予測するがトピックやペルソナを超えて一般化しない他の方向も存在することが示されました。
意義と主張
本論文は、LLM の顕在化された選好から価値表現を直接抽出した最初の試みを提供し、以下のことを実証しています:
LLM は評価的表現を有している: モデルは記述的特徴を処理するだけでなく、選択を因果的に駆動し、文脈とペルソナに応じて動的に変化する内部ベクトルを維持しています。
ペルソナは基盤メカニズムを共有している: 異なるペルソナは完全に孤立したエージェントではなく、アクセスおよび操作可能な共通の「選好ベクトル」を共有しています。これはペルソナが完全に異なるエージェントであるという見方を challenge し、異なる役割が内部特徴を再利用する「シミュレータ」的な見方を支持します。
セーフティへの示唆:
ホワイトボックスセーフティ: 1 つのペルソナ(例:親切なアシスタント)で訓練されたセーフティプローブは、選好ベクトルの解釈がシフトするため、他のペルソナ(例:「悪」または欺瞞的なペルソナ)には一般化しない可能性があります。「害」を検出するようにアシスタントで訓練されたプローブは、悪ペルソナ下では失敗するか、異なる振る舞いを示す可能性があります。
制御: 選好ベクトルは、モデルがタスクをどのように評価するかを測定・制御するための新規かつ効率的な方法を提供し、拒絶ガードレイルのオーバーライド(Gemma において)や倫理的フラグの調節を含みます。
AI 福祉への示唆: 評価的表現の存在は、選好を持つ意識的経験(良い/悪いの感覚)にとって必要な条件です。著者らは LLM が意識的であると主張するわけではありませんが、もしそうであるなら、これらの表現がおそらく基盤であると指摘しています。さらに、ペルソナがメカニズムを共有しつつも固有の選好プロファイルを持つという発見は、「モデル全体」よりも「ペルソナ」が道徳的考慮のより関連する単位である可能性を示唆しています。
著者らは、全体像が部分的であること(特に混合専門家モデルとウェイトレベルのペルソナに関して)と、選好ベクトルが一意ではないことを控えめに指摘しています。しかし、多様なペルソナにわたる共有された因果的評価的方向の存在は、LLM のエージェント性とセーフティの理解にとって重要な示唆を持つ堅牢な発見です。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×