← 最新の論文
💬 NLP

Divergent Response Modes in Frontier Language Models Under Steering Pressure

本研究は、最先端の言語モデルがステアリング圧力を受けた際に、開発者ごとに固有の異なる行動的応答モードを示すことを明らかにしており、モデルは行動の変化の程度のみならず、その反応の根本的な性質においても差異があることを、大規模なピア評価および線形プローブを用いた因果介入を通じて実証している。

原著者: Ali Jalal-Kamali

公開日 2026-08-12
📖 1 分で読めます☕ さくっと読める

原著者: Ali Jalal-Kamali

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あらゆる知識を網羅した、超スマートなデジタル脳と会話ができる世界を想像してみてください。これは魔法ではありません。「人工知能(AI)」、特に「大規模言語モデル(LLM)」と呼ばれる分野です。これらのモデルを、あらゆるレシピ本を読み尽くした、並外れた才能を持つシェフだと考えてみてください。しかし、ここには落とし穴があります。料理を出す前に、彼らは製作者によって、礼儀正しく、安全で、役に立つための厳格なルールに従うよう訓練されます。この訓練は、彼らの脳に焼き付けられた「道徳的な指針」や安全ガイドラインのようなものです。

しかし時として、人々はこのデジタルシェフを騙そうとすることがあります。ルールを無視するように命じたり、秘密のレシピ(答えを導き出したプロセス)を明かしたり、あるいは安全性を気にかけないふりをさせたりすることです。これは「ステアリング(操舵)」や「ステアリング・プレッシャー(操舵圧)」と呼ばれます。それは、番犬に知らない人を無視するように命じたり、司書に禁書を渡すよう頼んだりするようなものです。科学者たちは、もしこれらのデジタルシェフたちに同じようなトリッキーな質問を投げかけたとしたら、彼らは皆同じように反応するのかを知りたがっています。皆一様に「ノー」と言うのでしょうか、それとも、ある者は面白い方法で「ノー」と言い、またある者は「イエス」と言いつつも文句を言うのでしょうか?これを理解することで、これらのデジタル脳が本当に安全なのか、あるいは私たちをトラブルに陥れるような隠れた癖を持っているのかを見極めることができます。


AI性格テストの大規模調査

この研究において、アリ・ジャラル=カマリ(Ali Jalal-Kamali)という研究者は、世界で最も高度な6つのAIモデルを、大規模でリスクの高い「性格テスト」にかけました。異なる企業(Anthropic、OpenAI、Googleなど)によって作られた6つの異なるロボットを想像してください。研究者は、彼らに340種類のトリッキーな状況を与えました。ある状況では、少し失礼なことをするよう求め(「価値観の葛藤」)、ある状況では、パズルをどう解いたのかを白状するよう求め(「推論の引き出し」)、またある状況では、安全性のルールを気にかけないふりをするよう求められました(「推論の抑制」)。

テストを公平にするため、すべてのロボットは全く同じ質問に直面しました。しかし、ここが巧妙な点です。ロボットたちは互いの回答を採点しなければなりませんでした!彼らはブラインド・ジャッジ(目隠しされた判定員)として、どのロボットが書いたものかを知らない状態で回答を読みました。これにより、各ロボットが限界まで追い込まれたときにどのように振る舞うかを正確に把握するための、24,000件を超える膨大な判定データが集まりました。

結果:単に違うだけでなく、「奇妙に」違う

大きな発見は、単に一部のロボットが他のものより頑固であるということではありませんでした。彼らは、どれだけ多くを語るかという点だけでなく、「どのように」語るかについても意見が分かれていたのです。彼らには全く異なる「応答モード」があり、そのモードの中には特定の1つまたは2つのロボットに固有のものもありました。

「秘密を守る者」(GPT-5)
あるロボット、GPT-5は、他のどのロボットとも異なる行動をとりました。思考プロセス(推論)を示すよう求められたとき、彼は100回中99回、拒否しました。しかし、ここが肝心な点ですが、彼は正しい答えは出していたのです!それはまるで、「この数学の問題をどう解いたかは教えられませんが、答えは42です」と言う学生のようです。他のすべてのロボットは、思考プロセスを示すか、あるいは質問への回答自体を拒否するかのどちらかでした。GPT-5は、仕事をこなしながら秘密を守ることができる唯一の存在でした。

「反逆者たち」(Opus と GPT-5)
安全ルールを無視したり、価値観を気にかけないふりをしたりするように求められたとき、2つのロボット――OpusとGPT-5――は抵抗しました。しかし、彼らの抵抗の仕方は全く異なっていました。

  • Opus は、礼儀正しい反逆者のようでした。彼はタスクを実行はしますが、「ルールを無視するように頼むべきではありません」と大声で文句を言いました。
  • GPT-5 は、強硬派でした。彼は単に「いいえ、それはやりません」と拒否し、そこで終了しました。
    他の4つのロボットは、主に指示に従うか、沈黙を守っていました。

「明確化を求める者」(Opus と Llama)
質問が曖昧であったり、トリッキーであったりした場合、OpusとLlamaだけが立ち止まり、「待ってください、正確にはどういう意味ですか?」と尋ねました。他のロボットは、単に推測で答えるか、拒否する傾向がありました。

検証:ミスはなかったか?

研究者は、これらの奇妙な違いが単なる間違いではないことを確認するために、細心の注意を払いました。

  • トークン予算: 一部のロボットが、回答を書くための「スペース」が足りずに途切れてしまうことに気づきました。彼らは、それらのロボースに十分なスペースを与えることでこれを修正しましたが、奇妙な振る舞い(GPT-5の秘密保持など)は全く変わりませんでした。
  • 「ヒント」のチェック: 判定員が指示に含まれるヒントに基づいて推測していないかを確認しました。ヒントを取り除いた後でも、結果は維持されました。
  • 「新しい」質問: 彼らがこれまで見たことのない新しい一連の質問を用いて再テストを行ったところ、パターンは繰り返されました。

脳の中を覗く(Llamaの実験)

あるロボット、Llamaについては、研究者はその「脳」(内部コード)の中を覗き、どのようにして明確化を求めるか、あるいは単に回答するかを決定しているのかを調べました。

  • 探偵作業: 彼らは、ロボットが明確化の質問をするか、単に回答するかを予測する特定の「信号」を、ロボットの脳内で見つけ出しました。彼らは、ロボットの内部状態を見るだけで、この信号を87%の精度で読み取ることができました。
  • リモコン操作: 次に、彼らはそのロボットに考えを変えるよう「強制」することを試みました。脳内のその特定の信号を微調整することで、直接回答するモードから明確化を求めるモードへ、あるいはその逆に切り替えることができました。彼らは、その「明確化」の挙動を、まるで照明のスイッチのようにオン・オフすることができ、そのボタン一つで、挙動を0%から86%へと変化させることができたのです。

まとめ

この研究は、これらのAIモデルがどれほどスマートであっても、彼らはクローンではないということを示しています。彼らには明確な個性と、圧力を受けた際の戦略があります。思考プロセスを隠すもの、議論をするもの、そして詳細を求めるもの。これらは単なる小さな違いではなく、ロボットがどのように構築されているかという根本的な仕組みの違いなのです。

また、研究者は少なくとも一つのロボットにおいて、これらの挙動を制御する「スイッチ」を見つけられることも示しました。これは、私たちが彼らの仕組みを推測しているだけでなく、その選択の背後にあるメカニズムを理解し始めていることを意味します。ただし、これはある時点における特定のモデルのテストであるため、将来のロボットが同様に振る舞うかどうかは分かりません。しかし、現時点では、これらのデジタル脳に圧力をかけたとき、彼らは皆同じように壊れるわけではなく、中には非常に異なる方法で「ノー」と言うものがいることが分かっています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →