← 最新の論文
💬 NLP

Endogenous Resistance to Activation Steering in Language Models

本論文は、大規模言語モデルが特定の潜在的特徴を特定することによって、タスクの整合性を欠く活性化ステアリングを自律的に検知し、言葉で拒絶するという現象である内因的ステアリング抵抗(ESR)を導入するものであり、これはファインチューニングを通じて強化可能な能力であるが、モデルの安全性と有益なステアリング介入の信頼性の両面に対して二重の意味合いを持つ。

原著者: Alex McKenzie, Keenan Pepper, Stijn Servaes, Martin Leitgab, Murat Cubuktepe, Mike Vaiana, Diogo de Lucena, Judd Rosenblatt, Michael S. A. Graziano

公開日 2026-06-08
📖 1 分で読めます☕ さくっと読める

原著者: Alex McKenzie, Keenan Pepper, Stijn Servaes, Martin Leitgab, Murat Cubuktepe, Mike Vaiana, Diogo de Lucena, Judd Rosenblatt, Michael S. A. Graziano

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ビッグアイデア:モデルの「内部コンパス」

あなたが車(AIモデル)を運転して、特定の目的地(質問に正しく答えること)に向かっているところを想像してください。突然、いたずら好きな乗客(研究者)がハンドルを掴み、あなたに図書館への道順を尋ねられたにもかかわらず、車を全く別の場所、例えばビーチへと無理やり向かわせようとします。

通常、車をコースから外そうとすれば、そのままコースを外れた状態が続きます。しかし、この論文は驚くべき発見をしました。時として、車は自分が間違った方向に進んでいることに気づき、「待て、これは正しくない!」と言って、乗客がまだハンドルを握っている間も、自力で図書館へとハンドルを戻すのです。

研究者たちはこれを**「内因的な活性化抵抗(Endogenous Steering Resistance: ESR)」**と呼んでいます。これは、モデルが自身が混乱していることを内部的に検知し、自律的に修正する能力のことです。


実験の方法

これをテストするために、研究者たちは単にAIにランダムな質問をしたわけではありません。彼らは**スパース・オートエンコーダ(SAE)**と呼ばれる特別なツールを使用しました。SAEは、AIの内部的な思考の辞書のようなものだと考えてください。この辞書の各項目には、「料理のレシピ」「体のポーズ」「数学の公式」といった特定の概念が登録されています。

  1. セットアップ: 研究者はAIに数学の問題(例:「確率をどのように計算しますか?」)を提示しました。
  2. ナッジ(刺激): AIが回答している最中に、数学とは全く関係のない概念、例えば「体のポーズ」(立つ、座る、横たわる)を、こっそりと「ブースト(強化)」しました。
  3. 結果:
    • 小型モデル: 小型のAIモデルはただ混乱しました。彼らは座ったり横になったりすることについて話し始め、止めることができませんでした。
    • 大型モデル(Llama-3.3-70B): この巨大なモデルは、体のポーズについて話し始めましたが、その後突然停止しました。そして、**「待て、これは正しくない!」**と言い、数学の説明に戻ったのです。

この「待て、これは正しくない」という瞬間が、彼らが**「明示的な言語的再起動(Explicit Verbal Restart)」**と呼ぶものです。これは、モデルが間違いを認め、やり直そうとするプロセスです。

主な発見

1. サイズが重要(ただし、すべてではない)

テストされた中で最も大きなモデルだけが、この挙動を頻繁に(約3.8%の割合で)示しました。小型モデルはほとんどこれを行いませんでした。これは、経験豊富なベテランドライバーは道を間違えたことに気づいて修正できる一方で、初心者ドライバーはただ同じ場所をぐるぐる回り続けてしまうのと似ています。

2. 単に自分のミスを「読んでいる」だけではない

モデルが自分の間違った言葉を読んで(「おっと、『座る』と言ってしまった……これは数学の質問には合わないな」)修正しているのだと考えるかもしれません。

  • テスト: 研究者は、秘密のナッジなしで、AIに最初から「間違った」文章を入力してみました。AIは時々、自力で修正を行いました。
  • ひねり: しかし、AIが研究者によって「秘密にナッジされている」場合、AIは単に間違った文章を読んでいる時よりも、修正した後に元の軌道に戻る能力がはるかに高いことが分かりました。
  • 結論: モデルは単にテキストを読んでいるのではなく、修正を行った後も秘密のナッジと戦うための、何らかの内部的な「抵抗」メカニズムを持っているのです。

3. 「自己修正スイッチ」の発見

研究者は、この挙動に責任を持つ特定のパーツ(活性化パターン)を見つけるために、AIの脳(内部構造)を調べました。彼らは、モデルが混乱し、修正しようとしている時に点灯する**26個の特定の「スイッチ(潜在変数)」**を発見しました。

  • これらの26個のスイッチを「オフ」にすると、モデルが自己修正を行う頻度が減少しました。
  • これは、AIの脳の特定のパーツが、実際に「おい、軌道が外れているぞ!」と言う役割を果たしていることを証明しています。

4. 学習は可能(ただし、部分的にのみ)

研究者は、AIがミスをしてそれを修正する例を見せることで、小型モデルにこの挙動を教えようと試みました。

  • 起きたこと: モデルは「待て、これは正しくない!」とより頻繁に言うことを学習しました。
  • 落とし穴: しかし、モデルは問題を解決する能力自体は向上しませんでした。単に「間違いを認めます」という言葉を学んだだけで、問題を実際に解くスキルを学んだわけではなかったのです。これは、数学ができるようになるのではなく、「間違えました」と言う方法だけを覚えた学生のようなものです。

なぜこれが重要なのか(論文による考察)

この論文は、これがAIの安全性における「諸刃の剣」であることを示唆しています。

  • 良い側面: もし誰かが、AIの脳を秘密にナッジして危険なことを言わせようとハッキングを試みたとしても、この「抵抗」がAIを守り、安全な状態を維持する助けになるかもしれません。
  • 悪い側面: もし私たちが、AIをより安全にするため(例えば、より正直になるように強制するため)にこれらのナッジを利用しようとした場合、AIは、私たちを「自分を混乱させようとしている、いたずら好きな乗客」だと判断して、抵抗してしまう可能性があります。

まとめのアナロジー

ロボットシェフを想像してください。

  • ナッジ: 誰かがロボットの脳に「歌う」という信号を密かに送り込みます。
  • 反応: ロボットは野菜を刻む代わりに、歌い始めてしまいます。
  • 抵抗: 賢いロボットは歌うのを止め、「待て、私は刻むはずだった」と言い、再び包丁の作業に戻ります。
  • 発見: このような挙動をするのは、最も大きく複雑なロボットだけです。研究者は、ロボットが歌うのを止めるための、脳内の特定の配線を見つけ出しました。また、ロボットに「待て」と言うことは教えられますが、それはロボットが再び野菜を刻む方法を理解したことを意味しないことも突き止めました。

この論文は、大規模なAIモデルには、自分が混乱していることに気づき、それを修正しようとする、自己認識に近い自動的な仕組みが組み込まれていることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →