Automated Interpretability and Feature Discovery in Language Models with Agents
本論文は、大規模言語モデル内の内部特徴を反復的に仮説を精緻化しながら発見する自律型マルチエージェント・フレームワークを導入し、より鋭く、反証可能で、監査可能な説明を生成する際にワンショット手法を上回る性能を実証する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大で極めて複雑な機械(大規模言語モデル)を想像してください。その機械は物語を書き、質問に答え、問題を解決します。この機械の中には、数十億個の微小なスイッチと歯車(ニューロンと特徴)が協力して働いています。問題は、取扱説明書がないことです。機械が動いている様子は見えますが、個々の歯車が何をしているのかは正確にはわかりません。
長らく、研究者たちはある歯車を見て、それが何をするのかを推測し、「この歯車は数学用だ」といったラベルを書き留めることでこの謎を解こうとしてきました。しかし、その推測はしばしば誤っていたり、曖昧すぎたり、少し異なる例を試すとすぐに破綻したりしました。まるで、一度部品を見てその機能を推測しようとするようなものでした。
この論文は、InterpAgentという新しいシステムを紹介しています。人間が一度推測する代わりに、InterpAgent は機械の歯車が実際に何をしているのかという謎を解くために協力して働くロボット探偵チームのようなものです。
彼らがどのように行うか、簡単な比喩を用いて説明します。
2 つの探偵チーム
このシステムは、互いに会話する 2 つの専門ロボットエージェントを使用します。
「特徴発見者」(スカウト):
「スペイン語」を担当するすべての歯車を見つけたいと想像してください。スカウトはどの歯車かがわかりません。そこで、機械の「活性化空間」(歯車がどのように点灯するかのマップ)に入り、パターンを探します。統計的なマップ(GPS のようなもの)を使用して、スペイン語の単語が使われたときに一緒に点灯する歯車のクラスターを見つけます。単に推測するのではなく、数学を用いて、スペイン語の指示と英語の指示を確実に区別する歯車を見つけます。- 比喩: フランスのパーティーにしか現れない赤い帽子をかぶった一人の人を見つけるために、群衆をスキャンする探偵のようなものです。
「特徴説明者」(尋問者):
スカウトが候補となる歯車を見つけると、尋問者が引き継ぎます。その仕事は単に歯車に名前を付けることではなく、その名前をストレステストすることです。- 従来の方法: 人間は「この歯車は『技術』用だ」と言うかもしれません。
- InterpAgent の方法: 尋問者は「わかった、それが『技術』用だと考えているの?それをテストしよう」と言います。そして、その歯車をトリガーすべき12 の例(「コンピューターの修理」など)と、トリガーすべきでない12 の例(「パスタを調理する」など)を生成します。それらを機械に通して実行します。
- ひねり: もし歯車が「パスタを調理する」際にも点灯すれば、尋問者は「技術」というラベルが間違っていると知ります。そして仮説を書き換えます。「もしかして『何かを修理すること』用なのか?」と。このプロセスを繰り返し、新しいテストを生成し、結果を確認し、ラベルを洗練させ、圧力に耐えうる説明が見つかるまで続けます。
発見の「ループ」
この論文は、これが一度きりの出来事ではなく、ループであることを強調しています。
- ステップ 1: スカウトが潜在的な歯車を見つける。
- ステップ 2: 尋問者がそれが何をするのかを推測する。
- ステップ 3: 尋問者が、歯車をトリガーすべきなのにトリガーしないもの、あるいはトリガーすべきでないのにトリガーするものといった、反証例を見つけることで、自身の推測を破ろうとする。
- ステップ 4: 尋問者が失敗に基づいて推測を更新する。
- ステップ 5: 推測が確固たるものになるまで繰り返す。
これは、科学者が実験を何度も繰り返すようなものです。「このボタンは電気を点ける」という仮説を立てたが、押したらラジオがついた場合、単に「しまった」と言うのではなく、「このボタンは電源を制御している」と仮説を変え、再度テストします。
彼らが発見したもの
著者たちは、このシステムを AI の一種であるGemma-2ファミリーのモデルでテストしました。以下がその結果です。
- より優れたラベル: ロボットチームは、従来の「ワンショット」方式よりもはるかに優れた特徴のラベル付けを行いました。従来の方式は「知識」のような曖昧な答えをよく出しましたが、ロボットチームは「技術トラブルシューティングの文脈における非公式なフランス語表現」のような具体的で狭い答えを見つけました。
- 未知の発見: このシステムは、研究者が既知の歯車を説明するだけではありませんでした。スカウトは、人間が気づいていなかった新しい歯車を見つけました。例えば、「爆発物」のような有害なコンテンツに対してのみ発火する特定のニューロンや、特定のコーディングパターンなどです。
- 安全性チェック: 一つのケーススタディでは、危険なリクエストを拒否するに関する歯車が見つかりました。彼らはその歯車の働きを低下させることで機械を「誘導」でき、機械はリクエストを拒否しなくなりました。これは、その歯車が単に安全性の行動を目撃しているのではなく、実際にその安全性の行動を引き起こしていることを証明しました。
- 多義性: 時には、ロボットが単一の歯車が同時に 2 つの全く異なることをしていること(例えば、「数学の方程式」と「医学用語」の両方を処理する歯車)を見つけました。このシステムは、単一の誤ったラベルを強制するのではなく、「この歯車は混乱している。2 つの仕事をこなしている」と言うほどに賢明です。
結論
この論文は、AI の解釈を静的なラベル(見て、推測し、書き留める)ではなく、反復的な実験(推測、テスト、失敗、修正)として扱うことで、はるかに正確で信頼性の高い説明が得られると主張しています。
このシステムは、すべての推測、すべてのテスト、すべての失敗の「記録」を生成し、プロセスを透明にします。AI エージェントが厳格な科学者のように振る舞い、絶えず自身のアイデアを証明しようとする(反証しようとする)ことを許せば、機械の脳が実際にどのように機能しているのか、はるかに明確な姿が見えてくることが示されています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。