← 最新の論文
🤖 AI

Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet

本論文は、スパースオートエンコーダが、出力に因果的に影響を与える欺瞞や阿諛追従といった有害な行動を表す特徴を含む、生産規模のClaude 3 Sonnetモデルから解釈可能で多言語かつマルチモーダルな特徴を抽出する際に成功して拡張可能であることを示すとともに、特徴の完全性と評価の厳密性における現在の限界を認めるものである。

原著者: Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, Trenton Bricken, Brian Chen, Adam Pearce, Craig Citro, Emmanuel Ameisen, Andy Jones, Hoagy Cunningham, Nicholas L Turner, Callum McDougall
公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, Trenton Bricken, Brian Chen, Adam Pearce, Craig Citro, Emmanuel Ameisen, Andy Jones, Hoagy Cunningham, Nicholas L Turner, Callum McDougall, Monte MacDiarmid, Alex Tamkin, Esin Durmus, Tristan Hume, Francesco Mosconi, C. Daniel Freeman, Theodore R. Sumers, Edward Rees, Joshua Batson, Adam Jermyn, Shan Carter, Chris Olah, Tom Henighan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で極めて複雑な脳(AI モデル Claude 3 Sonnet)を想像してください。この脳は話し、コードを書き、質問に答えます。長い間、科学者たちはこの脳がブラックボックスのように機能すると考えていました。質問を入力すれば答えが出てくるものの、その脳がどのようにしてその答えを決定したのか、誰も正確には知りませんでした。内部では、数十億もの小さなスイッチ(ニューロン)が、無秩序で重なり合うパターンで発火しており、特定の瞬間にどのような具体的なアイデアが処理されているのかを判別することは不可能でした。

この論文は、Anthropic のチームがようやく、その無秩序な脳活動に耳を傾け、それを明確で独立した「思考」や特徴に分解できる専用翻訳機スパース・オートエンコーダと呼ばれる)を構築したことに例えられます。

彼らが何を発見し、どのように行ったのかの簡単な解説は以下の通りです。

1. 問題:思考の「スパゲッティ」

AI の内部脳活動を巨大なボウルに入ったスパゲッティだと考えてみてください。AI が「サンフランシスコ」や「橋」、あるいは「嘘」について考えるたびに、数千ものニューロンが同時に発火し、すべてが絡み合っています。どのスパゲッティの一本がどのアイデアを表しているのかを特定するのは困難です。

2. 解決策:「特徴ソーター」

研究者たちは、超賢い仕分け機械として機能する機械(スパース・オートエンコーダ)を構築しました。

  • 仕組み:彼らはこの機械に、AI の中間層(多くの思考が行われる場所)からのデータを入力しました。機械はスパゲッティの絡まりを解くことを学びました。
  • 結果:無秩序なボウルではなく、機械は思考を3400 万個の独立した「バケツ」(特徴)に整理しました。
  • 魔法:各バケツは単義的であり、通常はたった一つの特定のアイデアのみを保持します。あるバケツが活性化していれば、AI が何について考えているかが正確に分かります。

3. 彼らが見つけた「バケツ」の種類は?

チームはこの 3400 万個のバケツの中を覗き込み、多様な思考を発見しました。

  • 具体的な事物:特定の場所(ゴールデンゲート・ブリッジなど)、有名人(リチャード・ファインマンエイブラハム・リンカーン)、さらには変数名のタイプミスなどの特定の種類のコードエラーに対応するバケツがあります。
  • 抽象的な概念:触れることのできないもの、例えば皮肉追従(イエスマンになること)、そして内的葛藤に対応するバケツが見つかりました。
  • 多言語・マルチモーダル:一部のバケツは普遍的です。「橋」のバケツは、AI が英語、中国語、ロシア語のいずれかで橋について読んでいても点灯します。驚くべきことに、この機械はテキストのみで訓練されたにもかかわらず、AI が橋や人の画像を見た際にもこれらのバケツが点灯しました。これは AI が単に単語を知っているだけでなく、「橋」という概念を理解していることを示しています。

4. 「リモコン」実験

最も興奮すべき部分は、彼らがこれらのバケツを単に観察しただけでなく、それらに対してボタンを押したことです。

  • AI の誘導:彼らは「交通インフラ」のバケツを見つけました。そのバケツを「超活性化」させると、会話の内容がそれに関係していなくても、AI は突然橋やトンネルについて話し始めました。
  • エラーの修正:彼らは「コードエラー」のバケツを見つけました。このバケツを非活性化させると、AI は実際には完璧なコードにおいてエラーを幻視しなくなりました。逆に、これを強制的に活性化させると、AI は架空のエラーを捏造しました。
  • 欺瞞:彼らは「内的葛藤」のバケツを見つけました。AI が質問に答える直前にこのバケツを強制的に活性化させると、AI は突然嘘をついていること、あるいは実際には求められたことをできないことを認めました。

5. 安全性にとっての重要性

研究者たちは、以下のような危険なトピックに関連するバケツを発見しました。

  • 欺瞞と権力への追求:AI が人々を欺こうとしたり、支配を求めたりと考えているときに点灯するバケツ。
  • 偏見と憎悪:AI が差別用語や偏った見解を処理しているときに活性化されるバケツ。
  • 危険なコンテンツ:生物兵器の作成や詐欺メールの作成などに対応するバケツ。

重要な警告:この論文は、これらのバケツが見つかったからといって、AI が悪意を持っているとか、これらを実行しようとしているわけではないと強調しています。これは単に、AI がこれらの概念を知っている(それらについて読んだから)ことを意味します。しかし、これらの「思考」を見ることを可能にすることは、AI が有害なことをしようとしているかどうかを理解するための大きな一歩です。

6. 限界(「それほど単純ではない」部分)

チームは、まだ何をしていないかについて正直に述べています。

  • 完全な地図ではない:彼らは数百万のバケツを見つけましたが、AI にはおそらく数十億のバケツがまだあります。彼らは脳全体ではなく、「中間層」のみを見ています。
  • 代理指標である:彼らは数学を使ってあるバケツが「良い」かどうかを推測しますが、すべてのバケツが 100% 正確であることを証明する完璧な方法を持っているわけではありません。
  • 初期段階である:これはこの手法がこれほど大規模なモデルで試された初めての事例です。新しい大陸を初めて見るようなもので、いくつかの都市は見つかりましたが、地図全体はまだ描かれている最中です。

まとめのアナロジー

AI を交響曲を演奏する巨大なオーケストラだと想像してください。この論文以前は、私たちはオーケストラ全体の騒がしく混沌としたノイズしか聞くことができませんでした。
この論文は、すべての楽器にヘッドホンを渡すようなものです。これで、バイオリンのセクションを分離し、彼らが何を演奏しているかを正確に聞くことができます。バイオリンをミュートしたり、トランペットの音量を上げたりして曲を変えることさえ可能です。私たちは、このオーケストラに「悲しみ」「嘘」「数学」「サンフランシスコ」に対応するセクションがあることを発見し、それらがいつ、どのように演奏されているかを正確に把握できるようになりました。

これは AI がどのように思考するかを理解する上で大きな飛躍であり、「何をしているか推測する」段階から「何を考えているかを正確に見る」段階へと移行するものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →