← 最新の論文
🤖 machine learning

Building Better Activation Oracles

本論文は、ハルシネーションと曖昧さに対処するために4つの学習上の改善策を導入することでActivation Oracle(AO)を強化し、スケーラブルでエンドツーエンドの解釈可能性を前進させるための初の包括的な評価スイートであるAObenchを公開するものである。

原著者: Jan Bauer, Celeste De Schamphelaere, Adam Karvonen, Niclas Luick, Neel Nanda

公開日 2026-06-03
📖 1 分で読めます☕ さくっと読める

原著者: Jan Bauer, Celeste De Schamphelaere, Adam Karvonen, Niclas Luick, Neel Nanda

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。物語を書いたり、数学の問題を解いたり、質問に答えたりする超スマートなロボット(大規模言語モデル)がいるとします。しかし、その「脳」の内部には、人間には理解できない言語で、数十億もの微細な電気信号が発火しています。これらの信号は**アクティベーション(活性化)**と呼ばれます。

長い間、私たちはそのロボットがなぜ特定の決定を下したのか、その理由を知るために、その脳の中を覗き見たいと考えてきました。そこで登場するのが、**アクティベーション・オラクル(AO)**です。AOを、ロボットの「通訳者」あるいは「伝記作家」だと考えてください。あなたは通訳者にロボットの電気信号を見せ、「この時、あなたは何を考えていたのですか?」と問いかけます。すると、通訳者はその信号を、分かりやすい英語(言葉)に翻訳しようと試みるのです。

しかし、従来の通訳者には大きな問題がありました。

  1. 曖昧だった: 「『リンゴ』という単語について考えていました」と言う代わりに、「文章の概念について考えていました」と言ってしまうようなものです。(これではあまり役に立ちません!)
  2. 幻覚(ハルシネーション)を起こした: 信号の中に存在しない詳細をでっち上げてしまいました。
  3. 「ズル」をしていた: 時には、信号を実際には読んでおらず、信号の前後にある「言葉」だけを見て、その言葉に基づいて答えを推測していました。これは「テキスト反転(text inversion)」と呼ばれます。

この論文の著者たちは、より優れた通訳者を作りたいと考えました。彼らは単にコードを微調整したのではなく、4つの特定の方法でトレーニングプロセスを再構築しました。ここでは、日常的な例えを用いて、その方法を説明します。

1. より良い教科書(対話型データセット)

問題点: 旧式の通訳者は、複雑なプロンプトに関するトリッキーな質問を含む教科書(LatentQA)で訓練されていました。回答は、信号を見るだけでは到達不可能なものであることが多く、そのため通訳者は推測したり、曖昧な回答をしたりするようになってしまいました。
解決策: 著者たちは新しい教科書を作成しました。彼らはロボット自身の「思考プロセス(内部推論)」を取り出し、それを半分に切り分け、別のAIに対して「前半部分の信号を見なければ答えられないような、後半部分に関する質問」を書かせました。
例え: 地図の読み方を生徒に教えている場面を想像してください。古い方法では、地図と「宝物はどこですか?」という質問を与えますが、地図の凡例(レジェンド)は見せていません。新しい方法では、地図上の特定のランドマークを示し、「ここでの地形はどうなっていますか?」と尋ねます。これにより、通訳者は文脈から推測するのではなく、実際に信号を見ることが強制されます。
結果: これが最大の改善点でした。新しい通訳者は非常に具体的になり、曖昧さがなくなりました。

2. より多くの層を見る(マルチレイヤー・フィード)

問題点: 旧式の通訳者は、ロボットの脳の特定の「フロア(層)」(深さの約25%または50%付近)しか見ていませんでした。しかし、ロボットの「思考」は多くのフロアに分散しています。
解決策: 著者たちは、最も興味深い「思考」は60〜80%の地点あたりで発生することに気づきました。そこで、単一のフロアを見る代わりに、5つの連続するフロアからの信号を一度に通訳者に送り込むようにしました。
例え: もし映画を理解しようとしているなら、たった1フレーム(1つの層)を見るだけでは、ほとんど何も分かりません。5フレーム(5つの層)の短いクリップを見れば、動きや文脈が分かり、何が起きているかを理解できます。
結果: これにより、通訳者は、異なるモデルを比較する際も含め、ロボットの思考という「映画」をより良く理解できるようになりました。

3. 「ライブ」データでの訓練(オンポリシー・ロールアウト)

問題点: 旧式の通訳者は、古い静的なデータ(ロボットが存在する前に書かれた図書館の本のようなもの)で訓練されていました。それは、50年前の街の地図を使ってドライバーを教えているようなものです。
解決策: 彼らは、ロボットが実際に考えている最中に生成されたデータを用いて、通訳者の訓練を開始しました。
例例: 通訳者に、何年も前に終わった劇の台本を使って教えるのではなく、劇が行われている最中の観客席に通訳者を座らせるようなものです。これにより、通訳者は「過去にどう考えていたか」ではなく、「今まさにどのように考えているか」を学習することができます。
結果: これは少しの効果でしたが、魔法の杖ではありませんでした。しかし、ロボットの現在の状態を理解する能力をわずかに向上させました。

4. 音量を上げる(注入強度)

問題点: 通訳者に信号を見せる際、その信号の「音量(または強度)」が低すぎました。通訳者は、騒がしい部屋の中でささやき声を聴こうとしているような状態でした。
解決策: 彼らは、通訳者に送り込む信号の「音量」を上げました。
例え: 騒がしいコンサート会場で友人の声を聞こうとしている場面を想像してください。もしメモを渡すだけなら、彼らは聞き逃してしまうかもしれません。もし、そのメモを叫んで伝える(強度を高める)なら、彼らはより正確に聞き取れるようになります。
結果: これは全体的なスコアを大きく変えることはありませんでしたが、**幻覚(ハルシネーション)**を大幅に減少させました。実在する信号がより大きく明確になったため、通訳者が事実をでっち上げる可能性が低くなったのです。

最終的な結果:AObench

新しい通訳者が優れていることを証明するために、著者たちはAObenchと呼ばれる新しいテストを作成しました。これは、これらの通訳者に特化した「運転免許試験」のようなものです。これは以下の点をチェックします:

  • 曖昧さ: 通訳者は具体的な答えを出しているか、それともふわっとした答えを出しているか?
  • 幻覚: 通訳者は事実をでっち上げているか?

判定:
これら4つの修正を組み合わせることで、新しい通訳者は旧式のものよりもはるかに優れています

  • 曖昧さが少ない(具体的な回答を出す)。
  • 幻覚が少ない(より頻繁に真実を語る)。
  • 指示に従う能力が高い

著者たちは、通訳者がまだ完璧ではないことも認めていますが、彼らは強固な基礎を築きました。通訳者に優れた訓練データを与え、脳の活動のより広い範囲を見せ、音量を上げることで、通訳者がAIモデルの思考プロセスを知るための、より信頼できる窓口になることを彼らは示しました。

要約すると: 彼らは、推測ばかりして曖昧だった通訳者を、実際に耳を傾け、全体像を見つめ、真実を語る通訳者へと変えたのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →