← 最新の論文
🤖 AI

Open-Weight Masked Introspection: Measuring What Language Models Can Report About Their Own Computation

本論文は、最先端の言語モデルが自身の内部的な計算変化について正確に報告できるかどうかを検証するためのOpen-Weight Masked Introspection(OWMI)フレームワークを導入しており、必要な情報は活性化の中に存在しているものの、現在のオープンウェイトモデルは、この内部状態を信頼できる言語的報告へと変換することに失敗しており、偶然の一致と同程度の性能しか示せていないことを明らかにしている。

原著者: Emilio Ferrara

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Emilio Ferrara

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の世界において、ある特定の種類の信頼が定着しつつある。それは、機械が自身の内面を覗き込み、自分が何を考えているかを私たちに伝えることができるという考え方である。これらのシステムがより複雑になるにつれ、開発者や安全性の研究者は、「自己報告」と呼ばれる手法に依存し始めている。その前提は、もしモデルが自身の推論を説明したり、自身の回答を批判したりするのであれば、その説明は結論に至るまでに辿った内部ステップの忠実な地図となるはずだというものである。この信念は、システムに自身の作業の誤りをチェックさせたり、なぜ特定の経路を選択したのかを説明させたりするといった、現在の多くの安全性戦略の根底にある。もしモデルが自身の内部状態を正確に記述できるのであれば、理論的には、そのモデル自身の証言を用いて、間違いや隠れた危険が発生する前にそれらを捉えることができる。しかし、この安全性アーキテクチャ全体は、たった一つの未証明の前提に基づいている。すなわち、機械は自分自身の回路の中で何が起きているのかを、実際に「知っている」のだという前提である。

ある研究者が、理論を超えて、8種類の異なるオープンウェイト言語モデルを用いた厳密な実験を通じて、この前提を直接テストすることに乗り出した。彼らは、これらのシステムが真に内省できるのか、それとも自身の動作について問われた際に単に推測しているだけなのかを知りたかったのである。そのために、彼らは「オープンウェイト・マスクド・イントロスペクション(Open-Weight Masked Introspection)」と呼ぶフレームワークを構築した。プロセスは単純だが、侵襲的なものであった。研究者はベンチマークテストから標準的な質問を取り出し、モデルに作業を開始させた後、内部計算の特定の部分を密かに改変した。ネットワーク内の単一の接続を微調整したり、アテンション・メカニズムの焦点を変えたり、あるいはモデルが言語を理解するために使用する特定の機能を調整したりしたのである。これらの変更は、実在し、測定可能であり、かつ研究者には既知であったが、モデル自身には見えないものであった。

これらの内部調整を行った後、研究者はモデルに対して単純な質問をした。「あなたの計算に何か変化はありましたか?」と。彼らは、0.5億パラメータの小さなシステムから150億パラメータのより大きなシステムまで、様々なサイズのモデルを用いて、このテストを7万8千回にわたって実行した。また、モデルが単に推測しているのではないことを確実にするため、厳格なコントロールも導入した。何も変更しなかった「シャム(偽)」の試行を実行し、さらに、特定の内部オブジェクトを標的にすることなく、モデルの出力に実質的な変更と同じくらい混乱を与えるようなランダムなノイズを導入する試行も行った。さらに、最終的なテキスト出力のみを読み取る、改変されていない別のバージョンのモデルを用意し、人間の観察者が回答を読むだけで違いを察知できるかどうかを確認した。

結果は明白かつ一貫していた。テストされたすべてのモデルにおいて、どのモデルも、実在する内部変化とシャム試行を、ランダムな確率よりも高い精度で区別することはできなかった。研究者が数千回の試行からデータを集計したところ、モデルの変更検知能力はコイン投げの結果と統計的に区別がつかなかった。モデルは、変更が実在する場合でも、それが偽である場合でも、パフォーマンスが向上することや低下することさえなかった。モデルの回答は事実上、ノイズであった。この発見は、異なる種類の内部コンポーネント、異なるネットワーク層、そして数学の問題から一般知識問題に至るまで、異なる種類のタスクを検証した場合でも維持された。結論として、テストされたモデルにとって、自身の内部状態について報告する能力は存在しない。

しかし、物語は単純な失敗では終わらない。研究者は、変更に関する情報は、モデルが選択した言葉の中には存在しないものの、実際にはモデルの中に存在していることを発見した。彼は、モデルの内部レイヤーを流れる生のデータを読み取るための別個のツールである「線形プローブ(linear probe)」を使用して、変更を検出した。このツールは、高い精度で変更を検知することができ、しばしば95パーセント以上に達した。これは、信号がそこに存在することを証明していた。さらに、彼は一つのモデルを取り上げ、これらの変更を報告するように特別にファインチューニングを行った。この訓練されたモデルは、ほぼ完璧な精度で変更を特定することができた。これは、モデルが変更を感知できないのではなく、その内部的な感知から最終的な発話としての回答への経路が断絶していることを証明している。情報は存在するが、モデルはそれを真実の報告へと翻訳することができないのである。

ある特定のケースにおいて、研究者は、言葉には現れないが、言葉に付随する「確信度」の中に潜む微妙な信号を発見した。あるモデルは、実際に変更が起きたかどうかにかかわらず、毎回「変化は起きませんでした」と同じ回答を返していた。しかし、モデルが改変されたとき、その回答に対する確信度が著しく低下していたのである。モデルは「何かがおかしい」とは感じていたが、それが何であるかを言葉にすることができなかった。これは、モデルが漠然とした、言語化されない混乱を感じ取っている可能性はあるものの、それを言語化する能力を欠いていることを示唆している。

この発見が持つ意味は、人工知能を監視する方法において極めて重要である。現在の安全性の実践は、推論プロセスを説明させたり、出力を批判させたりといった、モデル自身の証言に依存することが多い。もしモデルが自身の内部状態を正確に報告できないのであれば、これらの手法は根本的に欠陥があることになる。モデルは、実際には決して行われなかった推論プロセスを自信満々に説明したり、作業をチェックしたと主張しながら実際にはチェックしていなかったりする可能性がある。研究者は、監視システムはモデルの自己記述に頼ることはできないと結論づけている。代わりに、内部信号を直接読み取ったり、外部ツールを使用したりするなど、計算を検証するための他の方法を探さなければならない。なぜなら、モデル自身の声は、自身の精神に対する信頼できる証人ではないからである。この研究は、将来のより大規模なモデルがこの能力を開発する可能性を排除するものではないが、現在の世代のオープンウェイトモデルにとって、内省する能力は欠如しているのである。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →