← 最新の論文
🤖 AI

Explanation Multiplicity: Circuit-Level Interpretability Evidence Does Not Survive Defensible Analytic Variation

この事前登録研究は、回路発見の結果が正当な分析的バリエーション間で極めて不安定かつ構造的に断片的であるため、メカニスティック解釈可能性によるAI規制のエビデンスは、コンプライアンス文書作成のための信頼性に欠け、フィラビリティ(再現可能な検証可能性)の基準を満たさないことを示している。

原著者: Ajay Pravin Mahale (Hochschule Trier)

公開日 2026-08-17
📖 1 分で読めます☕ さくっと読める

原著者: Ajay Pravin Mahale (Hochschule Trier)

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、懐疑的な友人に手品の手品を説明しようとしていると想像してください。あなたはこう言います。「手品師はただ杖を振っただけじゃない。ステージの下にある特定の隠されたレバーを使ったんだ」。しかし、すると友人がこう問い詰めます。「どうしてそれが『その』レバーだと言い切れるんだ? もし私がステージの別の場所を調べたり、別の懐中電灯を使ったり、あるいは別の手品師に調べさせたりしたらどうなるんだ?」もし、探し方次第で説明が全く変わってしまうとしたら、それを本当に「事実」と呼べるのでしょうか? これは、人工知能(AI)の世界における新しい研究の核心です。

「メカニスティック・インタープリタビリティ(機械論的解釈可能性)」という分野では、科学者たちはAIの脳(有名なGPT-2モデルなど)の内部を覗き込み、AIがなぜそのような挙動をするのかを司る特定の「回路」――接続の微細なネットワーク――を見つけ出そうとしています。それは、電灯がなぜ点いたのかを説明するために、家の正確な電気配線をマッピングしようとする試みに似ています。欧州連合(EU)には、もしAIが高額な融資の拒否といった重大な決定を下した場合、その企業はそのAIがどのように決定を下したのかを説明する報告書を提出しなければならないという新しい法律があります。これを行う最も明快な方法は、AIの内部回路のマップを提出することです。しかし、この論文は困難な問いを投げかけます。もし二人の賢明な専門家が、同じAIとツールを使い、かつ、回路の探し方についてわずかに異なる、かつ合理的な選択をした場合、彼らは「同じ」マップを見つけるのでしょうか? それとも、全く異なる二つの物語を見つけることになるのでしょうか?

この論文の著者は、この問題を検証するために、大規模な「選択型アドベンチャー(ゲームブック)」のような実験をセットアップすることにしました。彼らはAIを一度だけ観察したのではありません。15,840回もの異なる方法で観察したのです。彼らは、既存の公開されているツールのあらゆる設定を網羅するように、AIを分析するための7つの異なる方法からなるグリッドを作成しました。そしてこう問いかけました。「指標、シード値、回路のサイズ、あるいはテストの方法を変更した場合、AIの脳について語られる物語は同じままなのか?」

残念ながら、答えは大きな「ノー」でした。

研究者が実験を実行したところ、その証拠は極めて不安定であることが判明しました。データを分析するあらゆる方法のうち、AIの回路についての物語が全く異なるバージョンへと反転したのは、**73.2%の確率でした。つまり、もし二人の監査人が、同じAIとツールを使いながらも、設定をわずかに変えただけで、おそらく全く異なる二つの報告書を提出することになるのです。最も重要な選択肢を非常に厳格に標準化しようと試みたとしても、反転率は59.4%**までしか下がりませんでした。

これが単なる偶然ではないことを確認するため、彼らは見つけ出した回路が、単に言葉が違うだけで同じものを説明しているのではないかをチェックしました。しかし、そうではありませんでした。回路は構造的にほぼ完全に異なっており(共有しているパーツは約**4%**に過ぎません)、機能的な相関関係もありませんでした。それはまるで、一人の監査人はキッチンの配線図を見つけ、もう一人の監査人は配管の図を見つけ、そして両者が「これが家がどのように機能するかという秘密だ!」と主張しているようなものです。

また、この論文は、彼らが回路を見つけるために使用した7つの主要なツールのうちの一つが、テストしているタスクに対して全く機能せず、即座にクラッシュしたことも明らかにしました。さらに、潜在的な説明の半分以上は、テストの厳格なルールを満たさなかったために破棄されました。

では、これは将来にとって何を意味するのでしょうか? 著者は、AIが壊れているとか、理解できないと言っているわけではありません。彼らが言いたいのは、現在私たちが持っている「AIがどのように機能するかを証明するための領収書(エビデビンス)」は、政府の規制当局に提出できるレベルには達していないということです。もしあなたが今日、裁判官に回路図を提出したとして、別の裁判官が同じツールを使いながらも、わずかに異なる手法を用いた場合、その裁判官はあなたのマップを退け、「これは正しい説明ではない」と言うかもしれません。現状の証拠は、法的な文書として信頼できるというテストに合格できていないのです。この研究は、これらのAIの説明が裁判や安全確認において信頼されるようになる前に、誰が懐中電灯を持っていてもマップが安定するようにする方法を見つけ出す必要があることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →