Position: Mechanistic Interpretability Must Disclose Identification Assumptions for Causal Claims
本論文は、機械的解釈可能性研究が、必要な仮定を明示的に述べることに失敗することで、検証指標と因果的識別を混同することが頻繁にあると主張し、著者らがその識別戦略と因果主張の頑健性を明確に述べることを要求する新たな開示規範を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
複雑な機械(AI)がなぜそのような行動をとるのかを突き止めようとする探偵になったと想像してください。あなたは、特定のギア(「回路」や「特徴」)が特定の行動の原因だと疑っています。そのギアを取り外すと、機械は動作を停止します。あなたは「アハ!そのギアが原因だ!」と宣言します。
この論文は、AI の「メカニズム的解釈可能性」の分野において、研究者たちが証拠のルールに従うことなく、あまりにも頻繁にこのような宣言を行っていることを主張しています。彼らは「原因」を見つけたと主張していますが、なぜその実験が単なる偶然ではなく、真の原因を証明するものなのかを説明していません。
以下に、この論文の主張を単純なアナロジーを用いて解説します。
1. 核心的な問題:「検証」は「同定」ではない
この論文は、以下の 2 つの概念の間に決定的な区別を設けています。
- 検証(「何」): 「ギアを取り外したら、機械は止まった」。これは事実です。成功したテストです。
- 同定(「なぜ」): 「そのギアだけが機械を停止させた原因であり、隠れたバックアップギアや、私が取り外した行為による副作用ではないと、私は確信している」。
アナロジー:
医師になったと想像してください。患者に薬を投与すると、熱が下がりました。
- 検証: 「薬を投与した後、熱が下がった」。これは事実です。
- 同定: 「薬が熱を下げる原因となった」。これには仮定が必要です。
熱が下がったのは、熱が自然に下がる時間帯だったからかもしれません。同時に患者が水を飲んだからかもしれません。薬は効いておらず、熱はもともと下がろうとしていたのかもしれません。
AI 研究において、論文はしばしば「AI のこの部分を変更したら、行動も変化した。したがって、この部分が原因だ」と述べています。しかし、この論文は、研究者たちが「他のいかなる説明もその変化を引き起こし得ない」ことを証明するステップを省略していると主張しています。彼らは「熱が下がったこと(検証)」を、患者が自然な発熱サイクルを持っていたかどうかを確認もせず、「薬が効いたこと(同定)」の証拠として扱っているのです。
2. 「隠れた仮定」の罠
研究者が原因を見つけたと主張するたびに、彼らは見えない仮定の上に立っています。この論文は、これらの仮定が現在「隠されたまま」であると述べています。
アナロジー:
魔法使いが「杖を振ったからウサギが消えた」と主張すると想像してください。
- 隠れた仮定: 「ウサギは裏口から飛び出していなかった」。
- 隠れた仮定: 「私が杖を振る前、ウサギはすでにいなくなっていなかった」。
AI の論文における「マジックトリック」とは、以下のようなものです。
- アクティベーション・パッチング: 「AI の脳のこの部分を入れ替えた。行動が変化した」。
- 隠れた仮定: 「偶然、この仕事も行う眠っているバックアップシステムを起動させてはいなかった」。
- スパース・オートエンコーダー(SAE): 「AI 内で『誠実さ』という概念を表す特定の特徴を見つけた」。
- 隠れた仮定: 「この特徴は、他のものの汚れた混ざり合いではなく、『誠実さ』のように見える偶然の結果でもなく、独自の独立した構成要素である」。
この論文は、10 の主要な論文を監査し(さらに 30 の論文も確認し)、これらの隠れた仮定をリストアップする専用セクションを持っている論文がゼロであることを発見しました。彼らは単にマジックトリック(結果)を見せ、「見て、うまくいった!」と言い、宇宙がどのようなルールに従うと仮定しているかを認めることなく終わらせています。
3. 「置換」エラー
この論文は、現在の習慣を「検証指標の置換(Validation Metric Substitution)」と呼んでいます。
アナロジー:
自動車整備士が「エンジンが掛かったから、エンジンを修理した」と言うと想像してください。
- エラー: 整備士は、結果(エンジンが掛かった)を証拠(どの部品を修理したか正確に知っており、他にエンジンが掛かる要因はなかった)に置き換えています。
- 現実: エンジンが掛かったのは、バッテリーが自然に充電されたからかもしれません。あるいは、整備士がキーをぶつけたからかもしれません。あるいは、最初からエンジンに問題がなかったのかもしれません。
AI の論文では、研究者たちは「忠実度(説明がモデルに合致しているか)」や「完全性(すべての部品を見つけられたか)」といった指標を報告します。この論文は、これらは単に「エンジンが掛かった瞬間」に過ぎないと主張します。これらは有益ですが、それらを証拠とする仮定を明記しない限り、因果関係の証明にはなりません。
4. 提案される解決策:「開示プロトコル」
著者は、この分野が計量経済学(経済データの研究)からルールを借用すべきだと提案しています。経済学では、「X が Y の原因である」と主張する場合、以下を明示的に述べる必要があります。
- 主張すること: 「X が Y の原因であると主張する」。
- 戦略: 「証明するために手法 Z を使用する」。
- 仮定: 「[条件 A] と [条件 B] が真であると仮定する」。
- ストレステスト: 「[条件 A] が偽であれば、結論は崩れる。それが真かどうかをどうテストしたかを示す」。
アナロジー:
単に「薬が効いた」と言うのではなく、医師は以下のような報告書を書かねばなりません。
- 「薬が熱を下げる原因となったと主張する」。
- 「患者が他の薬を服用しなかったと仮定する」。
- 「熱が自然に下がりかけていなかったと仮定する」。
- 「もし患者が他の薬を服用していたなら、私たちの結論は誤りである。彼らが服用しなかったことを示すデータはこちらだ」。
5. 監査で判明したこと
著者は、この分野の 10 の主要な論文(回路発見やオートエンコーダーなど異なる手法を網羅)を調べ、さらに 30 の論文を確認しました。
- 結果: 30 件中0 件の論文が、同定仮定をリストアップする専用セクションを持っていた。
- 結果: ほとんどの論文(厳格さによって 30 件中 19 から 26 件)は、仮定が真であることを証明する代わりに、「検証指標」(AI が期待通りに振る舞ったなど)を代用していた。
- 結果: 最も慎重な論文でさえ、他者の研究の誤りを発見したものであっても、その誤りを見つけるために使用した仮定を明示的にリストアップしていなかった。
まとめ
この論文は、誠実さと明確さへの呼びかけです。これは AI 研究が間違っていると言っているのではありません。AI 研究は不完全だと言っているのです。
現在、研究者たちは「見て、原因を見つけた!」と言っています。
この論文は、「その主張をするためにどのようなルールを仮定しているのか、立ち止まって教えてください。ルールを教えない限り、あなたの『原因』が真実なのか、単なる幸運な推測なのかは分からない」と言っています。
この論文は、この分野に「見て、私たちのマジックトリックがいかに素晴らしいか」から、「トリックがどのように機能するか、そしてなぜそれがトリックではないと知っているのか」を正確に示すことへの移行を求めています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。