← 最新の論文
🤖 machine learning

Would this change your answer? Evaluating Explanations of LLM Behavior In The Wild with Counterfactual Experiments

本論文は、反事実的実験を用いて、説明手法が関連する入力に対してモデルの挙動を正確に予測できるかどうかを評価することで、現在の解釈可能性技術には予測上の利点がないことを明らかにし、かつCHIVEによって生成されたデータでの学習が汎化性能を向上させることを示す、LLMの説明手法を評価・改善するためのエージェンティックなパイプラインであるCHIVEを導入するものである。

原著者: Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Adam Karvonen, Euan Ong, Subhash Kantamneni, Samuel Marks

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この研究がどのような内容であるかを理解するために、ある人がなぜ特定の選択をしたのかを理解しようとしている場面を想像してみてください。その人に尋ねると、何らかの理由を答えるかもしれませんが、その理由は推測であったり、正当化であったり、あるいは単に間違っていたりするかもしれません。人工知能の世界において、研究者たちは同様の課題に直面しています。大規模言語モデルは、コードを書いたり、物語を語ったり、問題を解決したりできる強力なツールですが、同時に「ブラックボックス」でもあります。私たちは彼らが何を言ったかを見ることはできますが、それらの言葉を生み出すために回転している内部の歯車を容易に目にすることはできません。科学者たちは、モデルの挙動の真の原因を見つけ出そうと、長年、これらの歯車の中を覗き見るためのツールを構築しようとしてきました。目標は、モデルが自身の推論について正直であるのか、それとも異なる動機を隠しているのかを知ることです。問題は、「どのようにすれば、ある説明が本当に優れたものであるかを知ることができるのか?」ということです。もし研究者が「モデルが特定の単語によって混乱したために間違いを犯した」と言ったとしたら、それが真実であるかどうかをどのようにテストできるのでしょうか。

Anthropicの研究チームは、単なる推測を超えて「もし〜だったら」という領域へと踏み込むことで、これをテストすることに決めました。モデルに自分自身を説明させるのではなく、モデルの環境を能動的に変化させて、その説明が成り立つかどうかを確認するシステムを構築したのです。彼らはこのプロセスを「反事実的調査(counterfactual investigation)」と呼んでいます。その仕組みはこうです。もし、ある特定の単語のせいでモデルがエラーを起こしたと信じるならば、その単語を変更し、エラーが消えるかどうかを確認します。もし単語を変えたことでエラーが消失したなら、その説明はおそらく正しかったと言えます。もしエラーが変わらずに残ったなら、その説明は間違っていたことになります。この手法は、漠かりな理論をテスト可能な事実に変えるのです。研究者たちは、AIモデルの内部を見るために科学者が現在使用しているツールが、実際にこうした変化を予測するのに役立つのか、そしてモデル自身に自身の挙動をより良く理解させる方法があるのかどうかを確かめたいと考えました。

これを行うために、研究者たちはCHIVEと呼ばれる新しい自動パイプラインを作成しました。このシステムは、疲れを知らない調査官のように機能します。まず、ターゲットとなるAIモデルに対して、現実世界の会話から数千もの質問を投げかけ、モデルが予期せぬ、あるいは奇妙な行動をとる瞬間を探し出します。一度奇妙な挙動を見つけると、システムはそこで止まりません。元の質問を取り上げ、名前を変える、文章を削除する、あるいは単語を入れ替えるといった、小さく具体的な編集を施し、モデルに新しい質問を再度投げかけます。これを数十回繰り返し、元の質問の場合と編集後の質問の場合で、奇ло奇妙な挙動がどの程度の頻度で発生するかを確認します。もし特定の単語を変えることで奇妙な挙動が消えたなら、システムはその単語が原因であった証拠として記録します。このプロセスにより、原因が既知であり、実験自体によって検証された高品質な例が数多く生成されます。

研究者たちは、この膨大な検証済み事例のコレクションを使用して、2つの主要なアイデアをテストしました。第一に、AIモデルを解釈するために科学者が用いる既存のツールが、実際に役立つかどうかを調べました。これらのツールは、医師が脳スキャンを読み取るように、モデルの内部活動を読み取り、回答の背後にある「思考」を見つけ出すように設計されています。研究者たちは、これらのツールを賢いコンピュータ・エージェントに与え、プロンプトへの特定の変更がモデルの挙動を変化させるかどうかを予測させました。彼らは、これらのツールがエージェントに大きなアドバンテージを与え、単純な会話の読み取りでは見落としてしまう隠れた原因を見せると予想していました。驚いたことに、ツールは全く役に立ちませんでした。エージェントは、会話のテキストのみを持っていた場合と比較して、内部を読み取るツールを使用しても同等のパフォーマンスを示すか、時にはそれ以下のパフォーマンスしか示しませんでした。ツールは、特定の入力と結果としての挙動との結びつきを明らかにすることに失敗し、エージェントは以前と同様に暗闇に取り残されたままとなりました。

第二に、研究者たちは、収集したデータを用いて、モデル自身に自身の挙動を予測させることを教えられるかどうかを問い直しました。彼らはターゲットとなるモデルを取り出し、実行した数千の実験データを用いて学習を行いました。学習タスクは単純でした。会話と提案された変更を示し、その変更によって奇妙な挙動が止まるかどうかを推測させるのです。ここでの結果は、はるかに有望なものでした。このトレーニングを受けたモデルは、これらの変化の結果を予測することが大幅に上手くなりました。彼らは、以前は気づいていなかった自身の挙動におけるパターンを認識することを学んだのです。この改善は、トレーニング中に一度も見せていない全く新しい種類の質問やシナリオでテストした場合でも、維持されました。モデルは、自身の行動が入力によってどのように影響を受けるかという一般的なスキルを習得したのです。

研究はまた、モデルが単に答えを暗記しているだけなのか、それとも自身についてのより深い内部的な理解を得たのかについても探求しました。これをテストするために、研究者は一方のモデルを自身の挙動に関するデータで、もう一方のモデルを別のモデルの挙動に関するデータで学習させました。もし最初のモデルが自身の内部状態に対する特別なプライベートなアクセス権を持っていたならば、二番目のモデルよりも優れたパフォーマンスを示すはずです。しかし、両方のモデルは同等のパフォーマンスを示しました。このことは、モデルが自身の内部に関する隠された特権的な知識にアクセスしていたのではないことを示唆しています。代わりに、彼らは示されたデータから因果関係のパターンを認識することを学んでいたのです。まるで例題を勉強することで主題を学ぶ学生のように。

この研究結果は、この分野が現在どのような状況にあるかという明確な姿を提示しています。より単純で制御されたテストでは有望な成果を示してきたAIモデルの内部を見るための現在のツールは、現実世界の会話の中で起こる乱雑で複雑な挙動に適用されると、機能しないようです。それらは、モデルがなぜそのような行動をとったのかを説明する「アハ体験(ひらめき)」を提供することに失敗しています。一方で、本研究は、モデルが環境の変化に対する自身の反応を予測することを、より上手くなるよう訓練できることを示しています。これは、AIの挙動を理解するための道筋は、機械の内部を見るためのより優れた顕微鏡を作ることではなく、むしろ、自身の行動のパターンを認識するように機械を訓練することにあるかもしれない、ということを示唆しています。研究者たちはすべてのデータとコードを公開しており、他の人々がこの研究を継続できる新たな基盤を提供しています。これにより、将来のAIの挙動に関する説明が、単に私たちが「こうなっているのではないか」と考えることではなく、世界が変化したときに実際に何が起こるかに基づいたものになることを保証しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →