← 最新の論文
🤖 machine learning

IG-Lens: Exact Additive Probability Attribution Across Transformer Layers via Telescoping Integrated Gradients

本論文は、単一のパスに沿ってテレスコーピング(入れ子状)のIntegrated Gradientsを適用することにより、トランスフォーマー層全体にわたる厳密かつ加法的な確率属性付けを実現する新しい手法であるIG-Lensを紹介するものであり、これにより、既存のロジットベースまたは非加法的な読み出しツールの非線形性とバイアスの限界を克服しつつ、離散化誤差のない完全性を保証する。

原著者: Duc Anh Nguyen

公開日 2026-06-30
📖 1 分で読めます☕ さくっと読める

原著者: Duc Anh Nguyen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(このチャットを動かしているもののような)を、アイデアという「原材料」が最下層に入り、「予測された単語」という「完成品」が最上層から出てくる多層構造の工場として想像してみてください。

長い間、研究者たちは次のような単純な問いに答えようとしてきました。「この工場において、まさにどのフロアで『ハノイ』と言うという決定が下されたのか?」

既存のツールは、この問いに答えようと試みてきましたが、それらはまるで「仕事のできない会計士」のようでした。

  • あるツールは、各フロアを見て工場の「確信度」を推測しますが、その推測値の合計は100%になりません。例えば、フロア1が40%、フロア2が60%、フロア3が80%の確信を持っていると言った場合、合計が180%になってしまい、意味をなしません。
  • 別のツールは、数値がパーセンテージに変換される前の「生の数値(ロジット)」を見ます。しかし、生の数値を確率に変換することは、ケーキを焼くことに似ています。小麦粉と卵を別々に足し合わせても、完成したケーキの重さにはなりません(「ソフトマックス」と呼ばれる数学的プロセスによって、すべてが変わってしまうからです)。
  • 第三のグループのツールは、各フロアで行われた「作業量」を測定しようとしますが、それぞれ異なる出発点を基準に測定しているため、その数値は積み上げて全体の総作業量を算出することができません。

IG-Lensの登場:完璧な会計士

この論文では、この工場における**「完璧な会計士」**として機能する新しい手法、IG-Lensを紹介しています。これは「伸縮式望遠鏡(テレスコープ)」のトリック(伸びたり縮んだりするもの)を用いることで、この問題を解決します。

その仕組みを簡単に説明すると、以下の通りです。

1. 「一度限りのスナップショット」ルール
単語が工場全体を通り抜け、あらゆる局面で他の単語と混ざり合ってしまうのを待つのではなく、IG-Lensは特定のフロアにおける単語の状態の「スナップショット」を取ります。そしてこう問いかけます。「もし、フロア10の状態を取り出し、それを最終的な『仕上げ』マシン(生のデータを確率に変える部分)だけに通過させたとしたら、結果はどうなるだろうか?」

2. 伸縮和(テレスコーピング・サム)
IG-Lensは、旅路をセグメント(例:フロア10から11、11から12など)に分割します。

  • フロア10における単語の確率を計算します。
  • フロア11における確率を計算します。
  • 両者の差が、その特定のセグメントで行われた正確な作業量となります。
  • すべての変化を測定しているため、底から頂上まですべての変化を足し合わせると、最初から最後までの一連の変化と完全に一致します。計算の抜け漏れも、「製法の誤差」も、丸め誤差もありません。

3. 「予測に連動した」フィルター
ほとんどの手法は、重要度を推測するために数値がどれくらい「揺れ動くか(勾配)」を見ます。しかし、数値が大きく揺れ動いても、最終的な決定には影響を与えないことがあります。
IG-Lensはよりスマートです。IG-Lensは、実際の確率が変化した場合にのみ、そのフロアに作業のクレジットを与えます。もし数値が揺れ動いても予測が変わらないのであれば、IG-Lensはその揺れを無視します。これは、単に「箱を動かして忙しくしていた日」ではなく、「実際にタスクを完了させた日」に対してのみ報酬を支払うマネージャーのようなものです。

なぜこれが重要なのか(論文による説明)

  • 正確であること: 従来のツールが近似値を与えるのに対し、IG-Lensは、各レイヤーの貢献を合計すれば、最終的な確率と正確に一致することを保証します。これは数学的に完璧です(コンピュータの計算限界の範囲内で)。
  • 「発生点(Onset)」を見つけ出す: これにより、モデルがいつ単語を「決定」したのかを正確に特定できます。例えば、「首都」という単語についてはレイヤー12で決定が下されたが、「ハノイ」についてはもっと後、レイヤー15や16あたりで決定が起きた、といったことが示せます。
  • 限界についても正直であること: 論文はトレードオフについても認めています。IG-Lensは特定のレイヤーにおける単語のスナップショットを見るため、そのレイヤーが単語が上層へ進む過程で行うであろう「将来の作業」まではカウントしません。これは、「そのレイヤーがシステム全体に対して行った総効果」ではなく、「出発点から見て、そのレイヤーが最終回答にどれだけ貢献したか」を測定しているのです。

まとめ

IG-Lensは、AIモデルの内部を覗き見るための新しい方法であり、「モデルはいつ決定を下したのか?」という問いに対し、合計が100%になる数学的に完璧な「領収書」を提示します。それは推測ではなく、レイヤーごとに確率の変化を正確に計算し、ノイズを排除して、決定がどこで行われたかを正確に示してくれるのです。

著者らは、IG-Lensが特定したレイヤーにおいてモデルを「壊す」ことで、モデルが実際に正しく機能しなくなるかどうかをテストする計画です。これにより、この手法が真の決定ポイントを見つけ出していることが証明されることになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →