← 最新の論文
💻 computer science

DMDIntel: Interpreting Large Language Models via Dynamic Mode Decomposition

本論文は、動的モード分解を利用してLLMの隠れ状態を主要なモードへと分解し、入力トークンをランク付けする新しい解釈可能性フレームワークであるDMDIntelを紹介するものであり、複数のデータセットおよびモデルファミリーにおいて、PCA、Integrated Gradients、SHAPといった最先端のアトリビューション手法を上回る優れた性能を実証している。

原著者: Amogh Joshi, Animesh Mukherjee, Sergey Utyuzhnikov

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Amogh Joshi, Animesh Mukherjee, Sergey Utyuzhnikov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、手品師が帽子からウサギを取り出す様子を見ていると想像してください。あなたは帽子を見て、ウサギを見ていますが、魔法は、手品師の袖の中で隠されている、その二つの間のわずかな瞬間に起きています。長い間、人工知能(AI)はその手品師でした。私たちは文章を与えると、AIは答えを返してくれますが、なぜAIがその答えを決めたのか、そのプロセスを本当に理解している人は誰もいません。AIは「ブラックボックス」であり、科学者たちは、コンピュータが実際にどの言葉を重視したのかを知るために、中を覗き込もうと必死になっています。この分野は「解釈可能性(interpretability)」と呼ばれています。この新しい論文を理解するためには、まず二つのことを知る必要があります。AIがいかにテキストを読み取るか、そして、私たちが通常どのようにその内部を覗こうとしているかです。

AIモデル、特に「大規模言語モデル(LLM)」と呼ばれるものは、私たちのように言葉を読みません。その代わりに、彼らはすべての単語を長い数字のリスト(ベクトル)に変換し、リレーレースのように一連のレイヤー(層)へと通過させていきます。各レイヤーにおいて、数字はわずかに変化し、現在の単語の意味を、それより前にある単語の意味と混ぜ合わせます。レースの終わりまでに、モデルは最終的な一組の数字を持ち、それが答えを決定します。通常、どの言葉が重要であったかを判断するために、科学者はモデルの「静的な」状態を見るツールを使用します。それは、リレーレースの「一枚の写真」を撮り、誰が一番速く走っていたかを推測するようなものです。しかし、この論文は、一枚の写真を見るだけでは物語の全体像を見逃してしまうと主張しています。彼らは、数字が次のステップへとどのように進化していくか、つまり「動き」を見ることで、レースの「映画」を見るべきだと論じています。なぜなら、AIの思考の秘密はその動きの中にこそあるからです。

ここで、Amogh Joshi氏と、IIT Kharagarsおよびマンチェスター大学の研究チームによって導入された新しい手法、DMDINTELが登場します。AIの内部処理を、単なる静的な数字のリストとしてではなく、流れる川として考えてみてください。AIが文章を読み進めるにつれ、「水」(隠された情報)は波打ち、形を変えていきます。研究者たちは、水の渦巻きを研究するために考案された**動的モード分解(Dynamic Mode Decomposition: DMD)**という数学的ツールを使用し、これらの波紋をマッピングしました。

この「川」の比喩が実際にどのように機能するかを説明しましょう。AIが文章を読み取るとき、単語の隠れた状態は複雑に渦巻くパターンを作り出します。DMDINTELは、このパターンを、複雑な海の波がいくつかの基本的な波の形の組み合わせとして記述できるのと同様に、いくつかの単純で繰り返される「モード」または形状へと分解します。チームは、AIが文章を読み進める中で、これらの形状がどのように成長し、縮小し、あるいは振動するかを観察することで、どの単語が最終的な決定の「ドライバー(推進力)」であったかを特定できることを見出しました。彼らはAIを動的システムとして扱い、つまり、単なる単語そのものではなく、一つの単語から次の単語への「変化」に着目したのです。

研究者たちは、このアイデアを3つの異なるAIモデルのファミリー(Llama、Qwen、Mistral)と、3つの異なるタスク(レビューが肯定的か否定的かの判定、フェイクニュースの検知、ヘイトスピーチの検出)でテストしました。彼らは、自分たちの「川の映画」の手法を、Integrated Gradients、SHAP、および主成分分析(PCA)を含む従来の「静止画」の手法と比較しました。

結果は、DMDINTELがはるかに優れた探偵であることを示唆しています。実験において、この新手法は、他の手法よりも一貫して最も重要な単語(グラウンドトゥルース)を正確に見つけ出しました。例えば、AIがレビューが否定的であるかどうかを判断しているとき、DMDINTELは「trash(ゴミ)」や「unable(不可能)」といった言葉をトップのドライバーとして正しくランク付けしましたが、他の手法は時として「scheduled(予定された)」や「conference(会議)」といった重要度の低い言葉に気を取られてしまいました。この論文は、AIの思考の「進化」を見ることで、DMDINTELが文章の論理をより良く捉えられることを示しています。これは、AIの推論が単に単語が静止していることによるものではなく、文章が構築されるにつれて、意味がいかに流れ、変容していくかにあることを示唆しています。

しかし、著者たちは、これがすべてのAI問題に対する魔法の杖ではないことにも注意を促しています。彼らの手法は、AIが文章を読み、単純な答え(分類タスクのようなもの)を出しているときに最も効果を発揮します。もしAIが長い物語を書いたり、本を一語一語翻訳したりし始めると、AIが生成した新しい言葉をシステムに再びフィードバックし始めるため、数学的な処理が複雑になることを彼らは認めています。しかし、AIがなぜある文章を「ヘイトスピーチ」や「フェイクニュース」とラベル付けしたのかを説明するという特定の仕事において、数字のダンスを観察するこの新しい方法は、より明確で正確な、機械の心の姿を描き出しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →