← 最新の論文
💻 computer science

Towards Explainability of SLMs by investigating Token Level Activation

本論文は、BERT におけるトークンレベルの重要度を層 8 の隠れ状態活性化強度を分析することで定量化する軽量かつモデル非依存のフレームワークである活性化フローネットワーク(AFN)を提案し、意味的に意味のあるトークンは構造的トークンよりも著しく高い活性化の大きさを示すことを実証することで、注意中心の手法に対する解釈可能な代替手段を提供する。

原著者: Sayantani Ghosh, Rajashik Datta, Amit Kumar Das, Amlan Chakrabarti

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Sayantani Ghosh, Rajashik Datta, Amit Kumar Das, Amlan Chakrabarti

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いものの秘密主義なロボット司書「BERT」という存在を想像してみてください。この司書はこれまで書かれたほぼすべてのものを読み、文章内の質問に答えたり感情を理解したりすることができます。しかし、一つ問題があります。誰も、それが実際にどのように考えているのかを知ることができないのです。まるで「ブラックボックス」のようです。文を入力すると答えが出てきますが、内部の歯車は隠されたままです。

長らく研究者たちは、司書の「注視」を調べることで内部を覗き見ようと試みました。「もし司書が単語を見つめているなら、その単語は重要に違いない!」と考えたのです。しかし、彼らはあるトリックを発見しました。司書はしばしば、コンマやピリオド、あるいは「the」や「is」のような退屈な単語をじっと見つめながら、「beautiful(美しい)」や「disaster(災害)」、「Canada(カナダ)」といった実際の魅力的な単語は無視しているのです。まるで、ドアを通過する人物を無視して、ドアノブだけをズームインして映す監視カメラを見ているようなものです。

新しいアイデア:「注視」ではなく「エネルギー」を測定する

この論文の著者たちは、異なるアプローチを試すことにしました。「司書はどこを見ているのか?」と問う代わりに、「司書は各単語を思考するためにどれだけのエネルギーを使っているのか?」と問いかけました。

彼らは司書の脳にある特定の部屋、第8層に焦点を当てました。司書の脳を12階建てのビルだと考えてみてください。

  • 1階~5階: 1階です。ここでは司書は、大文字や単語が名詞か動詞かといった基本的なことに気づくだけです。
  • 10階~12階: ペントハウスです。ここで最終的な答えが決定されます。
  • 8階(絶好調のスポット): ここは「統合ゾーン」です。司書は文法を見るのをやめ、物語の意味を本当に理解し始める場所です。

研究者たちは活性化フローネットワーク(AFN)と呼ばれるツールを構築しました。司書の目を観察する代わりに、各単語が8階を通過する際に流れる「電気」(数学的にはL2ノルムと呼ばれるもの)を測定しました。

彼らが発見したもの:「高電圧」の単語

このエネルギーを測定したところ、明確なパターンが見つかりました。

  • 「高電圧」の単語: 「prime(首相)」、「minister(大臣)」、「Canada(カナダ)」、「beautiful(美しい)」、「enjoying(楽しんでいる)」といった内容に富んだ単語は、明るいネオンサインのように輝きました。これらは最も高いエネルギーを持っていました。
  • 「低電圧」の単語: 「the」や「of」のような構造語や、「?」のような句読点は、より暗かったです。それらは存在していましたが、意味の主要な重みを担っているわけではありませんでした。

比喩: 家が梱包される様子を考えてみてください。「高電圧」の単語は、重いソファやピアノです。移動させるのに最も多くの労力を要します。「低電圧」の単語は、空の箱やテープです。仕事には必要ですが、スペースやエネルギーをあまり取りません。研究者たちは、8階で重い荷物の持ち上げが行われていることを発見しました。

「波紋効果」実験

これを証明するために、研究者たちは「違いを見つけよう」というゲームを行いました。彼らは司書に非常に似た2つの文を与えました。

  1. 「公園で美しいを楽しんでいる!」
  2. 「ビーチで美しい散歩を楽しんでいる!」

彼らは「day(日)」を「walk(散歩)」に、「park(公園)」を「beach(ビーチ)」に置き換えたとき、エネルギーがどのように変化したかを見守りました。

  • 明らかなこと: 変化した単語(「day」と「park」)は、エネルギーが劇的に跳ね上がりました。
  • 驚き: 変化しなかった単語(「beautiful」や「at」など)さえも、著しいエネルギーのシフトを示しました!

比喩: これは池に石を落とすようなものです。一つの単語(石)を変えると、波紋(エネルギーのシフト)が広がり、直接当たっていない部分さえも水を変えてしまいます。これは、8階が深く接続されていることを示しました。物語の一部を変えると、文全体がその意味を再考することを余儀なくされるのです。

「バケツ」テスト

最後に、彼らは単純な規則を使って「重要な」単語と「背景」の単語を分離しようと試みました。彼らは線(閾値)を引き、エネルギーが高いすべての単語をHIGHバケツに、残りをLOWバケツに入れました。

彼らは次のことを発見しました。

  • HIGHバケツには、単語の約25%(重要なもの)しか入っていませんでした。
  • しかし、これらの少数の単語は、意味の変化の**76%**を担っていました。

比喩: これは、25%のミュージシャン(ソロ奏者)が誰もが覚えているメロディを演奏し、残りの75%が背景のリズムを演奏しているコンサートのようです。ソロ奏者をミュートすると、曲は魂を失います。背景をミュートしても、少し空虚に感じられるかもしれませんが、曲は聞こえます。

大きな教訓

この論文は単に「BERTは賢い」と述べるだけではありません。それは、BERTがどのように考えているのかを見る新しい方法を提供します。プロセスの途中(第8層)における単語の「エネルギー」を測定することで、彼らは「ブラックボックス」を「ガラスボックス」に変えました。

彼らは、BERTが単に句読点をじっと見つめているのではなく、実際の意味を担う単語に精神的なエネルギーを集中させていることを示しました。これにより、モデルが文を処理する際、世界を理解するために「内容」の単語で多くの重労働を行っている一方、「構造」の単語は枠組みを維持するだけであることが理解できました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →