Scaling Inherently Interpretable Language Models
この論文は、解釈可能性を導入することがモデルの能力とのトレードオフであるという概念に異を唱え、解釈可能性の制約を学習パイプラインに統合することで、Steerling-8Bのようなモデルが競争力のある性能を維持しながら、より透明かつ人間の概念に沿ったものへと効果的にスケールできることを実証している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、巨大で魔法のような図書館がどのように機能しているのかを理解しようとしているのだと想像してください。長年、最も賢い司書たち(AI研究者)は、この図書館をより大きく、より強力にすることに注力してきましたが、ある奇妙なルールを受け入れてきました。それは、図書館を真に強力なものにするためには、それが「ブラックボックス」でなければならないというルールです。あなたは質問を投げかけ、モデルは素晴らしい答えを返してくれますが、その答えをどのように導き出したのかは一切分かりません。それはまるで、魔法使いが呪文を唱え、「信じてくれ、うまくいく」と言いながら、その材料や詠唱の内容を見せないようなものです。このため、もし図書館が間違いを犯したり、変なことを言ったりしても、簡単に修正することはできません。後になってから、なぜそうなったのかを推測することしかできないのです。この論文は、大胆な問いを投げかけます。「私たちは、このトレードオフを受け入れなければならないのでしょうか? もし、超天才でありながら透明性も備えた、つまり、答えを書く際にどの本を使い、どのようなアイデアを考えていたのかを正確に見ることができる図書館を構築できるとしたらどうでしょうか?」
この論文の著者であるGuide Labsというチームは、このアイデアをテストすることに決めました。彼らは、Steerling-8Bと呼ばれる新しい種類の言語モデルを構築しました。単に文章の次の単語を予測するように訓練された通常の「ブラックボックス」モデルとは異なり、Steerlingは、最初から「自身の思考をプロセスの中で説明しなければならない」という特別なルールが脳に組み込まれた状態で訓練されました。彼らは驚くべき発見をしました。モデルに自己説明をさせることは、モデルを弱体化させることはなかったのです。実際、モデルを大きくし、より多くの計算資源を与えると、モデルは単に賢くなっただけでなく、自己説明を行う能力も向上しました。モデルが大きくなるにつれて、その内部の思考はより明確になり、答えを形成するためにどのアイデアを使用しているのかを正確に見ることがより容易になったのです。
「ブラックボックス」の魔法が抱える問題
長い間、AIを構築する標準的な方法は、モデルがテキストを予測することに最大限に特化して訓練し、学習が終わった後に、中を覗いて何をしているかを探ろうとする方法でした。研究者たちは「プローブ(探査)」と呼ばれるツール(概念がモデルの中に隠されているかを推測しようとするもの)や、「アトリビューション(属性付け)」(どの単語が最も重要であったかを推測しようとするもの)を使用します。しかし、著者らはこれらのツールは、すでに完成した車のエンジンが発する音を聞いて、そのエンジンがどのように機能しているかを理解しようとするようなものだと主張しています。エンジンは、そのように設計されたわけではないため、その音は誤解を招く可能性があります。プローブは「おい、『猫』という単語がそこにあるぞ!」と言うかもしれませんが、それはモデルが意思決定のために実際に「猫」という概念を使用したことを意味するわけではありません。それは単なる偶然である可能性があります。
この論文は、この「後付けで直す」というアプローチは根本的に欠陥がある、と主張しています。もし真に理解可能なモデルを望むのであれば、後から懐中電灯を追加するのではなく、エンジンを組み立てている最中に、そのエンジンの中に懐中電灯を組み込んでおく必要があるのです。
レシピ:透明な脳の構築
これを解決するために、チームはAIを訓練するための新しい「レシピ」を作成しました。単に次の単語を予測するように教えるのではなく、以下の3つのことを同時に教えました。
- 入力アトリビューション(Input Attribution): 「あなたの質問の中で、どの単語が最も重要でしたか?」
- コンセプト・アトリビューション(Concept Attribution): 「今、あなたはどのような大きなアイデアやトピックについて考えていますか?」
- データ・アトリビューション(Data Attribution): 「あなたの学習ライブラリのどの部分からこれを学びましたか?」
これを実現するために、彼らは膨大な新しい「コンセプト」のライブラリを構築する必要がありました。辞書を想像してください。ただし、そこには単なる言葉ではなく、「勾配降下法」「中世の詩」「皮肉」といった33,000個の具体的なアイデアが含まれています。彼らはAtlasと呼ばれるシステムを構築し、それが数百万の文書を読み込み、それらにこれらのアイデアのタグを付けることで、AIが実際に利用できる人類の知識のマップを作成しました。
次に、彼らは特殊な「ボトルネック」を備えたモデルの脳、Steerling-8Bを構築しました。通常のAIを、入力から出力へと情報(水)が流れるストレートなパイプだと考えてください。Steerlingには、その途中にフィルターがあります。水が出力される前に、それはラベル付けされた「バケツ(概念)」のセットを通過しなければなりません。モデルは、「よし、この文章は40%が『数学』についてで、20%が『歴史』についてだ」と判断しなければなりません。モデルは予測を行うためにこれらのバケツを使わなければならないため、どのバケツを使用したのかを正確に把握できます。もしモデルが間違いを犯した場合、私たちはバケツを見て、「ああ、これは『歴史』に集中しすぎて『数学』を無視していたのだ」と言うことができます。
大きな驚き:大きければ大きいほど、より明快になる
この論文で最もエキサイティングな部分は、モデルを大きくしたときに起こったことです。通常、複雑なシステムを大きくすると、理解するのが難しくなります。しかし、ここでは逆のことが起こりました。
チームは、極小のモデルから、巨大な80億パラメータを持つSteerling-8Bに至るまでのモデルをテストしました。その結果、モデルが成長するにつれて、内部の「バケツ」はより整理され、人間のアイデアとより一致するようになることが分かりました。
- 「税金」の神話: 多くの人々は、モデルに自己説明をさせると、その知能に対する「税金」のようにパフォーマンスが低下すると考えていました。論文は、これが事実ではないことを示しています。「解釈可能性」のコストは、非常に小さな固定額であり、富を得るにつれて増えていく請求書ではなく、一度だけ支払う小さな手数料のようなものです。
- スケーリング(規模の拡大): 計算資源(約1.35兆語の学習データ)を増やしていくと、モデルは単に賢くなっただけでなく、より透明になりました。学習されたコンセプトはより明確になり、モデルは「残差(residual)」(説明不可能な隠れた脳の部分)への依存を減らし、ラベル付けされたコンセプトへの依存度を高めました。
船の操舵
このようにモデルが構築されているため、再学習させることなく、実際にモデルを「操舵(ステアリング)」することができます。車の運転を想像してください。通常のAIでは、暴力的な話題を避けたい場合、車が衝突しないことを祈るしかありません。しかしSteerlingでは、ダイヤルを回すだけで済みます。もしモデルをもっと「学術的」にしたいなら、「学術的」のバケツをブーストします。もし「政治」について話すのをやめさせたいなら、そのバケツを抑制します。論文では、既存のコンセプトを単に微調整することで、モデルの挙動を即座に変更できることが示されています。
結果
チームは、1.2兆トークン(膨大な量のテキスト)を用いてSteerling-8Bを訓練しました。彼らは、2倍から16倍の計算資源を用いて訓練された他のオープンソースモデルと比較しました。Steerlingは、学習予算がより小さく、かつ「解釈可能性」という追加の「重み」を背負っているにもかかわらず、これらの巨大で不透明なモデルとほぼ同等の性能を発揮しました。
論文は、スマートなAIと透明なAIのどちらか一方を選ぶ必要はない、と結論づけています。設計段階から理解できるようにモデルを設計することで、私たちは強力であるだけでなく、思考プロセスが可視化され、間違いが起きた際に修正できる、信頼できるシステムを構築できるのです。これは、ブラックボックスを構築することから、光が透過するガラスの家を構築することへの転換なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。