Architecture-Dependent Causal Transfer of Activation States Across Large Language Models
本論文は、内部の活性化状態は異なる大規模言語モデルのアーキテクチャ間で測定可能な表現的整合性を持って投影可能である一方で、生成時におけるこれらの状態のエンドツーエンドの因果的転送の成功は厳密にアーキテクチャに依存しており、普遍的なメカニズムとして機能するのではなく、特定のデコーダーのみのペアに対してのみ確実に機能することを示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
二人の人間が会話をしようとしている場面を想像してみてください。しかし、彼らは第三の言語を話す通訳者を通さなければならないという制約があります。最初の人物が思考をささやくと、通訳者がそれを書き留め、それが二人目の人物によって読まれます。そして、通訳者が返答を書き留めます。このプロセスには時間がかかり、費用がかかり、さらに翻訳によって元の意味が失われるリスクもあります。今日、人工知能システムはまさにこのような方法で通信しています。あるコンピュータプログラムが別のプログラムに情報を送る際、そのプログラムは自身の内部的な思考を人間が読めるテキストに変換し、そのテキストを送り、受け取ったプログラムがそのテキストを読み取り、再び自身の内部的な思考へと変換します。このテキストという中間層が、現在の彼らが唯一知っている話し方なのです。しかし、もし彼らがこのテキストを完全にスキップできるとしたらどうでしょうか?もし、一つの機械が、書き留めることなくメモを渡すように、自身の内部状態を直接別の機械に手渡すことができたらどうでしょうか?これが、研究者たちが答えを出そうとした問いです。異なる会社によって作られ、異なるデータで訓練された異なる種類の人工知能は、言葉に翻訳することなく、互いの内部信号を理解できるのでしょうか?
この実験を理解するためには、これらのプログラム、いわゆる大規模言語モデルが、人間のように言葉で考えているのではないことを知っておく必要があります。その代わりに、彼らは「活性化状態」と呼ばれる、膨大な数字の流動的なパターンとして情報を処理しています。これらのパターンは、ある一瞬における脳の特定の電気的な発火のようなものだと考えることができます。モデルが質問を読み取ると、その内部でユニークな活動のパターンが点灯します。研究者は、あるモデルにおける特定のアイデアのパターンが、別のモデルにおける同じアイデアのパターンと、橋渡しができるほど十分に似ているかどうかを知りたいと考えました。もしパターンが十分に似ていれば、コンピュータは最初のモデルの内部信号を、テキストを介さずに直接、二番目のモデルの内部信号へと変換する方法を学ぶことができるはずです。
ある研究者が、4つの異なる人工知能モデルを用いてこのアイデアのテストを行いました。これらのモデルは、異なるテクノロジーの系統や異なる訓練履歴を代表するように注意深く選ばれました。そのうち3つは、一度に一単語ずつテキストを生成するように作られており、4つ目はテキストを双方向から同時に理解するように作られていました。研究者はまず、これらのモデルの内部パターンが比較できるほど十分に似ているかどうかを確認しました。彼らは、類義語や本の中でよく一緒に現れる言葉といった、関連する概念のペアに対してモデルがどのように反応するかを調べました。その結果、同じように作られた3つのモデルについては、内部パターンが確かに類似していることがわかりました。しかし、異なる仕組みで作られたモデルは、そのような類似性を示しませんでした。このことは、モデルを誰が作ったかやどのようなデータで訓練したかよりも、モデルがどのように構築されているかの方が重要であることを示唆していました。
次に、研究者は「橋」を架ける試みをしました。彼らは、あるモデルの内部信号を別のモデルの内部信号へと変換する方法を学習する、小さく単純なコンピュータプログラムを訓練しました。彼らはこの橋の性能をテストするために、ある質問を提示し、その質問に対する最初のモデルの反応を変換し、二番目のモデルが20個の選択肢の中からそれを正しい答えとして認識できるかどうかを確認しました。同じように構築された3つのモデルについては、この橋は驚くほどうまく機能しました。二番目のモデルは、信号の出所を正解の半分ほどの確率で正しく特定できました。これはランダムな推測よりもはるかに高い精度です。しかし、異なる仕組みで作られたモデルについては、この橋は完全に失敗しました。二番目のモデルはその信号を全く認識できなかったのです。これにより、翻訳レイヤーは可能であるものの、それは特定のアーキテクチャの系統を共有するモデル間でのみ機能することが裏付けられました。
最終かつ最も困難なテストは、この翻訳がリアルタイムで受け手側のモデルの挙動を実際に変えることができるかどうかを確認することでした。研究者は、最初のモデルから翻訳された信号を取り出し、それを新しい回答を書き始めている最中の二番目のモデルの中に直接注入しました。彼らは、この注入によって、二番目のモデルの出力が元の質問のトピックへと誘導されるかどうかを見たのです。結果はまちまちであり、決定的な限界を明らかにしました。特定の2つのモデルの間で試みたとき、注入は機能しました。二番目のモデルの出力は、最初のモデルの質問のトピックへと顕著にシフトしました。これは、信号が受信され、因果関係のある影響を与えたことを証明しています。しかし、三番目のモデルで同じ手法を試したところ、完全に失敗しました。紙の上では内部パターンが似ているように見えても、信号を注入しても出力には全く変化がありませんでした。
研究者は、物理的な情報の運び手――つまり特定の電気活動のパターン――をある機械から別の機械へと転送することは可能であるが、これは機械同士が深い理解や共通の意味を共有していることを意味するのではない、と結論付けました。成功したケースにおいて、二番目のモデルは必ずしも元の質問に対する正しい答えを出したわけではありません。むしろ、元の質問が正方形に関するものであった場合に三角形について話すような、テーマに関連したテキストを生成していました。信号は転送されましたが、意味は完全に保持されてはいませんでした。この研究は、人工知能間の直接的な通信は技術的には可能であるが、それは普遍的な言語ではないことを示しています。それは、関与する機械の特定の設計に完全に依存しています。設計が一致していなければ、信号は理解されず、転送は失敗します。これは、将来、異なるAIシステム同士を直接会話させたい場合、単に「動くだろう」と想定することはできず、それらが互換性のある方法で構築されていることを確認するか、あるいは接続したいあらゆるペアに対して専用の翻訳機を構築する必要があるということを意味しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。