Geometric Representations of Knowledge Inside Biological Large Language Models: an Empirical Analysis
この実証的研究は、生物学的大規模言語モデル(SCFMs)は生物学的知識に関する実在的で低次元かつ部分的に線形化された幾何学的構造をエンコードしているものの、その構造は控えめであり、しばしば非線形に絡み合い、PCAのような古典的な発現ベースの手法が既に回収可能なものと大きく重複しており、自然言語モデルに見られるような鮮明で規則的な幾何学には及ばないことを明らかにしている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
想像してみてください。あなたは、人間の体のあらゆる細胞が一冊の「生きた本」となっている、巨大で魔法のような図書館を持っています。何年もの間、科学者たちは私たちの体がどのように機能しているかを理解するために、これらの本を読もうと試みてきました。しかし、そのテキストは乱雑で、解読するのが非常に困難でした。最近、この「生物学的超読者(Biological Super-Reader)」と呼ばれる新しい種類のプログラム、すなわち「生物学的大規模言語モデル(Biological LLM)」が発明されました。これらは、スマートフォンのキーボードが次にあなたが打ち込む単語を予測するように、何百万もの細胞の「本」からパターンを学習するコンピュータプログラムです。
ここで科学者が抱いている大きな疑問があります。これらの「超読者」は、知識を整然とした直線的な方法で整理しているのでしょうか?一般的な言語モデル(エッセイを書いたり、あなたとチャットしたりするもの)では、研究者たちは「王様」と「女王様」といった概念が一直線上にあり、反対語は単純な一歩先に位置していることを見出しました。それは、あらゆる概念に明確な通り道がある、完璧に整理された地図のようなものです。科学者たちは、これらの生物学的超読者も、「健康 vs 病気」や「成長 vs 休止」といった概念に対して、同じような整然とした直線的な地図を持っていることを期待していました。もしそうであれば、コンピュータの思考を微調整して、疾患や発達を理解することが容易になるからです。しかし、これから明らかになるように、これらの生物学的モデルの内部にある地図は、整然とした都市の街路というよりも、曲がりくねった丘の多い森の小道のようです。
機械の中にある地図:高速道路ではなく、森である
この研究において、オリビア・デンビス(Olivia Denvis)という研究者は、これら4つの生物学的超読者(scBERT、Geneformer、scGPT、UCEと命名)を深く掘り下げ、それらが本当に整然とした直線的な整理を行っているのかを調査することにしました。彼女は彼らを探索家として扱い、細胞の種類、生息地、活動内容に関する詳細なメモが付随した42万個の細胞からなる膨大なデータセットへと送り込みました。そして、モデルの内部にある「地図」を、数十年にわたり科学者が使用してきた信頼できる古典的なツール、例えばPCAと呼ばれる単純な数学的トリックと比較しました。
彼女が発見したのは以下の通りです。モデルは確かに「地図」を持っていますが、それは誰もが期待していたような、鮮明で直線的な高速道路ではありませんでした。
1. 地図はコンパクトだが、混雑している
まず、研究者はモデルが情報を保存するためにどれほどのスペースを使用しているかをチェックしました。1,280の棚を収容できる巨大な倉庫(モデルのフルサイズ)を想像してください。研究の結果、モデルは知識を保存するために、実際にはわずか12から26の棚程度しか使用していないことがわかりました。これは非常に低次元な空間であり、モデルが効率的であることを意味するため、良いことです。しかし、この空間は「異方性(anisotropic)」、つまり、丸い球体というよりも、細長く狭い円錐形のような形をしています。規模の小さいモデルは、この狭い円錐の中にさらに押し込まれており、その思考プロセスが少し「窮屈」であることを示唆しています。
2. 簡単なことは直線的だが、難しいことは曲線的である
次に、研究者がモデルに対し、「これは男性の細胞か女性の細胞か?」や「免疫系に属しているか?」といった単純な識別を求めたところ、モデルは驚異的な能力を発揮しました。モデルは、言語モデルがそうであるように、これらのグループを分けるための直線を描くことができました。実際、これらの簡単なカテゴリーにおいて、モデルはほぼ完璧でした。
しかし、ここにひねりがありました。彼女が「これは病気の細胞か?」や「これは特定のサブタイプか?」あるいは「発達のどの段階にあるか?」といった、より「興味深い」問いを投げかけたとき、直線は機能しなくなりました。知識は依然として存在していましたが、それは曲線の中に絡み合っていました。
- 証拠: 研究者が細胞の発達時間を予測するために単純な直線を用いようとしたところ、正解率は約61%にとどまりました。しかし、コンピュータにデータの自然な曲線(フィールドを横切るのではなく、曲がりくねった小道に沿って歩くような動き)を辿らせたところ、精度は80%へと跳ね上がりました。
- 教訓: モデルは複雑な事象を理解していますが、それらは単純な直線では到達できない、曲線的で非線形な方法で保存されています。これは、複雑な概念であっても直線上に位置することが多い言語モデルとは異なります。
3. 「ステアリング・ホイール(操舵輪)」は少し不安定である
言語モデルにおいて、単語の意味を変えたい場合(例えば「幸せ」を「悲しい」に変えるなど)、特定のベクトル(方向)を加えるだけで完璧に機能します。研究者はこの手法を生物学的モデルでも試みました。彼女は、方向ベクトルを加えることで細胞のアイデンティティを「操舵(ステアリング)」しようと試みました。
- 結果: それは機能しましたが、成功率は約54%から66%でした。コイン投げよりはマシですが、言語モデルで見られる完璧な制御には程遠いものでした。一つのことを変えようとすると、意図せず他の何かが変わってしまうことがありました。異なる概念への方向性は、ある程度平行ではありましたが、完全ではなく、整合性も弱いものでした。
4. モデル同士は一致するが、「真実」とは一致しない
研究者はまた、これら4つのモデルが同じように考えているかどうかを調べました。モデル同士の類似性は中程度(約55%から74%)であり、これは良好な結果です。しかし、彼女がモデルを「ゴールドスタンダード(黄金律)」である生物学的知識(細胞型が現実世界でどのように関連しているかを示す詳細な地図)と比較したところ、モデル間の類似性はわずか36%から45%でした。
- 驚き: モデルは、生物学的な複雑な真実よりも、むしろ古い数学的ツール(PCA)に近い見解を示していました。モデルは、基本の数学に近い、データに対する共有された簡略化された視点へと収束していたのです。
5. 「深い」知識は中間層にある
最後に、彼女はモデルのレイヤー(その「脳」)のどこにこの知識が存在するのかを調べました。
- 単純なアイデンティティ: 「これが何の種類の細胞か」を知る能力は、モデルの層が深くなるにつれて強くなります。
- 疾患の状態: 細胞が病気であるかどうかを知る能力は、中間層でピークに達し、層が深くなるにつれて減衰していきました。
- バッチ効果: モデルは、初期のレイヤーにおいて技術的なノイズ(どの機械が写真を撮ったかなど)を無視することには長けていましたが、それを完全に忘却することはありませんでした。
結論
では、判定を下しましょう。生物学的大規模言語モデルは実在しており、知識の幾何学的な地図を保持しています。しかし、それは私たちが言語モデルで見られたような、クリーンで直線的で完璧に整理された地図ではありません。代わりに、それは「部分的に線形化された、低次元の」地図です。
モデルは、簡単なこと(男性の細胞と女性の細胞を見分けるなど)については非常に優れていますが、臨床的に重要な難しいこと(疾患や発達など)については、知識は曲線的で絡み合っています。モデルが持つ「直線的な」知識のほとんどは、実はすでに古い数学的ツールによって得られるものです。モデルが新たに学習した「新しい知識」はそこに存在していますが、それは曲線の中に隠されており、読み解いたり利用したりすることを困難にしています。
この研究は、これらのモデルは有用ではあるものの、誰もが期待したような「直線的な」ブレイクスルーをもたらす魔法の道具ではない、と結論付けています。将来の真の課題は、単にモデルを大きくすることではなく、最も重要な生物学的な秘密が隠されている、あの曲がりくねった、うねるような道を読み解くための、より優れたツールを構築することなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。