← 最新の論文
💻 bioinformatics

Single-cell foundation models benefit from cross-modal training: adding proteomics data beats parameter scaling

本論文は、単一細胞基盤モデルのプロテオミクスデータを用いたクロスモーダル事前学習が、単にRNAのみのモデルをスケールアップさせるよりも優れた遺伝子レベルおよび細胞レベルの表現とより高い汎化性能をもたらすことを実証しており、パラメータのスケーリング単独よりもマルチモーダルな学習に価値があることを強調している。

原著者: Burq, M., Stepec, D., Kim, C., Cimermancic, P.

公開日 2026-08-19
📖 1 分で読めます☕ さくっと読める

原著者: Burq, M., Stepec, D., Kim, C., Cimermancic, P.

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

あらゆる生細胞の内部では、2つの異なる言語で書かれた複雑な会話が行われています。一つの言語はRNAで構成されており、これは細胞を生存させ機能させる働き手であるタンパク質を構築するための指示を運ぶ分子です。科学者たちは、これらのRNAメッセージを読み解くために長年研究を重ね、細胞が健康な状態や疾患の状態においてどのように振る舞うかを記述する、膨大なデジタルライブラリを作り上げてきました。これらのライブラリは非常に巨大になったため、現在、研究者たちは「基盤モデル」として知られる強力なコンピュータプログラムを用いて、その中のパターンを見つけ出しています。これらのプログラムは、本の表紙を見ただけでそのジャンルを即座に特定できる司書のように、異なる細胞タイプの独特なシグネチャー(特徴)を認識することを学習します。長い間、これらのプログラムをより賢くする唯一の方法は、単にRNAデータを増やし続け、その膨大な量によって細胞の生命に関するあらゆる秘密がついに明らかになることを期待することである、という考えが主流でした。

しかし、細胞は複数の言語を操ります。RNAと並んで、細胞は実際の構造物であるタンパク質を生成します。RNAが細胞に何を構築すべきかを伝える一方で、タンパク質は完成品です。最近まで、細胞のほとんどのコンピュータモデルは、これらのタンパク質を無視し、RNAの指示のみに焦点を当ててきました。これにより、指示と最終的な結果が必ずしも一致しないという、理解における空白が生じていました。科学者が直面した問いは、この第二の情報の層、すなわちタンパク質データを加えることが、単にRNAデータを増やすことよりも、コンピュータモデルに多くのことを教えることができるのかどうかという点でした。それは、情報の質と多様性が、モデルを単に大きくして同じものを大量に投入するという単純な戦略を凌駕できるかどうかのテストでした。

ある研究チームは、新しい種類のデータを用いてコンピュータモデルを訓練することで、この問いに答えるべく取り組みました。彼らは、すでに数億ものRNAサンプルから学習済みの既存モデルからスタートしました。単にさらなるRNAを与えるのではなく、膨大なタンパク質のプロファイル(構成)をモデルに導入したのです。これらのプロファイルは、細胞内に存在する特定のタンパク質を測定する技術である質量分析法を用いた、440もの異なる研究から得られたものです。研究者たちは、「クロスモーダル継続事前学習」と呼ぶプロセスを通じて、モデルがこれら48,843のタンパク質サンプルから学習するように慎重に導きました。これは、モデルが既知のRNA言語と、タンパク質という言語がどのように関連しているかを学習することを意味し、実質的に、指示とその完成品の両方を通じて細胞を理解することを教えるものでした。

結果は驚くべきものでした。研究者たちは、7,000万のパラメータ(モデルの複雑さの尺度)を持つモデルを、この混合データを用いて、タンパク質サンプルをわずか1回通過させるだけで訓練しました。このモデルをテストしたところ、RNAのみで訓練された遥かに巨大なモデルと同等、あるいはそれ以上の性能を示しました。具体的には、タンパク質データを持つこの小規模なモデルは、10億および30億のパラメータを持つRNA専用モデルの性能に匹ついたか、あるいはそれを上回りました。この発見は、より優れた理解への道は、単にモデルのサイズを拡大し、RNAデータの量を増やすことにあるという考えに異を唱えるものです。むしろ、異なる種類の生物学的データを導入することが、モデルの知能をより効率的に向上させることができることを示唆しています。

このアプローチの利点は、一般的な性能向上にとどまりませんでした。タンパク質データで訓練されたモデルは、汎化能力、つまり学習した内容を未経験の新しい状況に応用する能力がより強いことが示されました。これは、細胞がタンパク質の変化に対してどのように反応するかをテストした際に特に明確になりました。これらのテストにおいて、単にRNA専用モデルを大きくしても、変化に対する理解は向上しませんでした。しかし、タンパク質から学んだモデルは、これらの新たな課題に対してより容易に対処できました。これは、タンパク質データが、RNAのみに見られるパターンに厳密に縛られない、より堅牢で柔軟な細胞の仕組みの理解をモデルに構築させたことを示しています。

これらの知見は、細胞を理解するための未来が、単一の種類のデータで訓練された、より巨大なモデルを構築することにあるのではないことを示唆しています。むしろ、最も強力な洞察は、異なる種類の生物学的情報を注意深く組み合わせることから得られるのかもしれません。コンピュータモデルに細胞の指示と完成物の両方を読ませることで、科学者はよりスマートで、かつ予測の正確さにおいても優れたツールを作り出すことができます。このアプローチは、生命の全容を捉えることのできる、より情報量の多いモデルへと向かう有望な道を提供しており、時には新しい視点を加えることが、単に同じものを増やすことよりもはるかに価値があるということを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →