LucaCell: a sequence-centric foundation model for cross-species single-cell analysis
LucaCellは、固定された遺伝子識別子の代わりに学習済みmRNA配列エンベディングを利用することで、正確な細胞型転送、微生物種の分化、およびホスト・ウイルス相互作用の予測を含む、堅牢な種間、モード間、およびコンテキスト間シングルセル解析を可能にするシーケンス中心の基盤モデルである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
あらゆる生細胞の中には、その細胞がどのように機能し、成長し、環境に反応するかを決定する、複雑な指示書のライブラリが存在しています。これらの指示書は、RNAと呼ばれる化学的な言語で書かれており、細胞のマスター設計図からの命令を運ぶメッセンジャーとして機能しています。数十年にわたり、科学者たちはこれらのメッセージを読み取るためのツールを開発してきました。これにより、ヒトの体における異なる種類の細胞をカタログ化し、疾患がいかに正常な動作を妨害するかを理解することが可能になりました。しかし、大きな障害が常に残っていました。これらのツールは、すべての本に特定の、あらかじめ割り当てられたコールナンバー(請求記号)が付いている必要がある図書館のように、遺伝子の固定された名前やラベルに依存していたのです。もし科学者がヒトの細胞とマウスの細胞、あるいはヒトの細胞と微生物を比較しようとしても、古いシステムでは、名前が一致しなかったり、データが全く異なる種類の測定値であったりするために、しばしば失敗してしまいます。この制限により、異なる種や生物学的コンテキストを横断して機能する、単一の普遍的な生命の理解を構築することが困難になっていました。
研究チームは今回、こうした命名の問題を完全に回避する新しいアプローチを導入しました。彼らは静的なラベルに頼る代わりに、遺伝コードを構成する文字の生の配列から直接学習するコンピュータモデルを構築しました。化学的な文字そのものに含まれるパターンをモデルに教え込むことで、研究者たちは、特定の名前や由来する種を知ることなく、遺伝子の本質を理解できるシステムを作り上げたのです。「LucaCell」と呼ばれるこの新しいモデルは、遺伝子をバラバラの項目のリストとしてではなく、連続した言語として扱います。その結果、生物学的な情報を種を超えて翻訳し、細胞が変化にどのように反応するかを予測し、さらには感染が明白になる前にそれを特定することさえできる、より柔軟で強力な生命の構成要素の研究手法が誕生しました。
この画期的な成果の核心は、モデルが遺伝子をどのように表現するかという点にあります。従来の手法は、各遺伝子を辞書の中の単語のような、固有のシンボルとして扱ってきました。もし辞書が変わったり、異なる言語の本を読んだりすれば、それらのシンボルは意味をなさなくなります。しかし、LucaCellは、遺伝子を形成する実際の文字の配列に注目します。このモデルは、事前学習されたシステムを用いて、これらの配列をその意味や関係性を捉えた数学的な形状へと変換します。モデルが遺伝子に遭遇したとき、それはラベルではなく、その化学的構造に基づいてその機能を理解します。これにより、ヒトの腎臓にある遺伝子とマウスの腎臓にある類似の遺伝子が、たとえ名前が異なっていたり、データが異なる技術を用いて収集されたものであったとしても、それらが関連していることを認識できるのです。研究者たちは、ヒトとマウスの数十の組織や疾患状態を網羅する、8,500万個の細胞からなる膨大なデータセットを用いて、このモデルのトレーニングを行いました。このトレーニングにより、モデルは細胞がどのように振る舞うかについての深く一般的な理解を得ることができました。
一度トレーニングを終えたモデルは、従来のシステムが通常苦戦するいくつかの困難なシナリオにおいてテストされました。ある実験では、研究者たちはヒト、マウス、そして小型の霊長類であるグレーマウスレマーの腎臓における細胞型の特定をモデルに求めました。モデルは、遺伝コードを直接読み取る場合とDNAのアクセシビリティ(接近しやすさ)を読み取る場合といった、異なる種類の測定値から得られたデータであっても、異なる種の間で細胞型を一致させることに成功しました。特に未知のマウスのデータに対して優れた性能を示したことは、配列ベースのアプローチが、種を超えて適用される根本的な生物学的真理を捉えていることを示唆しています。また、モデルは微生物に対しても機能することが証明されました。単一の細菌を用いたテストでは、モデルは参照ゲノムに最初にアラインメント(整列)させることなく、生の遺伝子リードを分析しました。モデルは50種類以上の異なる細菌種を正確に区別し、さらに、細菌の遺伝配列のパターンを見るだけで、抗生物質によるストレスへの反応といった、細菌の内部状態の微妙な変化さえも検出することができました。
この配列中心の視点の力は、細胞が特定の変化にどのように反応するかを予測することにも及びました。研究者たちは、特定の遺伝子がオフにされたり、あるいは改変されたりした場合(これは摂動と呼ばれるプロセスです)に何が起こるかをシミュレートするために、このモデルを使用しました。これらのテストにおいて、モデルは以前のシステムよりも正確に、遺伝子活動の変化を予測しました。また、個人間の遺伝子コードの極めて小さな差異である「一塩基多型(SNP)」も考慮することができました。これらの小さな違いを組み込むことで、モデルは特定の人物における遺伝子発現レベルを予測する能力を向上させ、遺伝子配列のわずかな変化であっても、細胞の機能に測定可能な影響を与える可能性があることを示しました。この詳細なレベルは、モデルがラベルベースの広範なシステムが見落としがちなニュアンスを捉えていることを示唆しています。
おそらく最も驚くべき応用例の一つは、宿主とウイルスの相互作用の領域でした。研究者たちは、異なる株のインフルエンザウイルスに感染した個々の細胞におけるウイルス量を予測するようにモデルを訓練しました。これまで見たことのない新しいウイルスと宿主の組み合わせに直面した際、モデルは既存のあらゆるツールを凌駕し、他のツールが失敗した場面でも感染パターンを正しく特定しました。さらに、モデルはウイルスに曝露されていない細胞を観察し、感染が差し迫っている兆候を示す遺伝的シグネチャをすでに備えている小さなサブポピュレーション(細胞集団)を特定することさえできました。この発見は、モデルが、細胞が感染に対してより脆弱になる、潜在的な事前状態を検出できることを示唆しており、これは疾患が細胞レベルでどのように広がるかを理解する上で極めて重要となる可能性があります。
LucaCellの成功は、遺伝子の文字の配列が、生物学を理解するための転移可能な基礎を含んでいることを示唆しています。固定された識別子から離れ、基礎となる化学的言語に焦点を当てることで、研究者たちはより適応性が高く堅牢なモデルを作り上げました。現在のバージョンはヒトとマウスのデータに依存しており、遺伝子配列の簡略化されたビューを使用していますが、その結果は、このアプローチが種、データタイプ、および生物学的コンテキストの間の溝を埋めることができることを示しています。これは、生命の根本的な言語を、翻訳や硬直した分類を必要とせずに直接理解するという、細胞の世界を見るための新しい方法を提示しています。ラベルから配列へのこの転換は、細胞がいかに機能し、相互作用し、そして生命の課題に反応するかという将来の発見における標準となるかもしれません。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。