← 最新の論文
🧬 biology

HEIST: A Graph Foundation Model for Spatial Transcriptomics and Proteomics Data

本論文は、2,230万個の空間解像度細胞を用いて事前学習された階層型グラフトランスフォーマー・ファウンデーションモデルであるHEISTを紹介するものであり、これは空間的コンテキストを細胞内の遺伝子およびタンパク質ネットワークと統合することで、細胞アノテーション、遺伝子インピュテーション、および臨床アウトカム予測において最先端の性能を達成し、空間プロテオミクスのような未知のデータタイプへの汎用性を実現している。

原著者: Hiren Madhu, João Felipe Rocha, Tinglin Huang, Siddharth Viswanath, Smita Krishnaswamy, Rex Ying

公開日 2026-06-05
📖 1 分で読めます☕ さくっと読める

原著者: Hiren Madhu, João Felipe Rocha, Tinglin Huang, Siddharth Viswanath, Smita Krishnaswamy, Rex Ying

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

あなたは、活気にあふれ、混雑した都市を理解しようとしていると想像してください。あなたには、この都市に関する2種類のデータがあります。

  1. 人々のリスト: すべての人が何を考え、何をしているか(彼らの「遺伝子発現」)を記した、膨大なスプレッドシート。
  2. 地図: すべての人がどこに立っており、誰の隣に立っているかを正確に示すGPS(彼らの「空間的位置」)。

長い間、科学者たちは、この「人々のリスト」を見るか、あるいは「地図」を見るかのどちらかを選ばなければなりませんでした。リストを見れば、近所の文脈を見逃してしまいます。地図を見れば、個人の内面的な思考を見逃してしまいます。さらに、ほとんどのコンピュータモデルは、すべての人の「語彙」が固定されているものとして扱っていたため、訓練時とは異なる言葉(遺伝子やタンパク質)を使う新しい都市を理解することができませんでした。

ここに、HEISTが登場します。

HEISTは、細胞の「内面的な思考」と、その「近所の文脈」の両方を同時に理解できるように設計された、新しい「基盤モデル(超スマートなAIベース)」です。以下に、簡単な比喩を用いてその仕組みを説明します。

1. 二層構造の都市地図(階層グラフ)

多くのモデルは、都市をたった一つの方法でしか見ていません。HEISTは、ロシアのマトリョーシカ二階建ての建物のように都市を見ます。

  • 上の階(近所): これは組織全体の地図です。これは、細胞が誰の隣に立っているかに基づいて、細胞同士を接続します。ある細胞が「腫瘍の近所」にいる場合、それが「健康な近所」にいる場合とは異なることを理解しています。
  • 下の階(内部のオフィス): すべての細胞の内部では、HEISTはその細胞の遺伝子のミニネットワークを構築します。単に遺伝子をリストアップするのではなく、誰が誰と対話しているか(共発現)に基づいて、それらを接続します。

魔法のトリック: HEISTは、単に上の階を見るだけでも、下の階を見るだけでもありません。これらが互いに話し合うように設計されています。

  • もし細胞が、騒がしく混雑した近所(特定の組織環境)に立っているなら、HEISTはその細胞の内部的な「思考」を、ストレスを反映するように更新します。
  • 逆に、もし細胞内の遺伝子が特定のメッセージを叫んでいるなら、HEISTはその情報を利用して、その細胞が近所の中でどのような位置にあるかという認識を更新します。

2. 固定された辞書を持たない(汎用性)

例えば、英語の翻訳機を訓練したのに、フランス語で書かれた本を渡されたと想像してください。標準的なモデルは、自分が知っているのは「英語の語彙」だけなので、クラッシュしてしまいます。

HEISTは異なります。固定された単語のリスト(遺伝子)を暗記する代わりに、言葉が互いにどのように関連しているかを学習します。

  • もし見たこともない新しいタンパク質(プロテオミクス・データのようなもの)に遭遇しても、パニックに陥りません。その新しいタンパク質が隣人とどのように「会話」しているかを見て、その関係性に基づいて意味を推論します。
  • これにより、HEISTはRNA(トランスクリプトミクス)の研究から、ゼロから再訓練することなく、タンパク質(プロテオミクス)の研究へと飛び移ることができます。それは、たとえ聞いたことのない言葉であっても、単語ではなく文法や文章構造を理解することで新しい言語を習得できる、多言語話者のようなものです。

3. 学習方法(トレーニング)

HEISTは、2,230万個の細胞15種類の臓器124種類の異なる組織を含む、大規模な「都市」データセットを用いて訓練されました。

  • 先生のゲーム: AIは学習するために、2つのゲームを行いました。
    1. 「違いを見つけろ」ゲーム(対照学習): 2つの細胞が示され、「これらの隣人は似ているか、それとも違うか?」と問われます。AIは、似ている細胞をグループ化し、異なる細胞を遠ざけることを学びました。
    2. 「穴埋め」ゲーム(マスクされた自己符号化): AIには、一部の遺伝子や位置データが隠された(マスクされた)細胞が示されます。AIは、その細胞の隣人や内部の遺伝子ネットワークについて知っていることを基に、欠落した部分を推測しなければなりません。

4. HEISTができること(結果)

論文では、HEDTが以下の4つの特定の領域において「スーパーパワー」であると主張しています。

  • 隠れたクラスターの発見: 他のモデルが見逃してしまうような、小さく隠れた細胞のサブグループを見つけることができます。例えば、以前のモデルでは単なる「一般的な免疫細胞」として扱われていたものが、腫瘍内の非常に特定の「微小環境」の中にのみ存在する特定のタイプの免疫細胞であることを特定できます。
  • 健康状態の予測: 組織サンプルを見て、がん患者が免疫療法に反応するかどうか、あるいは胎盤が健康であるかどうかを予測できます。多くの場合、他のトップモデルを打ち負かします。
  • 空白を埋める: 遺伝子の測定値が欠落していたり、ノイズが含まれていたりする場合(ラボでよくある問題)、HEISTはそれが本来あるべき姿を正確に推測できます。
  • スピード: HEISTは驚異的に高速です。すべての細胞を他のすべての細胞と接続しようとするのではなく、データのスマートで疎な(スパースな)見方を利用しているため、競合モデルよりも8倍速く、あるいは48倍速いのです。

まとめ

HEISTを、究極の生物学的探偵と考えてください。HEISTは単に細胞の身分証(遺伝子)を読むだけでなく、犯罪現場(組織マップ)を見、容疑者間の関係(遺伝子ネットワーク)を理解し、その文脈を利用して、他の探偵(モデル)が見落としてしまうような謎を解き明かします。HEISTは、「誰が(遺伝子)」、「どこに(空間)」、「どのように話しているか(ネットワーク)」を、一つの統一された適応可能なシステムへと統合することに成功した最初のモデルです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →