Global tree encoding of atlas-scale single-cell genomics
本論文は、大規模な単一細胞ゲノムデータセットを統一された階層的ツリー表現へと整理することで、効率的なサブサンプリングを可能にし、マルチレゾリューションな細胞関係を保持し、さらに組織、発生段階、および種を横断した統合的な解析を促進する、スケーラブルな計算フレームワークであるMILKを紹介するものである。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
シングルセル・ゲノミクスは、科学者が個々の細胞内の遺伝的指示を読み取ることを可能にし、生物学を変貌させてきました。組織をぼやけた混合物として見る代わりに、研究者は今や、その中にある一つ一つの細胞のユニークなアイデンティティを見ることができるのです。この技術は近年爆発的に普及し、ヒトの胎児、発達中のマウス、そして様々な疾患を持つ患者から得られた、数億個もの細胞を含む膨大なライブラリを生成しています。しかし、この成功は新たな問題を生み出しました。データがあまりに巨大になりすぎて、分析ができなくなったのです。科学者がこれらの膨大なコレクションを研究しようとすると、数字を扱いやすくするためにほとんどの細胞を捨て去らなければならなかったり、あるいは、結論に至るプロセスを隠してしまう「ブラックボックス」のような非常に複雑なコンピュータモデルに頼らざるを得なくなったりしています。この分野は情報に満ちていますが、重要な詳細を失うことなく全体像を見るための手段を欠いています。
これを解決するために、ブレット・キヨタ、チェヒョン・リー、ハオヤン・ヤオ、そしてノゾム・ヤチエの研究者たちは、「MILK」と呼ばれる新しい手法を開発しました。その名前は「大規模かつ高次元なカーネル情報のマルチレゾリューション統合(multi-resolution integration of large-scale and high-dimensional kernel information)」に由来しますが、その機能はもっとシンプルです。チームは、細胞が単なるランダムな点の集まりではなく、家系図のように自然な階層構造を持っていることに気づきました。一つの受精卵が分裂して系統を作り、それが特定の組織や細胞型へと枝分かれしていきます。研究者たちは、これら数百万の細胞を取り込み、それらを単一の統一された樹形図(ツリー構造)へと配置するシステムを構築しました。このツリーは細胞間の関係を捉え、似たもの同士をグループ化しながら、希少またはユニークな細胞も可視化されたままにします。データをこのように整理することで、チームは、そこに隠された生物学的な物語を失うことなく、膨大なデータセットを扱いやすいサイズへと圧縮することができるのです。
研究者たちは、15種類の器官から400万個の細胞を含むヒト胎児アトラスを用いて、このアプローチをテストしました。彼らはこのツリーを用いて、全集団の代わりとなる、代表的な少数の細胞サンプルを選択しました。このスマートな選択法を、同サイズのランダムなサンプルと比較したところ、ツリーベースの手法の方が生物学的なシグナルをはるかに良く保持していることがわかりました。それは、細胞の明確なグループを維持し、細胞の機能を定義する遺伝子活動の微妙なパターンを維持していました。これは、科学者が今や、コンピュータモデルのトレーニングや細胞の発達過程の研究のために、数百百万個の細胞ではなく、おそらく100万個程度の極めて小さなデータの一部を用いて、正確な結果を得られることを意味します。
このツリー構造の威力は、チームが1,100万個以上の細胞を含む発達中のマウス胚のデータセットに適用した際に、より明確になりました。彼らは、ツリーの枝が自然に発達段階と一致していることを見出しました。胚の生命の初期に現れた細胞はツリーの基部に近くに位置し、後に形成された細胞は枝のより遠くに位置していました。このツリーは、胚のタイムラインに関する事前の知識を必要とすることなく、単純な出発点から最終的な専門化した形態への細胞の旅路を、時間の流れと変化を捉えながら、見事にマッピングしました。これは、ツリー構造自体が、複雑な生物がいかに成長するかを理解するための鍵を握っていることを示唆しています。
この手法は、異なるソースからのデータを統合するために科学者が使用する大規模なコンピュータモデルを評価することにも有用であることが証明されました。チームは、世界的なシングルセルデータのコレクションであるCELLxGENE Discover Censusから、4,400万個の細胞を分析しました。彼らは3つの主要なコンピュータモデルに対してツリーを構築し、それぞれのモデルが細胞をどの程度うまく整理できているかを比較しました。Geneformerと呼ばれる一つのモデルは、異なる研究室による技術的なエラーを抑制しつつ、異なる細胞型を最もよく分離するツリーを作成しました。ツリー構造によって、研究者たちはモデルがどこで成功し、どこで苦戦しているのかを正確に把握することができ、人間生物学を研究するためのツールがどれほど信頼できるかを判断するための明確な方法を提供しました。
単に細胞を整理するだけでなく、このツリーは疾患が身体をどのように変化させるかを理解するためにも役立ちました。疾患の影響を受けた細胞が、健康な細胞と比較してツリー上のどこに位置するかを見ることで、特定の細胞型がどの程度破壊されたかを測定することができました。彼らは、多くの疾患が全く新しい状態を作り出すのではなく、すでに健康な体内にも存在する状態へと細胞を押し込んでいることを発見しました。また、この分析により、異なる疾患がしばしば同じ細胞グループに対して同様の影響を与えることも明らかになりました。例えば、心臓疾患と脳疾患は細胞の変化において重複するパターンを示しましたが、感染症は独自の明確なクラスターを形成していました。このグローバルな視点は、科学者が、そうでなければ無関係に見えるかもしれない疾患間のつながりを見出す助けとなります。
最後に、チームはこのツリーを使用して、異なる種の間で細胞がいかに進化してきたかを探りました。彼らは、カエルからヒトに至るまで、8種類の動物から得られた300万個の細胞を分析しました。ツリーは、免疫系に関与する細胞のような細胞型は種が分岐するにつれて大きく変化した一方で、血液の基本的な構成要素のような細胞は驚くほど同様であり続けたことを示しました。これらのパターンを辿ることで、研究者たちは、私たちの生物学のどの部分が古く、すべての哺乳類に共通しており、どの部分が私たち独自の系統に固有のものであるかを見極めることができました。
この研究は、単に数字を高速に処理する方法を提供するだけではありません。それは、生物学を見るための新しい方法を提供します。数百万の細胞という混沌とした雲を、構造化された階層的なツリーへと変えることで、研究者たちは生命の複雑さを保持しながら、それを探索することを可能にする地図を作り上げました。このツリーにより、科学者は特定の詳細へとズームインすることも、発達、疾患、そして進化という壮大なパターンを見るためにズームアウトすることもできます。これは、シングルセル生物学の未来を理解するための最善の方法は、より多くのデータを収集することではなく、生命の自然な秩序を尊重する方法で、私たちがすでに持っているデータを整理することであると示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。