がん研究は、シンプルで強力なツールである「がん細胞株」に大きく依存しています。これらは、実験室のシャーレの中で育てられ、数十年にわたって生存し続け、科学者が腫瘍の挙動を研究したり新薬をテストしたりするために使用される、がん細胞のグループです。これらは育てやすく共有も容易であるため、前臨床研究のバックボン(背骨)を形成しています。しかし、長年この分野を悩ませている根深い問題があります。それは、皿の中で育てられたこれらの細胞から得られた知見が、実際の患者における治療の成功へと結びつかないことが多いという点です。ペトリ皿の中の細胞には、ヒトの体のような複雑な環境が欠けており、時間の経過とともに、元々採取された腫瘍から遺伝学的・化学的に乖離してしまうことがあります。このギャップを埋めるために、研究者たちは、これらのラボで育てられた細胞の分子構成を、実際の患者の腫瘍の分子構成と直接比較する方法を必要としています。科学者たちは、遺伝的な指示書であるRNAについては、これら2つのグループを比較することに成功してきましたが、薬が通常ターゲットとする実際の働く分子である「タンパク質」についての同様の比較は、これまで手の届かないところにありました。これは主に、タンパク質データが非常に厄介であり、測定に使用される機器の限界によって、情報の大部分が欠落してしまうことが多いためです。
研究チームは、この特定のパズルを解くために、「ProtInt」と呼ばれる新しい手法を開発しました。彼らはこのアプローチを膨大なデータセットに適用し、771種類の異なるがん細胞株からのタンパク質測定値と、13種類の組織タイプにわたる550種類の未治療患者腫瘍からのデータを組み合わせました。その目的は、これら2つの異なるグループを、別々の島としてではなく、単一の景観の一部として並べて見ることができる、統一されたマップを作成することでした。研究者たちは、データのクリーニングや遺伝情報の整合性を取るために用いられる標準的な手法では、タンパク質データに見られる特有の空白や欠損値を処理できないことを発見しました。これらの古い手法を無理に適用しようとしても、細胞株と腫瘍は頑なに分離したままでした。しかし、ProtIntは、タンパク質がどのように測定され、なぜデータが欠落するのかを理解する、洗練された学習システムを使用しています。これは、現実的な方法で空白を埋めると同時に、細胞株と腫瘍を直接比較できるようにデータを調整することを学習します。
結果として、ProtIntはこれら2つのデータセットを統合することに成功しました。新しい統一された視点においては、ラボで育てられた細胞と患者の腫瘍との間の人工的な分離は消失しました。2つの明確なクラスターではなく、サンプルは肺、乳房、血液といった、由来となる組織のタイプに基づいてグループ化されるようになりました。この整合性はすべての組織タイプに対して完璧だったわけではありません。例えば、中枢神経系や平滑筋の細胞株は、依然として対応する腫瘍との一致に苦戦しましたが、これはおそらく、これらの特定の細胞が培養皿の中で育つ際に著しく変化するためです。しかし、他の多くの組織については、この手法は驚くほどうまく機能しました。研究者がこの整合の過程で何が変化したのかを詳しく調べたところ、明確な生物学的な物語が浮かび上がってきました。細胞株が実際の腫瘍に似せるように調整されるにつれ、そのタンパク質プロファイルは予測可能な形で変化しました。免疫系、細胞間のコミュニケーション、および周囲の組織構造との相互作用に関連するタンパク質が増加しました。同時に、遺伝的指示のコピーやエネルギー生成といった、基本的な細胞機構に関わるタンパク質は減少しました。この変化は、実際の腫瘍が複雑な体内環境の中に存在しているのに対し、ラボの細胞はしばしば孤立し、純粋に急速な増殖に集中しているという現実を反映しています。
この研究では、異なる数学的戦略が同じ結果をもたらすかどうかについてもテストが行われました。研究者たちは、データを元の状態に戻そうとする学習技術など、異なる学習手法に依存する他の手法と比較しました。その結果、これらの代替アプローチは、データを効果的に混合できなかったり、過剰なエラーを導入したりするなど、期待通りの性能を発揮できなかったことが判明しました。ProtIntが優れていた理由は、欠損データの振る舞いを、ランダムなノイズとしてではなく、タンパク質の豊富さと関連したパターンとして具体的に考慮したことにあります。これにより、システムは欠損値を高い精度で再構築することができ、最終的な比較が完全な情報に基づいたものになることを保証しました。研究者たちは、この手法が今回使用した特定のタイプのタンパク質データには有効であるものの、タンパク質を異なる方法でラベル付けする他の一般的な実験手法にはまだ準備ができていないことも指摘しています。
最終的に、この研究は複雑な生物学的データを理解するための新しい枠組みを提供します。細胞株と腫瘍のプロテオーム(タンパク質全体)を統合することに成功したProtIntは、どのラボ細胞株が特定の患者のがんに最も適した一致を見せるかを特定する方法を提供します。これにより、科学者は自身の実験に最も関連性の高いモデルを選択できるようになり、臨床試験の失敗を減らせる可能性があります。この手法は、がん治療の全問題を解決したと主張するものでも、調整された細胞でテストされた薬が必ず患者に効くことを保証するものでもありません。むしろ、ラボと臨床の間の差異をより明確で正確なレンズを通して見るための手段を提供するものです。研究者たちは、コードを科学コミュニックティに公開しており、他の人々がこのツールを使用して、これまで断絶されていた細胞株と腫瘍の生物学という広大な世界を探求することを呼びかけています。
技術要約:ProtInt – 細胞株および腫瘍からのプロテオミクスデータの統合
問題提起
がん細胞株は前臨床研究において不可欠であるが、これらのモデルから得られる知見が臨床的な成功に至らないことが多い理由は、in vitro培養と患者の腫瘍との間の生物学的な相違に起因する。転写産物(トランスクリプトーム)データの統合手法は存在するものの、プロテオミクスデータに対して同様のアプローチは不足している。プロテオミクス統合における主要な障壁は、ランダムに欠損する(MAR)メカニ期およびランダムではない欠損(MNAR)メカニズムの両方から生じる欠損値の蔓延である。標準的なバッチ補正法(ComBat、Harmonyなど)は、生物学的に類似したデータセット間の技術的変動を除去するように設計されており、細胞株と腫瘍を隔てる深刻な生物学的・技術的差異に対処することはできない。さらに、既存の転写産物統合ツール(Celligner、MOBERなど)は、ラベルフリー・プロテオミクスに特徴的な強度依存的な欠損パターンを明示的にモデル化しておらず、欠損値を妥当な低発現量として推定するのではなく、ゼロとして再構成してしまうことが多い。
手法:ProtIntフレームワーク
著者らは、ラベルフリー・プロテオミクスデータを、データ統合とインピュテーション(補完)を同時に行うことで統合するために設計されたディープラーニングフレームワークであるProtIntを導入する。ProtIntは、以下の3つのコアコンポーネントで構成されている:
- 条件付き変分オートエンコーダ (cVAE): このモデルは、対数変換されたタンパク質強度(x)とデータソースの共変量(c、細胞株または腫瘍を示す)を、潜在埋め込み(z)へとエンコードする。デコーダはタンパク質発現分布を再構成する。標準的なインピュテーションとは異なり、ProtIntはPIMMSのアプローチに従い、観測された強度のみを再構成することで、欠損していないデータへのノイズの混入を回避する。
- 確率的ドロップアウトモデル: MNARパターンに対処するため、ProtIntはmsBayesImputeから派生した確率的ドロップアウト関数(Φ)を組み込んでいる。この関数は、タンパク質が欠損する確率をその強度(intensity)の関数としてモデル化する。モデルはバイナリ交差エントロピー損失(Ldropout)を最小化し、デコーダによって推定された欠損状態を観測された欠損パターンに適合させることで、欠損値を単にゼロとするのではなく、妥当な推定値を生成することを可能にする。
- 敵対的学習: 生物学的な変動(組織の起源)を保持しつつ、データソースのバイアス(細胞株と腫瘍の区別)を除去するために、ProtIntは敵対的ニューラルネットワークを採用している。この識別器(discriminator)は、潜在埋め込みからデータソースを予測しようとし、一方でエンコーダは、この予測誤差を最大化するように訓練されることで、データソースに不変な潜在空間を学習する。
著者らは、サイクル一貫性(シングルセル転写産物統合に触発されたもの)を含む代替アーキテクチャを評価したが、敵対的学習が、生物学的シグナルの保存を損なうことなく、特に高い重み付けパラメータにおいて、プロテオミクスデータの統合においてサイクル一貫性を上回ることを発見した。
主な貢献
- プロテオミクス統合のための初のディープラーニングフレームワーク: ProtIntは、MNARによる欠損を明示的にモデル化しながら、異なる生物学的コンテキスト(細胞株 vs 腫瘍)を横断してプロテオミクスデータを統合するために特別に開発された最初の手法である。
- インピュテーションと統合の同時実行: インピュテーションを敵対的学習ループ内に組み込むことで、ProtIntは、逐次的なインピュテーションとその後の統合に伴うエラー伝播を回避している。
- ベンチマーク: 本研究は、パンキャンサー(全がん種)のプロテオミクスデータセットを用いて、従来のバッチ補正(ComBat、limma、Harmony)および転写産物統合手法(Celligner、MOBER)と比較する包括的なベンチマークを提供している。
結果
著者らは、13の組織型にわたる771種類のがん細胞株と550種類の未治療の腫瘍サンプルのラベルフリー・プロテオミクスプロファイルを統合するためにProtIntを適用した。
- 統合のパフォーマンス: ProtIntは、結合埋め込み空間において細胞株と腫瘍の間の分離を排除することに成功した。これはバッチ補正や転写産物ベースの手法では達成できなかった成果である。定量的指標(graph iLISI)は、ProtIntが最高のレベルのデータセット統合を達成したことを確認した。元のデータと比較して生物学的シグナルの保存(graph cLISI)にわずかな減少が見られたが、これはデータの混合が成功したことによるものであり、組織特異的なクラスタリングの喪失によるものではない。
- インピュテーションの質: モデルは欠損値に対して妥当な推定値を生成した。これらは一般に、検出された値よりも低い強度をインピュテーションしており、これは低発現量のタンパク質が検出されない可能性が高いという生物学的な期待と一致している。
- 生物学的知見:
- 組織特異的なアライメント: 統合後、造血系/リンパ系、大腸、乳房、および神経外胚葉組織の細胞株は、中枢神経系(CNS)や平滑筋組織の細胞株よりも、対応する腫瘍に対して高いプロテオミクス的類似性を示した。
- プロテオミクス的シフト: 統合前の細胞株と「腫瘍投影(tumor projection)」後の比較による差異解析により、再発的な変化が明らかになった。免疫反応、細胞間コミュニケーション、および細胞外マトリックス相互作用に関連するタンパク質は、マイクロ環境のような特徴の獲得を反映して、存在量が増加した。逆に、転写、転写後プロセシング、およびミトコンドリア遺伝子発現に関与するタンパク質は、急速に分裂する細胞株と比較した腫瘍の増殖率の低下や代謝状態の変化を反映して、減少した。
- 分類: ProtIntの埋め込みにおいて最も近い細胞株の近傍に基づいて腫瘍サンプルを分類したところ、38%がその組織の起源に正しく割り当てられ、特定の組織型(肺、乳房など)でより高い精度が観察された。
意義と主張
本論文は、異なる生物学的設定間でのプロテオミクスデータセットの共同解析を促進するためのフレームワークとしてProtIntを位置づけている。著者らは、ProtIntを用いることで、患者の腫瘍に最も類似した細胞株を特定できると主張しており、これは臨床的に関連のある前臨床研究のためのモデルを選択する上で極めて重要である。
著者らは、現在のデータセットには一致する薬物応答データが欠けているため、アライメントされた細胞株が隣接する腫瘍と同様の薬物感受性を示すことを決定的に証明することはできないと控えめに述べており、これを将来の検証課題としている。また、現在の制限事項として、ProtIntはラベルフリーデータ用に設計されており、正規化によって強度と欠損の関係が変化するラベルベースのアプローチ(TMTなど)には適応が必要である可能性があることを認めている。著者らは、ProtIntがシングルセル・プロテオミクスデータの統合や、異なるデータモダリティ間での欠損パターンのモデリングといった将来の拡張のための基礎を提供するものであることを強調している。
毎週最高の bioinformatics 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録