人体を、巨大で活気あふれる一つの都市として想像してみてください。この都市では、あらゆる遺伝子が市民であり、彼らが作るタンパク質は、互いに会話するための道具やメッセージです。これらの会話は、「タンパク質相互作用ネットワーク」と呼ばれる巨大なつながりの網を形成します。時として、数人の市民が病に倒れ、その悪い習慣が都市中に広がり、疾患を引き起こすことがあります。科学者たちは、こうした病んだクラスターを「疾患モジュール」と呼びます。大きな課題は、私たちは数人の「悪いリンゴ(確認された疾患遺伝子)」の名前は知っていますが、残りの厄介者たちが誰なのかは全く分かっていないということです。都市の他の住民は、ラベルのない大きな群衆に過ぎません。もし、他の全員が健康であると仮定して誰が病気かを推測しようとすれば、間違えてしまうかもしれません。なぜなら、それらの「健康な」人々の中には、実際には病んでいるのに、まだ捕まっていない人々がいるかもしれないからです。これが、疾患遺伝子を見つけ出す際のトリッキーなパズルです。つまり、誰が善人で誰が悪人なのか確信が持てない中で、どのようにして隠れた厄介者を見つけ出すのか、という問題です。
ここで、XG-PULと呼ばれる新しいツールが登場します。これは、都市の網に対する超スマートな探偵として機能します。研究者のマディエ・アユマンとザフラ・ナリマニは、この特定の問題を解決するためにコンピュータ・フレームワークを構築しました。彼らは「誰が健康か」を推測する代わりに、「ポジティブ・アンラベル学習(Positive-Unlabeled learning)」という巧妙な戦略を用いました。これは、まるで「熱いか冷たいか(ホット・アンド・コールド)」のゲームのようなものです。宝物がどこにあるか(確認された疾患遺伝子)は分かっていますし、都市の地図(タンパク質ネットワーク)もありますが、他の宝物がどこに隠されているのかは分かりません。XG-PULはまず、市民が誰と付き合い、都市の中でどれほど中心的な存在であるかを見るだけで、病んでいるか健康であるかを知ることなく、すべての市民の「性格」を学習します。次に、一連の探偵たち(分類器のアンサンブル)を用いて、誰が最も疾患クラスターの一部である可能性が高いかを投票させます。多くの探偵が少しずつ異なる人々のグループを観察し、その投票を平均化させることで、システムは、たとえ健康を装っている者がいたとしても、隠れた厄介者を特定することに非常に長けているのです。
チームはこの探偵を、乳がん、統合失調症、肝硬変を含む10種類の複雑な疾患でテストしました。彼らはXG-PULを、長年使用されてきた他の有名な手法と比較しました。結果は有望でした。XG-PULは、最も可能性の高い疾患遺伝子をリストの最上位にランク付けすることに優れていました。例えば、乳がんに関連する遺伝子を探す際、このシステムは既知の生物学的に重要な遺伝子をリストの非常に高い位置に配置することに成功し、単にランダムに推測しているのではないことを証明しました。また、細胞間のコミュニケーションや免疫系による防御など、特定の経路に関与する遺伝子も見つけ出しました。
しかし、論文はこれがすべてを解決する魔法の弾丸であるとは主張していません。著者らは、彼らの手法が現在の「都市の地図」に依存しており、その地図はまだ不完全であることを指摘しています。もし地図からある街区が丸ごと欠落していれば、探偵はその中に隠れている厄介者を見つけることはできません。また、現在のバージョンは都市全体を見ており、特定の街区(脳だけ、あるいは肝臓だけ、といった具合に)をチェックしていないため、非常に特殊な詳細を見逃してしまう可能性があります。しかし、現時点では、XG-PULは、都市の地図の賢い読み解き方とチームによる投票システムを組み合わせることで、複雑な疾患の原因となる新たな手がかりを見つけ出し、科学者が最も有望な容疑者に実世界の実験を集中させる助けとなることを示唆しています。
XG-PULの技術要約:疾患遺伝子優先順位付けのためのネットワークベースのフレームワーク
問題提起
疾患に関連する遺伝子の特定は、創薬ターゲットの発見やバイオマーカーの開発において極めて重要であるが、実験的な検証には多大なコストと時間がかかる。生物学的ネットワークに基づく計算手法は代替案となるが、根本的な課題に直面している。それは、信頼できる負例(negative examples)の欠如である。疾患遺伝子の優先順位付けにおいては、疾患に関連することが確認されている遺伝子(正クラス)は限られている一方で、残りの大多数の遺伝子は「負」であることが確認されたのではなく、単にラベルが付与されていない状態である。未ラベルの遺伝子を信頼できる負例として扱うことは、系統的なバイアスとラベルの不確実性を導入し、標準的な教師あり学習モデルの性能を低下させる。既存のアプローチは、特に複雑なネットワークトポロジーを統合する場合において、この「正・未ラベル(Positive-Unlabeled: PU)」の設定を効果的に扱うことに苦慮することが多い。
手法
著者らは、タンパク質相互作用(PPI)ネットワークを用いたPU学習条件下での疾患遺伝子優先順位付けのために設計された機械学習フレームワークであるXG-PULを提案する。本フレームワークは、以下のマルチステージ・パイプラインを通じて動作する。
- データキュレーション: 本研究では、BioGRID由来のヒトPPIネットワーク(約19,761個の遺伝子と約682,195個の相互作用を含む)を利用し、DisGeNETから遺伝子・疾患関連データを取得した。乳がん、統合失調症、大腸癌を含む10種類の複雑な疾患を分析した。
- グラフ表現学習: クラスラベルに依存せずに潜在的な構造的関係を捉えるため、フレームワークはNode2Vecを用いて低次元のノード埋め込み(embedding)を生成する。著者らは4つの埋め込み構成(次元数とウォークパラメータのバリエーション)を体系的に評価し、多様な疾患に対して安定した性能を示したHighDim構成(d=256)を選択した。
- 特徴量の統合: Node2Vecの埋め込みを、次数中心性、媒介中心性、PageRank、近接中心性、クラスター係数を含む明示的なグラフトポロジー的特徴量と組み合わせる。ランダムフォレスト分類器を使用して、不純度に基づく重要度スコアによって特徴量をランク付けし、予測性能と計算効率のバランスをとるために、最も情報量の多い上位150個の特徴量を保持する。
- バギングベースのPU学習: 負のサンプルが確定していない状況に対処するため、XG-PULはバギングベースのPU分類器を採用している。この戦略では:
- 既知の疾患遺伝子(シード遺伝子)が正の訓練セットとして機能する。
- 未ラベルの遺伝子プールは、ブートストラップ法によって繰り返し再サンプリングされ、代理の負のセットを作成する。
- これらのブートストラップ・サンプルに対して複数の分類器を訓練する。
- 最終的な予測は、未発見の疾患遺伝子を負として扱うことによって導入されるバイアスを軽減するために、集約(例:確率平均化)される。
- これらの分類器に使用される基本学習器はXGBoostである。
- 遺伝子ランキング: アンサンブルモデルはすべての候補遺伝子に対して疾患関連スコアを割り当て、各ターゲット疾患に対するランク付けされたリストを生成する。
主な結果
XG-PULは、DIAMOnD、Random Walk with Restart (RWR)、MCL、およびXGDAG(GNNExplainerおよびGraphSVXのバリアント)を含む、代表的なネットワークベースおよびグラフ学習ベースラインと比較して評価された。
- 数値的性能: 10種類の複雑な疾患にわたり、XG-PULはAUPR(精度-再現率曲線下面積)および**F1スコア(K=500における)**において一貫して優れた性能を示した。例えば、乳がんにおいて、XG-PULはAUPR 0.6522、F1@500 0.1768を達成し、次に優れた手法であるXGDAG-GraphSVX(それぞれ0.5442および0.1152)を上回った。また、AUC-ROCスコアにおいても競争力のある、あるいは優れたスコアを維持した。
- 堅牢性: 本フレームワークは、変動するランキング閾値(K)に対しても一貫した性能を示し、異なる候補リストのサイズにわたって関連する遺伝子を効果的に優先順位付けできることを示した。
- 生物学的妥当性: Enrichrを用いた機能濃縮解析により、上位ランクの候補が疾患に関連する経路(例:統合失調症における神経シグナル伝達、乳がんにおける免疫調節)に有意に濃縮されていることが示された。特定の疾患におけるトップ10候補の文献レビューでは、既知の疾患関連遺伝子(例:乳がんにおけるMAP2K6, USP15; 統合失調症におけるGRID2, ITGB2)が優先順位付けされたリストの上位に現れており、モデルが生物学的に意味のあるターゲットを回収できる能力を確認した。
主な貢献
- 新規フレームワーク: ラベルに依存しないネットワーク埋め込み(Node2Vec)を、PU学習の設定内で明示的なトポロジー的特徴量と一意に統合したXG-PULの導入。
- ラベルの不確実性の処理: 信頼できる負のサンプルが欠如しているという、疾患遺伝子発見における一般的なボトルネックを緩和するために、XGBoostを用いたバギングベースのPU戦略を適用。
- 特徴量の相乗効果: 潜在的なネットワーク埋め込みと明示的なトポロジー記述子を組み合わせることが、埋め込みのみを使用する場合よりも優れた予測性能をもたらすことを実証。
- 包括的な評価: 10種の色々な疾患にわたる厳格なベンチマークを実施し、最先端のネットワークベースおよびグラフ学習手法を一貫して凌駕することを示した。
意義と主張
論文は、XG-PULが不完全な生物学的知識を特徴とするシナリオにおいて、堅牢な疾患遺伝子優先順位付けのフレームワークを提供すると主張している。未ラベルの遺伝子が負であるという仮定を避けることで、本手法は系統的なバイアスを軽減し、真の疾患関連遺伝子の回収率を向上させる。著者らは、本アプローチが現在の注釈を超えて、疾患に関連する経路や分子メカニズムに関与する遺伝子を効果的に特定できると断言している。
本研究は、ネットワーク表現学習とPU学習の統合が、新たな疾患関連遺伝子の発見に向けた実行可能な戦略となることを結論づけている。しかし、著者らは謙虚に限界についても認めており、本フレームワークが静的でコンテキストに依存しないPPIネットワークおよびキュレートされたデータベースに依存しており、それが既知の遺伝子へのバイアスを生じさせ、組織特異的またはサブタイプ特異的なバリエーションを捉えられない可能性があると述べている。彼らは、今後の研究において、疾患モジュールの特定をさらに精緻化するために、マルチオミクスデータやコンテキスト特異的な発現プロファイルを組み込むことができると示唆している。
毎週最高の biology 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録