あなたのDNAを、4つの文字のコードで書かれた巨大で古の指示書だと想像してみてください。何十年もの間、科学者たちは、この指示書を一行ずつ読み解くことで、誰が病気になる可能性があるかを予測しようとしてきました。彼らは、すべての文字が独立してわずかなリスクを加算していると想定してきました。これは、スープの味を予測するために、それぞれの材料を個別に味わって、その味を足し合わせようとするようなものです。この方法でもそれなりにはうまくいきますが、材料が混ざり合った時に起こる「魔法」を見逃してしまいます。現実の世界では、材料は相互に作用します。ニンニクは玉ねぎの味を変え、塩はトマトの性質を変えます。遺伝学において、これらの相互作用は「エピスタシス(遺伝子が互いに会話すること)」や「遺伝子と環境の相互作用(あなたの遺伝子が食事やストレスなどの要素にどのように反応するか)」と呼ばれます。科学者たちが抱いてきた大きな疑問は、「もし材料を一つずつしか見ていないとしたら、病気の『風味』のうち、どれほどの分量を見逃しているのだろうか?」ということです。
「加算的マルチローカス・バーデンとエピスタシス的相互作用による複雑な疾患の遺伝的リスク予測の向上」と題されたこの論文は、その「失われた風味」に深く切り込んでいます。研究者たちは、単に材料を足し合わせるだけでなく、それらがどのようにぶつかり合い、さらに「キッチンの環境」(血糖値や体重など)に対してどのように反応するかを見る、新しいタイプの遺伝的リスク計算機を構築しました。彼らはこれを、数百もの材料が複雑に絡み合う複雑なシチューのような「2型糖尿病」と、1つか2つの非常に主張の強いスパイスによって支配されている料理のような「セリアック病」という、2つの全く異なる疾患でテストしました。
ケリ・ムルターラーとアンドリュー・B・ムンカシ率いるチームは、UKバイオバンクの23万5千人のデータを使用して、彼らの新しい計算機の5つの異なるバージョンを作成しました。彼らは、従来の「加算的(additive)」な手法は、全員が同じ音を歌っている合唱を聞いているようなものだと発見しました。彼らの新しい手法は、そのハーモニーや不協和音を聞き取ろうとするものでした。彼らは、新しい計算機の異なるバージョンが、それぞれ異なる高リスク層を捉えていることを発見しました。実際、2型糖尿病については、新しいモデルによって特定された高リスク者の半数以上が、旧来の方法では完全に見逃されていました。それはまるで、古い計算機が「赤い帽子」を被った人を探していたのに対し、新しい計算機は「青いスカーフ」「緑の靴」「黄色い手袋」を身につけた人も探し出し、最初の計算機が無視した多くの人々を見つけ出したようなものです。
これらすべての異なる「耳」を一つのスーパー計算機へと統合したとき、彼らはBMIや血糖値といった標準的な医学的チェックでは健康に見える人々も含め、さらに多くの高リスク者を特定することができました。しかし、この論文はまた、この新しいアプローチは複雑で混ざり合った遺伝学を持つ疾患において最も効果を発揮することも指摘しています。少数の非常に強力な遺伝的シグナル(圧倒的な力を持つ単一のスパイスのようなもの)によって駆動されるセリアック病に対しては、新しい手法は大きな付加価値をもたらしませんでした。研究者たちは、このアプローチはまだ魔法の特効薬ではないものの、私たちが長らく無視してきた、私たちの遺伝的リスクの隠れた相互作用的な側面を理解するための扉を開くものであると示唆しています。彼らは、これらの知見が医師によって臨床現場で使用される前に、より多様な集団や現実の臨床環境でテストされる必要があると強調していますが、その結果は、遺伝子が互いに、そして私たちの環境とどのように相互作用するかを見ることが、誰が病気になるかを予測する上で極めて重要な次の一歩であることを示唆しています。
技術要約:加算的マルチローカス・バーデンとエピスタシス相互作用による複雑疾患の遺伝学的リスク予測の向上
問題提起
従来のポリジェニック・リスク・スコア(PRS)は、ゲノムワイド関連解析(GWAS)からの加算的効果を集計することで遺伝学的リスクを推定する。しかし、複雑な疾患のリスクは、標準的な加算モデルでは系統的に除外されてしまう遺伝子間(エピスタシス)および遺伝子・環境相互作用を含む広義の遺伝率(H2)を反映している。多くの手法がより高次の遺伝的効果をモデル化することを試みてきたが、その多くは相互作用項を明示的に保持できないか、あるいは予測性能のために解釈性を犠牲にしている。その結果、相互作用を考慮した特徴量表現が、ポリジェニック・リスクの補完的かつ非重複的な成分をどの程度捉えられるのかは不明なままである。
方法論
著者らは、寄与する遺伝子座や環境変数を保持しつつ、補完的なマルチローカス特徴量エンコーディングを明示的に組み込む、interpretable(解釈可能な)機械学習フレームワークである「extended PRS(ePRS)」を開発した。本研究では、UKバイオバンクの、血縁関係のない白人英国人参加者約235,000人のデータを用い、トレーニング(70%)、バリデーション(20%)、ホールドアウト(10%)のセットに分割して利用した。
このフレームワークは、以下の2つの疾患に焦点を当てた:高度に多遺伝子性である2型糖尿病(T2D)、およびHLA(ヒト白血球抗原)の効果が支配的なセリアック病(CD)。
核となる手法は以下の通りである:
- 特徴量の発見: PLINKの高速エピスタシス・スクリーニング(p<5×10−6)を用いた、統計的に有意なSNPペアの特定。
- デュアル・エンコーディング戦略: 同一の有意なSNPペアを、2つの異なる特徴量表現へと変換した:
- マルチローカス加算的バーデン(G+G): ペアとなった遺伝子座間のアレルカウントを合算し、累積的なアレル・バーデンを捉える。
- 統計的エピスタシス(G×G): アレルカウントを乗算し、加算的独立性からの逸脱をモデル化する。
- 遺伝子・環境統合: G+GおよびG×Gの特徴量を、72個の心代謝臨床変数(E)と組み合わせ、相互作用モデル(G+G×EおよびG×G×E)を生成した。
- モデル訓練: 7つのL1正則化(Lasso)ロジスティック回帰モデル(G、G+G、G×G、G+G×E、G×G×E、および組み合わせたバリアント)を訓練した。
- 冗長性フィルタリング: 厳格な統計プロトコル(Cohenのκ、Jardard指数、およびDeLong検定を使用)を適用し、統計的に異なるモデルのみを特定・保持することで、保持されたモデルが冗長なシグナルではなく、独自の高リスク集団を捉えることを保証した。
- 複合スコアリング: 保持された個別のモデルのいずれかにおいて閾値を超えた場合に高リスクと分類する、複合スコア(ePRSComp)を構築した。
主な結果
- 明確に異なる高リスク集団: T2Dにおいて、5つの統計的に異なるePRSモデルが保持された。これらのモデルは、大部分が非重複の高リスク個人を特定した。具体的には、バリデーションセットにおけるT2D症例の78%が特定され、これら症例の53%は単一のモデルにのみ含まれていた。G+GモデルとG×Gモデルは、同一のSNPペアから派生しているにもかかわらず非冗長であり、補完的な生物学的シグナルを捉えていることが示された。
- 優れた症例検出能: 補完的なモデルを統合した複合スコア(ePRSComp)は、標準的な加算的PRS(PRSG)および従来の臨床予測因子を上回る症例検出を実現した。ホールドアウトセットにおいて、ePRSCompはT2D症例の77%(2,077/2,696)を特定し、これにはPRSG単独では見逃されていた1,323の追加症例が含まれていた。
- 臨床的妥当性: 複合スコアは、臨床的に正常な範囲(例:正常なBMI、血糖値、HbA1c)にある個人を、高リスクカテゴリーへと再分類することに成功した。グルコースに関しては、純再分類改善度(NRI)が正の値(0.08)を示しており、これはePRSCompが標準的な臨床閾値に対して補完的な遺伝学的成分を捉えていることを示している。
- 疾患構造への依存性: 相互作用モデリングの恩恵は、疾患特異的であった。T2Dでは、相互作用モデルが相当量の独自の情報を捉えた。一方、CDでは、HLA主導の加算的構造により、利得はより緩やかであったが、相互作用モデルは依然として、特にHLAと環境の相互作用によって駆動される独自の症例を特定した。
- 生物学的解釈性: モデル固有の特徴量は、特定の生物学的経路および確立されたT2Dサブタイプ(SAID, SIDD, SIRD, MOD, MARD)にマッピングされた。例えば、G×G×Eモデルは肝臓/脂質代謝および重症インスリン抵抗性糖尿病(SIRD)に富み、G+Gモデルはβ細胞機能不全および代謝経路全般にわたる広い表現を示した。
意義と主張
本論文は、補完的なマルチローカス特徴量表現が、従来の加算的PRSが見落としているポリジェニック・リスクの異なる成分を捉えていると主張している。著者らは、直交する特徴量エンコーディングが個別の高リスク個人を特定する場合、AUCのような集約的な識別指標は、相互作用モデルの価値を過小評価する可能性があると述べている。
主な貢献は以下の通りである:
- 補完性の実証: 加算的バーデン(G+G)と統計的エピスタシス(G×G)が、同一の基礎的な遺伝データから派生しているにもかかわらず、異なるサブセットの高リスク個人を捉えることを示した。
- 欠落した遺伝率への対処: 非加算的遺伝的効果および遺伝子・環境相互作用が、T2Dのような代謝性疾患における広義の遺伝率に大きく寄与している証拠を提供した。
- 臨床的有用性: 複合的なアプローチを用いることで、標準的な臨床スクリーニングでは見逃される可能性のある高リスク個人(特に代謝プロファイルが正常な者)を特定できることを示した。
- 解釈可能性: 相互作用項を明示的にモデル化することで生物学的解釈性を維持し、特定のローカス・ペアや環境コンテキストに関する検証可能な仮説の生成を可能にした。
著者らは、複数の特徴量エンコーディングを統合するメリットは遺伝的ヘテロジェネティクス(多様性)の大きさに比例すると結論付けており、生物学的な解釈可能性を維持しながら、高度に多遺伝子的な疾患の予測精度を向上させる道筋を提示している。なお、臨床応用には前向きな検証が必要であると注記している。
毎週最高の genetic and genomic medicine 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録