生細胞内において、薬物分子はただ一つの標的に出会うわけではない。それは、多くの異なるファミリーに属する膨大な種類のタンパク質が存在する、混雑した環境の中を漂っている。分子の最終的な影響は、意図した標的への結合だけでなく、これらすべての相互作用の総和である。数十年もの間、これらの相互作用を研究するための標準的な手法は、「この特定の薬物は、この特定のタンパク質に結合するか?」という一度に一つの質問を投げかけることだった。研究者たちは、その単一の相互作用を予測するためのモデルを構築してきたが、創薬の現実はこれほど孤立していることはめったにない。科学者たちは、意思決定を左右する二つの実用的かつ比較的な問いに直面することが多い。すなわち、「新しい候補薬物がある場合、二つの潜在的な標的のうち、どちらにより結合しやすいか?」、そして逆に、「特定の標的がある場合、二つの候補薬物のうち、どちらがより適しているか?」という問いである。これらの問いに答えることは、研究者が次にどの化合物を合成すべきか、また、薬が臨床段階に達するずっと前の早い段階で、どの望まぬ副作用をスクリーニングすべきかを判断する助けとなる。
研究チームは現在、これら比較的な問いに答えるために特別に設計された二つのコンピュータモデルを構築した。単一の薬物とタンパク質のペアに対して正確な結合強度を計算しようとするのではなく、これらのモデルは二つの項目を同時に見て、単に勝者を選ぶ。一つのモデルは、一つの薬物と二つの異なるタンパク質を取り込み、その薬物がどちらのタンパク質を好むかを予測する。もう一つのモデルは、一つのタンパク質と二つの異なる薬物を取り込み、そのタンパク質がどちらの薬物を好むかを予測する。これらのモデルは、80万種類近い独自の薬物分子と2,700種類以上のヒトタンパク質を含む、120万件以上の測定値からなる大規模な公開データベースを用いて訓練された。極めて重要な点は、これらのモデルはタンパク質や薬物分子の三次元的な形状に依存していないということである。モデルは、結合ポケットの正確な構造を知る必要も、分子がどのようにねじれ、回転して適合するかをシミュレーションする必要もない。その代わりに、タンパク質を構成するアミノ酸の生の配列と、薬物の化学構造の二次元マップを用いて機能する。
結果は、この直接比較のアプローチが驚くべき精度で機能することを示している。異なるファミリーの二つのタンパク質の間で選択を求められた際、モデルは約75パーセントの割合で正しい優先標的を選択した。二つのタンパク質が同じファミリーに属する場合、その精度は78パーセントに上昇した。逆の問い、つまり単一の標的に対する二つの薬物の選択については、モデルは71パーセントの確率で正解を出した。研究者たちは、モデルの確信度が信頼できるガイドになることを見出した。モデルがその選択に非常に自信を持っているとき、その精度は90パーセント以上に跳ね上がる。しかし、二つの選択肢の測定された活性が非常に似通っている場合、モデルの識別能力は低下するが、これは実験データ自体を分離することが困難になるという事実を反映している。モデルは、見たことがない薬物分子を用いてテストされており、その結果が単なる過去のデータの記憶ではなく、真の汎化能力であることを保証している。
この研究の主要な発見は、これらの予測の精度が、単にコンピュータアルゴリズムの洗練度だけでなく、科学的記録にある利用可能なデータに大きく依存しているということである。モデルが二つの異なるタンパク質ファミリーを比較するためには、両方のファミリーに対してテストされた薬物を経験している必要がある。研究者たちは、データベース内の薬物分子のうち、二つの異なるタンパク質ファミリーにわたって測定されたものは、わずか4.6パーセントしかないことを発見した。このクロスファミリー・データの不足は、遠い標的同士を比較する際のモデルの性能に自然な限界を課している。対照的に、単一のタンパク質ファミリー内ではデータがより豊富であり、より多くの比較が可能である。これらのモデルは、結合の正確な強度を予測したり、物理的な実験に取って代わったりするために設計されたものではない。むしろ、それらは研究者がどの実験を優先的に行うべきかを判断するための強力な選別ツールとして機能する。絶対値ではなく「好み(優先順位)」に基づいて標的と化合物をランク付けすることで、これらのツールは、関与するすべてのタンパク質の詳細な三次元構造を知ることなく、複雑な薬物相互作用の景観をナビゲートする方法を提供する。
技術要約:2つのコンパレーターがあれば十分かもしれない
問題提起
創薬において、細胞内の化合物は複数のファミリーにわたる幅広いタンパク質と同時に相互作用するが、標準的なスクリーニングやモデリングでは通常、一度に一つの標的のみを検証する。低分子化合物は本質的に多標的性(プロミスキャス)を持ち、オフターゲット活性が安全性における脱落の要因となることが多いが、ほとんどの予測モデルは、一つのタンパク質と一つの化合物を個別にスコア化する。その結果、選択性や好みの度合いを導き出すには、2つの別々の親和性予測値を差し引く必要があり、このプロセスは、公開されている活性データ(実験室やアッセイによってほぼ1ログ単位で変動し得る)の不均一性に苦慮する。また、「この2つの標的のうち、化合物はどちらを好むのか?」や「この2つの化合物のうち、標的はどちらを好むのか?」といった、意思決定を左右する比較的な問いに直接答えることもできない。
手法
著者らは、ChEMBL 37から得られた2,279個のヒトタンパク質(34のタンパク質ファミリーに該当)を対象とした、公開データのみに基づく2つの相互的な構造フリー(structure-free)モデルを構築した。どちらのモデルも、タンパク質構造、結合部位、ドッキングポーズ、またはコンフォメーション解析を利用しない。
- データキュレーション: データセットは、794,638個の化合物による1,263,626個の測定値(Ki, IC50, Kd, EC50, Kb)で構成される。データは、ヒトの単一タンパク質標的かつChEMBLレベル2のクラスラベルを持つものに限定された。数値はpActivity(濃度の負の常用対数)に変換され、タイ(同値)は除外された。
- 特徴量表現:
- タンパク質: ESM2-t12-35Mタンパク質言語モデルから派生した、480次元の残基ごとの平均ベクトルとして表現される。
- 化合物: 1,024個の値を持つ半径2のMorganカウントフィンガープリントと、14個の全分子記述子(分子量、原子数など)で表現される。
- モデルアーキテクチャ: 両方のコンパレーターは、ペアワイズ(対比較)入力形式をとるランダムフォレスト(それぞれ300本の決定木)である。
- 標的コンパレーター (Target Comparator): 入力は (配列A, 化合物, 配列B) である。これは、化合物がどちらの標的を好むかを予測する。このモデルは、異なるファミリー間での比較と、単一ファミリー内での比較の両方のシナリオを扱う。
- 化合物コンパレーター (Compound Comparator): 入力は (化合物A, 配列, 化合物B) である。これは、単一の標的がどちらの化合物を好むかを予測する。
- 学習戦略: 厳格な汎化性能を確保するため、モデルは化合物が重複しないホールドアウト法を用いて評価された。化合物コンパレーターの場合、両方の化合物が学習中に未知であった場合にのみ、その比較をテストセットに含め、学習とテストの境界を跨ぐ比較は破棄した。すべての比較は、対称性を強制するために、位置を入れ替え、ラベルを反転させた状態で2回ずつ入力された。
- 出力: モデルは絶対的な親和性値ではなく、0.50(判定不能)から1.00(確信)の範囲の範囲の「好みの強さ(preference strength)」としての確率を返す。
主な結果
モデルは、標的または化合物(コンパレーターに応じて)のいずれも学習時に現れなかった保持された比較に対して評価された。
- 標的の好み(ファミリー間): 異なるファミリー間の8,689件の保持された比較において、モデルは75%の割合で好ましい標的を正しく特定した。最も確信度の高い予測(強さ ≥ 0.80)では、精度は94%に上昇した。
- 標的の好み(ファミリー内): 同一ファミリー内の32,738件の比較において、精度は78%であり、高確信度の呼び出しでは95%に達した。キナーゼファミリーは、構造的な類似性が高いためか、最も困難なケースとなった(精度73%)。
- 化合物の好み: 学習中にどちらの化合物も見られなかった65,725件の保持された比較において、モデルは71%の割合で好ましい化合物を正しく特定した。この精度は、最も確信度の高い予測において96%に達した。
- 差の大きさと影響: 精度は、真の活性差の大きさと強く相関している。2つの測定値の差が2ログ単位を超えている場合、精度は90%から92%の範囲であった。これらが0.5ログ単位以内である場合、精度は偶然レベル(0.57–0.64)まで低下した。
- カバレッジの制限: ファミリーを跨ぐ標的比較の性能の天井は、モデルのアーキテクチャではなく、利用可能なデータの記録によって制限されている。データベース内の分類された化合物のうち、2つ以上のタンパク質ファミリーにわたる測定値を持つものは、わずか4.6%である。
意義および主張
本論文は、直接的なペアワイズ比較が、優先順位付けのワークフローにおいて、絶対的な親和性を予測することよりも実用的かつ堅牢なアプローチであることを提唱している。著者らは、これら2つのコンパレーターが、典型的な創薬カスケードにおける完全なランキングツールを提供すると主張している。すなわち、化合物コンパレーターは次に何を合成または購入すべきかを決定するのに役立ち、標的コンパレーターは、何に対してカウンタースクリーニングを行うべきかを決定するのに役立つ。
主な貢献は以下の通りである:
- 広範性: ペアワイズ比較を(キナーゼやGPCRのような)単一のファミリーを超えて、34の多様なタンパク質ファミリーへと拡張したこと。
- 構造フリーの予測: 配列と2D化学記述子のみで、構造データなしに標的や化合物を効果的にランク付けできることを示したこと。
- 厳格な評価: 化合物が重複しない分割(compound-disjoint splits)を用いた厳格なベンチマークを確立し、モデルが未知の化学構造に対して汎化することを保証したこと。
- 運用の有用性: モデルは精度と相関する「好みの確率」を出力するため、ユーザーは高確信度の決定のためにフィルタリングを行うことができる。著者らは、モデルは表現されている化学空間および標的空間内において化合物や標的を適切にランク付けするが、効力を推定するものではなく、毒性や安全性の結果を直接予測するものではないとも述べている。
この研究は、ユーザーが独自のデータを用いて拡張できる「ファミリー・ファウンデーション・モデル」としての基礎的なステップとして提示されている。これは、Random Forestのアーキテクチャにより、モデル全体を再学習することなく新しい決定木を結合できるためである。モデルとコードは、コミュニティによる採用と拡張を促進するために、オープンライセンスの下で公開されている。
毎週最高の bioinformatics 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録