✨ 要約🔬 技術概要
創薬という広大な領域において、科学者たちは、単一の鍵を見つけることよりも、むしろ「橋を架ける」ことに近いパズルに直面することがよくあります。断片ベース創薬(fragment-based drug-based discovery)として知られるこの戦略は、疾患ターゲットに対して弱く結合することが分かっている、小さく単純な分子の断片を取り上げ、それらを結合させることを目的としています。船が辛うじて触れることができる、離れた二つの島を想像してみてください。目標は、その二つの島の間に頑丈な橋を架け、船が自由に移動できるようにすることです。この橋は「リンカー」と呼ばれます。薬が機能するためには、この橋が二つの断片を繋ぐだけでなく、それらを非常に特定の三次元的な形状に保持し、阻止すべき生物学的な仕組みの中に完璧に適合させる必要があります。これらの橋を作ることは困難です。なぜなら、可能な形状の空間は膨大であり、紙の上では良く見えても、ラボで構築することが不可能であったり、自重で崩壊してしまったりする可能性があるからです。
シヴ・ナダル・インスティテューション・オブ・エクセレンス(Shiv Nadar Institution of Eminence)の研究者たちは、この問題を解決するために、「GeoLinker」と呼ばれる新しいツールを開発しました。既存の化学物質の膨大なデータベースを検索したり、分子を一つずつ組み立てたりする従来の手法とは異なり、GeoLinkerは、ゼロから橋の形状を想像することを学習する人工知能の一種を使用しています。このシステムは「拡散(diffusion)」と呼ばれる概念に基づいて構築されており、これは、ランダムなノイズの雲から始まり、明確で利用可能な構造が出現するまで、徐々にそれを洗練させていくプロセスと考えることができます。GeoLinkerを特別なものにしているのは、三次元空間のルールを理解する能力です。分子を回転させてもその化学的性質は変化しないということを理解しており、その知識を用いて、物理的に現実的で化学的に妥当な橋を生成します。
研究者たちは、原子が自然にどのように結合するかを学習させるために、既知の薬物様分子の膨大なコレクションを用いてこのシステムを訓練しました。訓練後、彼らはGeoLinkerの柔軟性を検証するために、4つの異なる方法でテストを行いました。指示を全く与えずに橋を架けさせることもあれば、どの原子に結合させるかを正確に指示する場合もあり、また、橋の長さを指定する場合もありました。さらに、結合点と長さの両方の要件を同時に満たす必要があるモードでもテストを行いました。結果は、GeoLinkerがこれまでに見たこともない多様な構造を生成できることを示しました。標準的な分子テストセットにおいて、このシステムはほぼ80%のケースで新しいデザインを生成しており、この新規性の割合は従来のメソッドよりも大幅に高いものでした。古いツールは、安全で予測可能ですが反復的なデザインを生み出す傾向がありました。対してGeoLinkerは、より広範な形状を探索し、より複雑な環構造や多様な結合を持つ分子を作り出しました。
しかし、この新しい形状の探索にはトレードオフが伴いました。GeoLinkerはユニークで複雑な構造を見つけることを優先しているため、生成された分子のうち、完全に化学的に妥当であった割合は、より保守的な旧来のツールよりも低くなりました。GeoLinkerが生成した分子のうち、厳格な化学チェックを通過したのは約45%であり、従来のツールのいくつかが90%を超えていたのと比較すると低い数値でした。研究者たちはこの違いを認め、彼らのアプローチは、たとえ不完全なデザインを多くふるいにかけることになったとしても、稀少で有望な候補を見つけるために、より広い網を投げるように設計されていると述べています。このシステムは、ヒトの体内に存在するタンパク質が関わる、より複雑で現実世界のシナリオにおいてもその価値を証明しました。これらの特定のタンパク質について明示的に教えられていないにもかかわらず、GeoLinkerは、既知の有効な薬物に似た方法で断片を繋ぐ橋を生成することに成功しました。例えば、Hsp90と呼ばれるタンパク質に関する特定のケースでは、システムは既知の阻害剤の形状を再現し、二つの断片を、成功した薬物の幾何学的形状と一致する3炭素鎖で結合させました。別のタンキンのケースでは、元の断片の不可欠な部分を維持しながら、その間に新しい橋を架けることで、強力な既知の阻害剤に非常によく似た分子を生成しました。
この研究は、単一のフレームワーク内で異なる種類の設計制約を扱うことができるこの統一されたアプローチが、創薬に対する強力な新しい考え方を提供することを示唆しています。科学者が、完全な自由から厳格な制約まで、異なるレベルのガイダンスを切り替えられるようにすることで、GeoLinkerは化学空間を探索するための柔軟なツールを提供します。研究者たちは、現在のシステムは多様な形状を生成することには優れているものの、次のステップは結果の化学的妥当性を向上させることであり、おそらく形状を構築しながら原子がどのように結合するかを予測するようにシステムに教えることであると指摘しています。現時点において、GeoLinkerは重要な前進であり、人工知能が分子の複雑な三次元世界をナビゲートするように訓練できることを証明し、いつか命を救う薬となるかもしれない「橋」を架けるための新しい視点を提供しています。
技術要約: GeoLinker
問題提起
フラグメントに基づく創薬(FBDD)は、低分子量のフラグメントから高親和性のリードを組み立てる系統的な戦略である。このプロセスにおける決定的なボトルネックは、分子リンカー設計 である。これは、2つ以上のフラグメントを、元の結合幾何学を維持しつつ、化学的に妥当で合成可能なリンカーで接続するタスクである。
既存の生成手法は、主に2つの制限に直面している:
表現の制約: 多くの手法は1次元または2次元の表現(例:SMILES)や逐次的なグラフ構築に依存しており、結合モードを維持するために必要な複雑な3次元幾何学的制約を捉えることに苦慮している。
柔軟性の欠如: 現在の最先端の等変拡散モデル(例:DiffLinker)は、通常、特定の条件設定に対して最適化されている。実用的な創薬ワークフローでは、同一プロジェクト内で異なる制約構成(例:無制約生成、アンカー誘導、サイズ条件付きなど)を切り替える必要がある場合が多く、そのたびに複数のモデルや再学習を必要とする。
手法
著者らは、単一の学習アーキテクチャ内で複数のフラグメント連結シナリオを扱うことができる、統一された SE(3)-等変拡散フレームワーク である GeoLinker を提案する。
コアアーキテクチャ
バックボーン: モデルは6層の 等変グラフニューラルネットワーク(EGNN) を利用している。これは、不変なスカラー特徴量(原子種)と等変な座標特徴量(3D位置)を処理する。
SE(3)-等変性: このネットワークは、生成された構造がグローバルな回転および平行移動に対して一貫して変換されることを保証する。これは、スカラーノード特徴量と二乗距離からエッジメッセージを構築し、重み付けされた相対変位ベクトルを介して座標を更新することによって実現される。
拡散プロセス: GeoLinkerは、条件付き幾何学的インペインティング問題として定式化された デノイジング拡散確率モデル(DDPM) を採用している。
順方向プロセス: フラグメントの座標を固定したまま、1,000タイムステップにわたってリンカー原子の位置にノイズが加えられる。
逆方向プロセス: モデルは、ノイズを含む入力からクリーンな座標(x 0 x_0 x 0 )を予測する。幾何学的整合性を強制するため、デノイジングの各ステップにおいて、フラグメントの位置は真の座標に置き換えられる。
統一条件付けフレームワーク
単一のモデルが、動的なマスキングと特定の条件付けモジュールを介して、4つの異なる設計モードをサポートする:
ベース(無制約): フラグメントの幾何学のみを条件としてリンカーを生成する。
アンカー誘導: アンカー認識クロスアテンション を用いて既知の付着原子を組み込む。ここでは、リンカーの表現がアンカーの表現にアテンションを向ける。アンカーの位置は逆拡散中、固定される。
サイズ条件付き: 学習されたサイズ埋め込みをノード特徴空間に投影することで、ターゲットとなるリンカー原子数(N l i n k N_{link} N l ink )に基づいて生成を条件付ける。
ジョイント(両方): アンカークロスアテンションとサイズ条件付けを組み合わせ、完全に制約された生成を行う。
学習目的と損失関数
モデルはZINCデータセット(438,610分子)を用いて、座標の再構成と幾何学的妥当性のバランスをとる統一された損失関数で学習される:
デノイジング損失 (L d e n o i s e L_{denoise} L d e n o i se ): 予測された座標と真の座標の間の平均二乗誤差(MSE)。
原子種損失 (L t y p e L_{type} L t y p e ): 原子分類のためのクロスエントロピー損失。
補助的幾何学損失:
エンドポイント距離損失: フラグメントのアンカーと最も近い生成されたリンカー原子との距離を罰し、1.5 Åの結合長を目標とする。
非アンカー反発損失: リンカー原子が非アンカーのフラグメント原子(1.8 Å以内)と結合を形成するのを防ぐ。
ステリック衝突損失: 非物理的な重なりを防ぐため、原子間距離が1.2 Åを下回る場合に二次関数的なペナルティを適用する。
後処理
生成された3Dポイントクラウドは、貪欲な原子価制約付き知覚手順に従って分子グラフに変換された後、MMFF94緩和とRDKitによるサニタイゼーションが行われる。
主な結果
GeoLinkerは、ZINC (イン分布)、CASF-2016 (生物活性タンパク質-リガンド複合体)、GEOM-drugs (構造的に多様なコンフォーマー)の3つのベンチマークで評価された。
多様性と妥当性のトレードオフ:
ZINC ベンチマークにおいて、GeoLinkerはDiffLinker(Uniqueness: 22.7%–51.4%; Novelty: 30.3%–47.7%)などのベースラインと比較して、大幅に高い Uniqueness (86.4%–88.7%)と Novelty (78.7%–82.1%)を達成した。
GeoLinkerは、より高いトポロジー複雑性を持つリンカー(リンカーあたり0.54–0.63環 vs ベースラインの0.21–0.36環)を生成した。
しかし、これはグラフベースの手法(最大99.3%)と比較して低い Chemical Validity (44.1%–45.5%)という代償を伴った。著者らは、これを座標優先のアプローチがより広い構造空間を探索するため、時に厳格なサニタイゼーションに失敗するトポロジーをもたらすためであるとしている。
汎化性能:
CASF-2016: GeoLinkerは、タンパク質ポケットの条件付けなしで、生物活性ポーズへのゼロショット汎化を実現し、約58%の妥当性と約71%の新規性を達成した。
GEOM-drugs: モデルは、構造的に不均一な分子に対して高い多様性(98%以上のUniqueness/Novelty)を維持した。
ケーススタディ:
Hsp90: GeoLinkerは、Hsp90 ATPaseポケット内の2つのフラグメントを接続する3炭素リンカーのトポロジーを正常に再構成し、既知の阻害剤のトポロジーを復元した(タニモト類似度 = 0.32)。
IMPDH: モデルは、複雑なフラグメントを接続する分子を生成し、参照阻害剤に対して0.643のタニモト類似度を示し、入力フラグメントの幾何学を保持した。
意義と主張
本論文は、GeoLinkerを、柔軟性の実用的なニーズに対処する 統一フレームワーク として位置づけている。その主な貢献は以下の通りである:
単一モデルの多用途性: 単一のSE(3)-等変アーキテクチャ内で4つの異なる制約レジーム(無制約、アンカー誘導、サイズ条件付き、およびジョイント)をサポートし、異なるワークフローの段階ごとに個別のモデルを用意する必要性を排除した。
強化された構造的多様性: 離散的なグラフトポロジーよりも3D幾何学生成を優先することで、GeoLinkerはより広い化学空間を探索し、既存の拡散ベースラインよりも大幅に高い新規性と環の複雑性を実現した。
実用的な適用可能性: 本フレームワークは、明示的なタンパク質ポケットの条件付けなしに、生物活性ターゲット(CASF-2016)や多様な化学空間(GEOM)に対して妥当なリンカーを生成できる能力を示している。
著者らは、多様性と妥当性のトレードオフ を明確に認めており、GeoLinkerが多様なスカフォールドの探索に優れている一方で、化学的妥当性はグラフベースのアプローチよりも低いことを指摘している。彼らは、これを、新しいブリッジングスカフォールドの探索が優先される初期段階の創薬における機能として捉えており、妥当性を向上させるために、直接的な結合予測と合成制約の統合が必要な将来の課題であるとしている。
毎週最高の biology 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×