Interrogating contrastive learning embeddings for structure-based virtual screening: a case study on DrugCLIP
本論文は、構造ベースのバーチャルスクリーニングにおけるDrugCLIPの対照学習埋め込みを体系的に評価しており、そのポケット埋め込みが高速かつ堅牢な構造類似性検索を提供する一方で、リガンド埋め込みは未知の標的に対する強力な汎化性能を伴うポケット認識的な化学パターンを捉えるものの、その性能はコンフォメーションの変化や予測されたタンパク質ポケットの不正確さによって著しく制限されることを明らかにしている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む
新しい薬を見つけ出すことは、遅くて高価なギャンブルです。たった一つの薬を市場に出すまでに15年の歳月と10億ドル以上の費用がかかることもあり、その主な理由は、多くの候補が途中で失敗するためです。この無駄を減らすために、科学者たちはコンピュータプログラムを使用して、数百万もの化学化合物の中から、特定の疾患を引き起こすタンパク質に結合する可能性のあるわずかなものを探し出します。「バーチャルスクリーニング」と呼ばれるこのプロセスは、膨大なライブラリを絞り込み、実世界のテストに適した管理可能なリストへと凝縮するフィルターの役割を果たします。数十年にわたり、この作業は薬の物理的な形状をタンパク質の結合部位の形状に一致させることに依存してきましたが、これは計算負荷が高く、現在利用可能な膨大な数のタンパク質や化学物質に対しては、あまりにも遅すぎることが多々ありました。
最近、この探索を言語翻訳の問題として扱う新しいアプローチが登場しました。個々の相互作用の物理学を計算する代わりに、これらの手法は人工知能を用いて、タンパク質の結合ポケットと薬分子の両方を、数値による共通の抽象的な言語へと翻訳します。この共通の空間において、タンパク質によく適合する薬は、タンパク質自身のパターンと非常によく似た数値パターンを持ち、適合しないものは全く異なるものになります。これにより、コンピュータはこれらの数値パターンを比較するだけで、優れた一致を見つけることができ、このプロセスは驚異的に高速です。「DrugCLIP」と呼ばれる一つのツールは大きな有望性を示していますが、これまでは、これらの抽象的な数値パターンが実際に何を表現しているのか、科学者たちは完全には理解していませんでした。彼らはツールが機能することは分かっていましたが、それが真に化学を理解しているのか、それとも単に答えを暗記しているだけなのかは分からなかったのです。
ユニバーシティ・カレッジ・ロンドンの研究チームは、DrugCLIPの「ブラックボックス」を開き、内部で正確に何が起きているのかを解明することに決めました。彼らはこのツールを魔法の杖としてではなく、測定可能で理解可能なシステムとして扱いました。彼らの調査により、このツールは単に薬をタンパク質に一致させることよりも、はるかに有用なことを学習していることが明らかになりました。研究者たちは、ツールのタンパク質結合ポケットに関する内部表現があまりにも正確であるため、既存のどの手法よりも優れた精度で、異なるタンパク質間における類似のポケットを特定できることを見出しました。しかも、それは100倍以上速いスピードで行われました。これは驚くべきことです。なぜなら、このツールは類似のポケットを見つけるよう明示的に教えられておらず、単に結合する薬を見つけるように教えられていただけだからです。しかし、薬を見つけることを学習する過程で、ツールは意図せずして、ポケット自体の形状と構造を驚くほど精密に認識することを学んでいたのです。
チームはまた、ツールが分子の物理的な現実をどのように扱っているかを検証しました。タンパク質や薬は硬直した彫像ではありません。それらは揺れ動き、変化します。研究者たちは、もし薬分子が少し異なる形状で見せられたり、あるいはタンパク質が少し異なる位置にあったりした場合、ツールが混乱するかどうかをテストしました。その結果、ツールは極めて堅牢であることが分かりました。同じ薬が数十種類の異なる揺らぐ形状で見せられたとしても、ツールはそれらを同じ分子として認識しました。同様に、タンパク質ポケットが、ある時は薬と結合し、ある時は空の状態であり、また別の時は他のAIモデルによって予測された状態であるといった、異なる状態で示された場合でも、ツールの内部マップは一貫していました。しかし、研究は、ツールの性能が低下し始める明確な境界線も描き出しました。研究者が、結合部位に誤ったアミノ酸を含む予測されたタンパク質構造を使用したり、タンパク質の側鎖が間違った方向を向いていたりする場合、正しい薬を見つけるツールの能力は著しく低下しました。これは、ツールは強力ではあるものの、提供されるタンパク質の物理的構造の正確さに依存していることを示しています。
おそらく最も重要な発見は、ツールが暗記に頼っているかどうかを確認するためのテストでした。研究者たちは、ツールが学習データから答えを単純に呼び出せないよう、見たことがないタンパク質と化学物質を用いて、厳格なテストを作成しました。結果は心強いものでした。完全に新しい化学構造を持つ新しいタンパク質に対しても、ツールは依然として、全候補の中で正しい薬を上位1パーセント以内にランク付けすることに成功し、その割合は約55パーセントから75パーセントのケースに及びました。これは、ツールが単に既知のペアのリストを暗記しているのではなく、タンパク質と薬がどのように相互作用するかというルールを真に学習していることを証明しました。それは、ツールが全く新しい状況に対しても知識を一般化できることを示しており、これは実世界の創薬において極めて重要な要件です。
研究は、DrugCLIPのようなツールは、飛躍的な進歩と能力の向上をもたらす一方で、まだ完璧ではないと結論付けました。その成功は、提供されるタンパク質の構造の正確さに左右されます。もしタンパク質の初期モデルが少しでもずれていたり、予測された結合部位に誤った原子が含まれていたりすれば、ツールの性能は損なわれます。研究者たちは、これらのシステムを改善するための次のステップは、単に優れたAIを導入することではなく、タンパク質ポケットの正確な形状を予測するためのより優れた手法であると示唆しています。これらの高速でスマートなスクリーニングツールを、より正確な構造予測と組み合わせることで、科学者たちは、新しい薬を見つけることがより速く、より安く、そしてより信頼できるものとなる未来へと近づくことができます。この研究は、複雑なテクノロジーを解明し、それが(たとえ)レンズ自体がしっかりと固定されていれば、分子の世界を見るための強力な新しいレンズであることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。