UniLingo3DMol: a unified 3D molecular language model for de novo and fragment-based drug design
本論文は、新しい表現形式と多段階学習戦略を通じて、de novo設計とフラグメントベースの創薬を統合した統一的な3D分子言語モデルであるUniLingo3DMolを紹介しており、優れた性能、高速な推論、およびin vivoでの有効性を備えた強力なCBL-B阻害剤の特定を実現している。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
新薬の探索は、絶えず形を変え続ける干し草の中から特定の針を見つけ出す作業に例えられるほど、途方もない任務である。数十年にわたり、科学者たちはこれらの「針」を設計するために主に二つの戦略に頼ってきた。一つのアプローチは、すでに効果が確認されている分子の化学的な形状に着目し、それらをわずかに微調整してより優れたものにならないかを確認するというものである。もう一つのアプローチは、疾患ターゲット(標的)そのものの三次元的な形状——いわば「鍵穴」のようなもの――に着目し、そこに完璧に適合する「鍵」を設計しようとするものである。どちらの手法も有用であるが、伝統的にこれらは別々に扱われてきた。人工知能は両方のアプローチを支援し始めているが、ほとんどのコンピュータプログラムは専門化されており、「既存の化学物質を微調整すること」には長けていても、「特定の鍵穴に対して新しい形状を設計すること」には長けているものの、その両方を同時に行うことは稀である。この分離により、研究者はツールや考え方の切り替えを余儀なくされ、発見のプロセスが遅延し、コンピュータが薬物と疾患ターゲットがいかに相互作用するかという全容を学習することを妨げている。
現在、ある研究チームが、この溝を埋める新たな人工知能システム「UniLingo3DMol」を発表した。創薬の異なる段階ごとに別々のツールを使用するのではなく、このシステムは分子を三次元的に記述するための単一の統一された言語を用いる。これは、全く新しいドラッグ候補をゼロから生成することもできれば、既知の薬の特定の部分を取り込み、その周囲に新しい分子を構築することもできる。しかも、それは常に疾患ターゲットの複雑な三次元形状を念頭に置いた上で行われる。研究者がこのシステムを100種類以上の異なる生物学的ターゲットでテストしたところ、既存のコンピュータモデルよりも、ターゲットに対してより良く、かつ正確にフィットする薬物様分子を生み出せることが判明した。実世界での有効性を証明するため、チームはこのシステムを用いて、免疫系の調節に関与するCBL-Bと呼ばれるタンパク質の阻害剤を設計した。結果として得られた化合物は、実験室レベルの試験で強い活性を示し、既存の免疫療法抗体と組み合わせることで、マウスにおける腫瘍を76パーセント縮小させることに成功した。
この研究の核心となる革新は、コンピュータがどのように分子を「見る」かにある。従来の方法では、分子を原子と結合の平坦なリストとして記述することが多く、そのためコンピュータはその分子がタンパク質の中に収まろうとする際に、三次元空間においてどのような姿になるのかを理解するのが困難であった。新しいシステムは、デュアルシーケンス・アプローチを採用している。これは、分子を環状構造の原子群や側鎖といった意味のある塊へと分解し、次にそれらの塊がどのようにつながっているかをポインターを使って記述する方法である。これにより、コンピュータは分子を壊すことなく、トランプの束をシャッフルするように、スーツ(柄)を保ったまま順番を組み替えることができる。この柔軟性は極めて重要であり、膨大な可能性を持つあらゆる分子の広大な化学空間と、既にタンパク質に結合することが分かっている分子の高解像度な構造という、二つの非常に異なるデータから同時に学習することを可能にするためである。
システムへの教育を行うにあたり、研究者たちはX線結晶構造解析によって直接決定された最も確かな構造から、コンピュータによるドッキング予測に基づく信頼性の低い構造まで、三段階の信頼度で整理された数百万のタンパク質-リガンド複合体を含む大規模データベース「RComplex」を構築した。トレーニング工程は三段階で行われた。まず、システムは800万個の仮想分子ライブラリを使用して、基礎的な化学ルールと原子が空間内でどのように配置されるかを学んだ。次に、データベース内の豊富だが不確実なデータを用いながら、これらの分子がタンパク質のポケットとどのように相互作用するかを学んだ。最後に、最高品質の実験構造のみを使用して、その理解を洗練させたのである。この段階的なアプローチにより、システムは高度なタンパク質結合という複雑な「方言」を習得する前に、化学の基本的な「言葉」を確実に学ぶことができた。
研究者たちは、標準的な102種類のタンパク質ターゲットを用いたセットを用いて、他の主要な6つのAIモデルと比較評価を行った。その結果、新システムはすべてを凌駕した。同システムは、サイズ、複雑さ、および化学的特性のバランスが取れた、より「本物の薬らしい」分子の高い割合を生成した。さらに重要な点として、生成された三次元形状は、タンパク質ターゲットに対し、より精密に適合していた。生成された分子が既知の活性薬物の結合パターンを再現できるかどうかをチェックした際、新システムの成功率は7割を超えたが、これは他のモデルの成功率が35パーセント未満であったことと比較すると大幅な跳躍である。また、動作速度も格段に速く、他のモデルが同じタスクを実行するのに13分から3時間以上かかる一方で、新システムは約30秒で500個の有効な分子を生成した。
これが単なる計算上の演習ではないことを示すために、チームは具体的な課題に取り組んだ。それが、CBL-Bに対する阻害剤の設計である。CBL-Bは、がん治療において免疫系にブレーキをかける役割を果たしており、これをオフにすることで体ががんをより効果的に攻撃できるようになるため、魅力的なターゲットとなっている。チームは、CBL-Bタンパク質に結合している既知の阻害剤を出発点とし、元の薬の二つの特定の部分を維持しながら、残りの部分を変更してより良い適合を見つけるようにシステムへ指示を出した。システムは数十万件の候補を生成した後、有望なリード化合物へと絞り込んだ。そのうちの一つである「Cmpd. 7」と名付けられた化合物が合成され、テストされた。これはラボにおいて強い活性を示し、その結晶構造は、コンピューターが予測した通りにタンパク質に結合していることを裏付けた。
この成功に基づき、研究者たちはさらなる最適化のために再びシステムを使用した。彼らは機能しているパーツとしてのCmpd. 7の一部を保持したまま、残り部分を再設計してタンパク質との相互作用を高めるよう依頼した。この世代プロセスを経て生み出されたのが、新たなリード化合物「Cmpd. 20」である。マウスを用いた腫瘍テストにおいて、Cmpd. 20は単独でも一定の活性を示したが、標準的なPD-1抗体と併用した場合、腫瘍増殖を76パーセント減少させる結果となった。この化合物は初期テストにおいても良好な安全性プロファイルを示し、医薬品相互作用の原因となりやすい特定の肝酵素への抑制も低かった。デジタルなアイデアから潜在的な医薬品に至るまでの道のりを合理化できる、統合型アプローチの有用性が浮き彫りになった。
本研究は現在の技術の限界についても探求している。このシステムは非常に効果的ではあるものの、実際には動き回る動的な存在であるタンパク質を、静止画として捉えている。研究者たちは、将来のバージョンにおいては、タンパク質の運動性を取り入れることで、より堅牢なデザインが可能になると指摘した。また、外部データベースから特定の化学断片をリアルタイムで取得できるように改良すれば、最初から再学習する必要なく、新たな科学的発見に適応させることができるとも示唆した。これらのアップグレード案は、AIが継続的なパートナーとして創薬に従事し、利用可能な新しいデータが得られるたびに自ら学び続け、設計を磨き上げていく未来を指し示している。
UniLingo3DMolの成功は、創薬の未来が、特定のタスクのための特化したツールではなく、プロセス全体を処理できる統合されたシステムにあることを示唆している。AIに対し、分子の化学性とターゲットの幾何学性の両方を包含する言語を教えることにより、研究者たちは、これまで以上に効率的に創薬という複雑な景観をナビゲートできるツールを作り出した。高品質な三次元的ドラッグ候補を数秒で生成し、それを生体内(living organism)で検証できる能力は、人類の健康に対する人工知能の応用における大きな進歩を象徴している。人間が行うエキスパートの思考プロセスをも模倣するように作られたコンピュータモデルこそが、理論的に妥当であるだけでなく、実践的にも効果的な結果を生むことができるのだということを、今回の成果は証明している。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。