Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules
Mol-JEPAは、化学的に不適切な拡張やモダリティの崩壊といった限界を克服するために、多様な創薬データに対してモダリティ・マスキングを採用することで分子の世界モデルを学習する、スケーラブルなマルチモーダル・フレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
新薬の探索は、遅く、高価で、しばしば挫折を伴う道のりです。科学者たちは、病気を止めるために体内の特定の標的にロックオンできる小さな分子を見つけ出さなければなりませんが、これらの分子は同時に、血流の中を生き残り、肝臓によって破壊されるのを避け、健康な細胞を毒さないことも求められます。何十年もの間、研究者たちは、分子の画像(通常はテキストの文字列や結合した原子の図として表現されるもの)をコンピュータに見せることで、これらの結果を予測する方法を教えようとしてきました。しかし、分子は真空の中に存在するわけではありません。その振る舞いは、周囲の複雑な生命システムとどのように相互作用するかに完全に依存しています。分子の形状だけを見るモデルは、地形は示しているものの、天気や交通量、現地の法律を無視している地図のようなものです。それは道路がどこへ続くかは教えてくれますが、実際に車がそこを走れるかどうかまでは教えてくれません。
これを解決するために、研究チームは「Mol-JEPA」と呼ばれる新しい種類の人工知能を開発しました。Mol-JEPAは、分子の形状をわずかに変えることでその未来を推測しようとする手法(化学における微細な変化は劇的な振る舞いの変化を引き起こすことがあるため、しばしばナンセンスな結果を招きます)ではなく、分子を一度に多くの異なる角度から見ることで学習します。人物を理解しようとする際、単に顔を見るだけでなく、声を聞き、動きを観察し、病歴を読み、さまざまな食べ物にどう反応するかを観察するような状況を想像してみてください。Mol-JEPAは、化学物質に対してまさにこれを行います。このシステムは、約500万個の分子に関する膨大な情報(原子構造、タンパク質への結合方法、細胞への影響、および物理的特性を含む)を集めます。そして、情報の断片を一つ隠し、残りの情報に基づいてそれが何かを当てるという予測ゲームを練習します。このように欠落したピースを繰り返し埋めることで、コンピュータは分子の静的な形状を単に暗記するのではなく、現実世界で分子がどのように振る舞うかについての、深く統一された理解を学習するのです。
研究者たちは、公開データベースと新たな計算から得られた膨大なデータコレクションを用いて、このモデルを構築しました。彼らは、標準的な化学測定法を、原子がどのように動き、相互作用するかのアドバンスドなシミュレーションや、薬が生存細胞にどのように影響するかを測定する実験データと組み合わせました。合計で、それぞれが最大14種類の異なる情報によって記述された、約500万個の一意の化合物を含むデータセットを作成しました。これらの記述の中には、化学におけるパターンを認識することをすでに学習している既存のコンピュータモデルによるものもあれば、量子物理学を用いてゼロから計算されたものもありました。チームは、AIに「ワールドモデル(世界モデル)」、つまり化学宇宙のルールを理解するシステムとして機能するように訓練しました。訓練中、コンピュータは分子の構造とその細胞への影響などを観察し、例えば、特定のタンパク質への結合強度を予測したり、あるいはその逆を行ったりします。もしコンピュータの予測が間違っていた場合、正解にたどり着くまで内部の理解を調整します。このプロセスにより、モデルは明示的にルールを教えられることなく、分子の形状と生物学的な振る舞いの間の隠れたつながりを学習することができました。
チームがこの新しいモデルを他の主要な人工知能システムと比較テストした際、その結果は驚くべきものでした。このモデルは、特にデータが乏しい状況において、幅広い困難なタスクで競合モデルよりも優れた性能を発揮しました。創薬の現実の世界では、科学者はしばしば非常に少量の実験データに基づいて意思決定を行わなければなりませんが、この新しいモデルはその点で輝きを放ちました。モデルは、学習中に見たものとは化学的に大きく異なる分子に対しても、その知識を一般化させ、高い精度を維持することができました。研究者たちは、モデルの成功が、入力されたあらゆる種類の情報を活用する能力から来ていることを発見しました。分子の詳細な3D構造や細胞への影響といった特定の種類のデータを取り除いたとしても、モデルの性能にはわずかな違いしか見られませんでした。これは、学習された表現の中に、複数のモダリティ(様式)にわたって情報が符号化されているという冗長性が存在することを示唆しています。システムは単にデータを暗記したのではなく、異なる化学的特性間の関係について推論することを学んだのです。
最も重要な発見の一つは、モデルが有用であるために、必ずしもすべてのタスクにおいて完璧である必要はないということでした。むしろ、モデルは多くの異なる問題に適応可能な、柔軟な分子表現を学習しました。研究者たちは、薬が体内にどれほど吸収されるか、あるいはどの程度毒性があるかを予測することを含む、いくつかの困難なベンチマークを用いてモデルをテストしました。ほぼすべてのケースにおいて、この新しいモデルは従来の最高の手法を上回りました。特に、「分布外(out-of-distribution)」の問題、つまり、学習データとは化学的に異なる新しい未知の分子がどのように振る舞うかを予測するという困難な課題において、優れた能力を示しました。広範な生物学的および物理的な文脈から学習することで、モデルは、新しい化合物に対しても信頼できる推測を行うことを可能にする堅牢な理解を構築しました。これは、創薬の未来が、単に多くのデータを暗記するより大きなモデルを作ることではなく、多様な情報源を統合して、薬がどのように機能するかという複雑な現実を理解できる、よりスマートなモデルを構築することにある可能性を示唆しています。
この研究はまた、すべての種類の情報が等しく重要であるわけではないものの、システムはそれらすべてを持っていることで恩恵を受けることも明らかにしました。研究者たちは、グラフ・モダリティ(分子の連結性と構造を表すもの)が、ダウンストリームのパフォーマンスにおいて最も重要な情報であることを発見しましたが、化学的フィンガープリントや分子が細胞とどのように相互作用するかというデータも不可欠でした。興味深いことに、モデルは一部のデータが欠落していたり、疎であったりする場合でも効果的に学習することができました。これは、科学研究においてよくある問題です。この回復力は、このアプローチが、材料科学や生物学のように、データが不完全であったり入手困難であったりする他の分野にも応用できる可能性を示唆しています。チームは、このモデルは強力ではあるものの、魔法の解決策ではないとも指摘しています。それは依然として、学習するデータの慎重な選択を必要とし、モデルが一度も見たことがないような全く異なる分子に対して、予測できる結果には限界があるからです。しかし、このアプローチの成功は、単純なパターンマッチングを超えて、生命そのものの複雑さを反映した、より深く、よりコンテキストに基づいた推論を行うことができる、化学の世界を真に理解する人工知能の創造に向けた、重要な一歩を刻みました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。