← 最新の論文
🤖 AI

MolEmb: Multimodal Large Language Models Can Be Strong Molecular Embedding Models

本論文は、分子プロファイルとテキスト記述の双方向の対照的アライメントを通じて、物性予測およびクロスモーダル検索への生存能力を実証し、マルチモーダル大規模言語モデルを汎用的かつ文脈依存的な分子埋め込みモデルとして機能させるための軽量なフレームワークであるMolEmbを導入するものである。

原著者: Xinjian Zhao, Xiangru Jian, Yaoyao Xu, Xiaozhuang Song, Wei Pang, Lei Bai, Tianshu Yu

公開日 2026-08-26
📖 1 分で読めます☕ さくっと読める

原著者: Xinjian Zhao, Xiangru Jian, Yaoyao Xu, Xiaozhuang Song, Wei Pang, Lei Bai, Tianshu Yu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

計算化学の静かな研究室において、科学者たちは分子という目に見えない世界を理解するために、長らく特定の種類のデジタル指紋に頼ってきました。これらの指紋は「エンベディング(埋め込み)」として知られ、化学構造の本質を捉える数学的な要約であり、コンピュータが物質の振る舞い、例えば水に溶けるかどうか、あるいは毒性を持つ可能性があるかどうかを予測することを可能にします。長年、これらの指紋を作成するには、単一の目的のために設計された専用のツールが必要でした。それは、分子の写真を撮るか、その化学コードを読み取り、一つの固定された数値を吐き出すというものです。この手法は特定のタスクにはうまく機能しましたが、柔軟性に欠けていました。科学者が何を求めているかに基づいて、その焦点を容易に移すことができなかったのです。もし研究者が、ある分子が血液脳関門を通過する能力について知りたかったとしても、ツールは「油に溶ける能力」について尋ねられたときと同じ答えを出してしまいました。なぜなら、そのツールは質問を理解しておらず、ただ分子の形状のみを理解していたからです。

この限界は、分野がより複雑な創薬や材料設計へと移行するにつれて、ボトルネックとなっています。科学者たちは、これらのデジタル指紋に対して「対話」する方法、つまり、問いかけの文脈に応じて異なる特徴を強調するように指示する方法を必要としていました。そこで疑問が生じました。テキストを読み、画像を理解できる既存の強力で柔軟な人工知能システムを、これら適応型の化学指紋を作成するために転用できるのではないか、と。新しい、用途を限定したツールをあらゆる化学的問題に対して構築する代わりに、単一の汎用システムが、記述に使用される言語に基づいて分子を表現する方法を学習できるのではないか、と考えたのです。

香港中文大学(深セン)と上海人工知能研究所の研究チームは、「MolEmb」と名付けた新しいフレームワークを用いて、この問いに答えるべく取り組みました。彼らは、マルチモーダル大規模言語モデルとして知られる一種の人工知能から着手しました。これらは、写真を見ることができ、文章を読み、その両者の関係を理解できるシステムと同じ種類のものです。研究者たちは、これらのモデルが、分子を記述するさまざまな方法——二次元の図、化学構造を表すテキスト文字の列、そして調査すべき特性に関する指示——を扱うのに自然に適していることに気づきました。

チームは、これらの大規模モデルに分子エンベディングのエキスパートとして振る舞うよう教えるための、軽量なシステムを構築しました。彼らは、モデルに新しい分子を生成させたり、化学論文をゼロから書かせたりしようとはしませんでした。その代わりに、分子の視覚的およびテキストによる記述を、特定のテキスト指示に整合させるようにモデルを訓練することに焦点を当てました。分子を、異なるレンズを通して見ることができる複雑な物体として想像してみてください。研究者たちは、モデルに分子の画像とその化学コードを見せ、それを「毒性を分析せよ」や「溶解性を分析せよ」といったテキスト指示と組み合わせました。目標は、指示に応じてわずかに変化する、その分子固有のデジタル指紋をモデルに生成させることでした。指示が毒性に関するものであれば、指紋はその安全性の関連部分を強調します。指示が溶解性に変われば、指紋は水への溶解に関連する部分を強調するようにシフトします。

このアプローチが機能するかどうかを検証するため、研究者たちは一連の厳格な実験を行いました。まず、この新システムが、現在使用されている専門的なツールと同等の精度で化学特性を予測できるかどうかを確認しました。その結果、特定の化学タスクに関する特別な訓練を受けていないにもかかわらず、このシステムは溶解性や毒性といった特性を、既存の最良の手法に匹敵するレベルの精度で予測できることがわかりました。これは、汎用モデルが、分子の画像、テキストコード、およびそれらを記述するための言語の関係を理解することによって、化学構造について十分に学習しており、有用であるということを示唆しているため、重要な発見でした。

次に、チームはこれらの指紋を使用して、テキストを用いて分子を検索できるかどうかをテストしました。従来のシステムでは、データベース内の分子に対して「肝細胞に対して毒性を持つ分子を見つけてください」といった文章を入力しても、関連する結果を得ることはできません。なぜなら、化学データとテキストデータは別々の世界に存在しているからです。研究者たちは、彼らの新しいシステムが、分子とテキスト記述を直接比較できる共有空間を作り出したことを示しました。彼らがシステムに対し、特定の記述に一致する分子を探すよう求めたところ、高い精度で成功しました。これは、モデルが化学の視覚的側面とテキスト的側面を、単一の統一された表現へと真に結びつけることを学んだことを証明しています。

しかし、最も重要なテストは、システムが文脈に基づいて真に「考えを変える」ことができるかどうかを確認することでした。研究者たちは、診断用ベンチマークである「MolCAR」を作成し、モデルが全く同じ分子に対する異なる有効な記述を区別できるかどうかを検証しました。彼らは単一の分子を提示し、例えば「毒性」に関する特定のタスクに対しては正しい記述を見つけ出し、「水和」などの他のタスクのための有効な記述は無視するように求めました。最終的な特定の訓練レイヤーを追加する前、モデルはこの区別を行うのに苦労していました。モデルは、どのような質問がなされようとも、その分子を一つの固定されたアイデンティティとして扱っていました。しかし、研究者が分子を異なるタスクに特化した記述とペアリングするように設計されたデータセットを用いてモデルを訓練した後、システムは焦点を移すことを学習しました。モデルは、質問が毒性に関するものか、あるいは溶解性に関するものかに応じて、同じ分子に対して異なる指紋を生成し始めたのです。

結果は、マルチモーダル大規模言語モデルが、単に化学的なアイデアを生成したり質問に答えたりするためのツールであるだけでなく、新しい種類の分子表現の基礎となり得ることを示唆しています。この研究は、文脈に応じた化学指紋を作成する能力は、モデルのアーキテクチャに備わった固有の欠陥ではなく、むしろモデルが学習するデータの問題であることを示しています。学習データに、同じ分子を異なる科学的なレンズの下で記述した多様な例が含まれている場合、モデルは適応することを学びます。この知見は、単一の汎用システムが、一連の限定的で専門的なツールに取って代わり、科学者が図書館で情報を検索するのと同じ柔軟性で化学データを照会できる未来を示しています。この研究は、分子のプロファイルと自然言語の指示を整合させることにより、これらの強力なモデルが、次世代の創薬および化学研究のための多才なインフラストラクチャになり得ることを実証しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →