← 最新の論文
🧬 biology

Monroe: A Molecular Foundation Model for In-Context Probabilistic Inference

本論文は、強化された立体化学表現と新規の学習目的関数を用いて8,100万個の分子で学習されたスケーラブルな分子基盤モデルであるMonroeを紹介するものであり、これは事前データ適合モデル(TabPFN)を活用したインコンテキスト確率推論によってバイオアッセイ活性予測において最先端の性能を達成しており、このダウンストリーム適応戦略がMiniMolやCheMeleonといった既存のモデルをも大幅に改善することも示している。

原著者: Blazej Banaszewski, Andrew W. Fitzgibbon

公開日 2026-08-20
📖 1 分で読めます☕ さくっと読める

原著者: Blazej Banaszewski, Andrew W. Fitzgibbon

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ⚕️ これは査読を受けていないプレプリントのAI生成解説です。医学的助言ではありません。この内容に基づいて健康上の判断をしないでください。 免責事項の全文を読む

新薬発見の競争において、科学者たちは手強いボトルネックに直面している。それは、ある分子が疾患を治療するかどうかを知るための最も信頼できる方法は、実際にその分子を合成し、実験室でテストすることであるという事実だ。このプロセスは遅く、高価であり、これらの実験を実行できる専門的な施設の数によって制限されている。このため、コンピュータプログラムを訓練するための利用可能なデータは、しばしば乏しいものとなる。これを克服するために、研究者たちは、子供が特定の犬や猫を見る前に動物を認識することを学ぶ方法に似た戦略を採用した。彼らは、膨大な化学構造とその基本的な物理的性質のライブラリを用いて、大規模なコンピュータモデルを訓練し、分子がどのように振る舞うかという一般的な感覚をソフトウェアに教え込ませた。この基礎が築かれれば、モデルは、特定のタスクに関する実験結果がわずか数件しか利用できない場合でも、ウイルスに結合するかどうかといった特定の生物学的結果を予測するように適応させることができる。分子基盤モデルとして知られるこのアプローチは、可能性のある無限の化学の世界と、現実世界の薬物試験における限られたデータの間の溝を埋めることを目的としている。

研究チームは、この分野における重要な進歩を象ло代表する「Monroe」という名の新しいモデルを導入した。その名は、計算化学の先駆者であるエリザベス・モンロー・ボッグスに敬意を表したものだが、モデル自体は分子の複雑な言語を理解するように設計された現代的な機械学習システムである。研究者たちは、8,100万個以上の分子を含む大規模なデータセットを用いてMonroeを訓練したが、これはこれまでの試みよりもはるかに大規模なスケールである。このデータセットには、原子のエネルギーや構造を記述する詳細な量子化学計算や、分子が生命システムとどのように相互作用するかを測定する数千の生物学的アッセイからのデータが含まれていた。この膨大な種類の情報にモデルをさらすことで、研究者たちは、単に特定の例を暗記するのではなく、異なる種類の問題に適用できる化学の一般原則をモデルに学習させたのである。

Monroeにおける最も重要な革新の一つは、分子の三次元的な形状、特にその「手性(ハンドネス)」の扱い方である。多くの分子は、左手と右手のように、互いに鏡写しの関係にある二つの形態で存在する。これらの鏡像体は、同じ原子が同じ順序で結合しているものの、人体内での振る舞いは全く異なることがよくある。一方は薬になり得るが、その鏡像体は毒性を持つ可能性がある。標準的なコンピュータモデルは、両方の形状に対して同一に見える数学的記述に依存しているため、これらのバージョンを区別することに苦慮することが多い。Monroeは、分子の内部マップに、これらの鏡像の違いを示すフラグとして機能する追加の接続を明示的に加えることで、この問題を解決した。これにより、モデルは二つの形態を高い精度で区別することができ、これは薬が実際に生体内でどのように作用するかを予測するために不可欠な能力である。

研究者たちはまた、モデルが訓練データからどのように学習するかについても改良を加えた。すべての学習タスクを等しく重要であると扱うのではなく、Monroeは自動的に焦点を調整するスマートな重み付けシステムを使用している。モデルは、データが明確で信頼できるタスクにはより多くの注意を払い、ノイズが多い、あるいは不確実なタスクには注意を少なくする。さらに、モデルは不完全なデータをクリーンアップするように訓練されている。現実の世界では、コンピュータシミュレーションで使用される分子の3D形状は、しばしば粗い近似に過ぎない。Monroeは、これらの粗い形状を取り込み、より正確で安定した形態へと洗練させるように教えられており、このプロセスは、分子の安定性を支配する基礎的な物理法則をモデルが理解する助けとなる。このデータの「デノイジング(ノイズ除去)」能力が、現実世界のアプリケーションに対する予測を強化する。

他の主要なモデルと比較してテストを行った際、Monroeは、「アクティビティ・クリフ(活性の崖)」として知られる最も困難なシナリオにおいて、優れた性能を示した。これらは、構造はほぼ同一であるが、生物学的な効果が劇的に異なる二つの分子が存在するケースである。これらの急激な違いを予測することは人工知能にとって非常に困難として知られているが、Monroeはこれらのテストにおいて競合モデルを上回った。研究者たちはまた、モデルを新しいタスクに適応させる彼らの手法が非常に効果的であることも発見した。すべての新しい薬物ターゲットに対してモデル全体を再訓練する代わりに、彼らは、人間がわずかな例を見ただけで新しいルールを学習できるのと同様に、単一のステップで少数の例からモデルが学習できる技術を使用した。この手法をMonroeだけでなく、既存の他の二つのモデルを改善するためにも適用したことは、強力かつ汎用的な戦略であることが証明された。

本研究は、大規模な事前学習と、分子の手性のより良い取り扱いやスマートなデータ重み付けといった特定のアーキテクチャの改善を組み合わせることが、より堅牢なツールを生み出すことを結論づけている。このモデルはあらゆる分子予測の問題を解決するものではなく、アクティビティ・クリフの課題は依然として困難ではあるが、Monroeは何が可能であるかについての新たな基準を打ち立てている。これは、コンピュータに化学的構造と振る舞いに関するより深く微細な理解を教えることで、科学者が潜在的な医薬品の広大で複雑な風景をナビゲートするための、より優れたツールを構築できることを示しており、化学的なアイデアから救命治療への道のりを加速させる可能性を秘めている。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →