Monroe: A Molecular Foundation Model for In-Context Probabilistic Inference
Cet article présente Monroe, un modèle de fondation moléculaire évolutif entraîné sur 81 millions de molécules avec des représentations stéréochimiques améliorées et de nouveaux objectifs d'entraînement, qui atteint des performances de pointe dans la prédiction de l'activité des bioessais en exploitant un modèle ajusté aux données préalables (TabPFN) pour l'inférence probabiliste en contexte et en démontrant que cette stratégie d'adaptation en aval améliore également de manière significative les modèles existants tels que MiniMol et CheMeleon.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Dans la course à la découverte de nouveaux médicaments, les scientifiques sont confrontés à un goulot d'étranglement persistant : le moyen le plus fiable de savoir si une molécule guérira une maladie est de la construire et de la tester en laboratoire. Ce processus est lent, coûteux et limité par le nombre d'installations spécialisées capables de réaliser ces expériences. En conséquence, les données disponibles pour entraîner des programmes informatiques sont souvent rares. Pour surmonter cela, les chercheurs se sont tournés vers une stratégie similaire à la façon dont un enfant apprend à reconnaître les animaux avant même d'avoir vu un chien ou un chat spécifique. Ils entraînent de vastes modèles informatiques sur de gigantesques bibliothèques de structures chimiques et leurs propriétés physiques de base, enseignant au logiciel une compréhension générale du comportement des molécules. Une fois cette fondation établie, le modèle peut être adapté pour prédire des résultats biologiques spécifiques, comme la capacité d'un composé à se lier à un virus, même lorsqu'il n'existe qu'une poignée de résultats expérimentaux pour cette tâche précise. Cette approche, connue sous le nom de modèle de fondation moléculaire, vise à combler le fossé entre le monde infini des produits chimiques possibles et les données limitées des tests de médicaments en conditions réelles.
Une équipe de chercheurs a introduit un nouveau modèle nommé Monroe, qui représente une étape significative dans ce domaine. Le nom rend hommage à Elizabeth Monroe Boggs, une pionnière de la chimie computationnelle, mais le modèle lui-même est un système d'apprentissage automatique moderne conçu pour comprendre le langage complexe des molécules. Les chercheurs ont entraîné Monroe sur un ensemble de données massif contenant plus de 81 millions de molécules, une échelle bien plus grande que les tentatives précédentes. Cet ensemble de données comprenait des calculs de chimie quantique détaillés, qui décrivent l'énergie et la structure des atomes, ainsi que des données provenant de milliers d'essais biologiques qui mesurent comment les molécules interagissent avec les systèmes vivants. En exposant le modèle à cette immense variété d'informations, les chercheurs lui ont permis d'apprendre des règles générales de la chimie qui s'appliquent à différents types de problèmes, plutôt que de simplement mémoriser des exemples spécifiques.
L'une des innovations les plus critiques de Monroe réside dans sa gestion de la forme tridimensionnelle des molécules, plus précisément de leur « chiralité » (leur latéralité). De nombreuses molécules existent sous deux formes qui sont des images miroirs l'une de l'autre, tout comme une main gauche et une main droite. Bien que ces images miroirs possèdent les mêmes atomes connectés dans le même ordre, elles se comportent souvent de manière totalement différente dans le corps humain ; l'une peut être un médicament, tandis que son image miroir pourrait être toxique. Les modèles informatiques standards peinent souvent à distinguer ces versions car ils reposent sur des descriptions mathématiques qui paraissent identiques pour les deux formes. Monroe résout ce problème en ajoutant explicitement des connexions supplémentaires dans sa carte interne de la molécule qui agissent comme des drapeaux signalant ces différences d'image miroir. Cela permet au modèle de distinguer les deux formes avec une grande précision, une capacité essentielle pour prédire comment un médicament fonctionnera réellement dans un système biologique.
Les chercheurs ont également perfectionné la manière dont le modèle apprend de ses données d'entraînement. Au lieu de traiter chaque tâche d'apprentissage comme étant d'égale importance, Monroe utilise un système de pondération intelligent qui ajuste automatiquement son attention. Il accorde plus d'importance aux tâches où les données sont claires et fiables, et moins d'attention aux tâches qui sont bruitées ou incertaines. De plus, le modèle est entraîné pour nettoyer les données imparfaites. Dans le monde réel, les formes 3D des molécules utilisées dans les simulations informatiques sont souvent des approximations grossières. Monroe est enseigné pour prendre ces formes approximatives et les affiner en formes plus précises et stables, un processus qui aide le modèle à comprendre les règles physiques sous-jacentes régissant la stabilité moléculaire. Cette capacité à « débruiter » les données renforce ses prédictions pour les applications du monde réel.
Lorsqu'il a été testé contre d'autres modèles de pointe, Monroe a démontré une performance supérieure, particulièrement dans les scénarios les plus difficiles connus sous le nom de « falaises d'activité » (activity cliffs). Il s'agit de cas où deux molécules sont presque identiques dans leur structure mais présentent des effets biologiques radicalement différents. Prédire ces différences abruptes est notoirement difficile pour l'intelligence artificielle, pourtant Monroe a surpassé ses concurrents lors de ces tests. Les chercheurs ont également constaté que leur méthode d'adaptation du modèle à de nouvelles tâches était très efficace. Au lieu de réentraîner l'intégralité du modèle pour chaque nouvelle cible thérapeutique, ils ont utilisé une technique qui permet au modèle d'apprendre à partir d'un petit ensemble d'exemples en une seule étape, de la même manière qu'un humain peut apprendre une nouvelle règle après n'en avoir vu que quelques exemples. Cette approche, qu'ils ont appliquée non seulement à Monroe mais aussi pour améliorer deux autres modèles existants, s'est avérée être une stratégie puissante et généralisable.
L'étude conclut que la combinaison d'un pré-entraînement à grande échelle avec des améliorations architecturales spécifiques, telles qu'une meilleure gestion de la chiralité moléculaire et une pondération intelligente des données, crée un outil plus robuste pour la découverte de médicaments. Bien que le modèle ne résolve pas tous les problèmes de prédiction moléculaire, et que le défi des falaises d'activité reste difficile, Monroe établit un nouveau standard de ce qui est possible. Il démontre qu'en enseignant aux ordinateurs une compréhension plus profonde et plus nuancée de la structure et du comportement chimiques, les scientifiques peuvent construire des outils mieux équipés pour naviguer dans le paysage vaste et complexe des médicaments potentiels, accélérant potentiellement le voyage d'une idée chimique vers un traitement salvateur.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.