← Derniers articles
🔬 materials science

BOOM: Benchmarking Out-Of-distribution Molecular Property Predictions of Machine Learning Models

Cet article introduit BOOM, le premier benchmark open-source chimiquement informé pour évaluer systématiquement la généralisation hors distribution (OOD) dans la prédiction de propriétés moléculaires, révélant que les modèles d'apprentissage automatique actuels peinent à extrapoler au-delà de leurs données d'entraînement et soulignant la nécessité de nouvelles approches pour atteindre une performance OOD robuste.

Auteurs originaux : Evan R. Antoniuk, Shehtab Zaman, Tal Ben-Nun, Peggy Li, James Diffenderfer, Busra Sahin, Obadiah Smolenski, Everett Grethel, Tim Hsu, Anna M. Hiszpanski, Kenneth Chiu, Bhavya Kailkhura, Brian Van Esse
Publié 2026-09-17
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Evan R. Antoniuk, Shehtab Zaman, Tal Ben-Nun, Peggy Li, James Diffenderfer, Busra Sahin, Obadiah Smolenski, Everett Grethel, Tim Hsu, Anna M. Hiszpanski, Kenneth Chiu, Bhavya Kailkhura, Brian Van Essen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La quête de la découverte de nouveaux médicaments et matériaux commence souvent par une question simple, mais intimidante : lesquelles, parmi les milliards de structures chimiques possibles, fonctionneront réellement ? Pendant des décennies, les scientifiques se sont appuyés sur l'essai et l'erreur, mais une nouvelle vague d'intelligence artificielle promet d'accélérer ce processus en prédisant comment une molécule se comportera avant même qu'elle ne soit construite. Ces modèles informatiques sont entraînés sur de vastes bibliothèques de produits chimiques connus, apprenant à reconnaître les motifs qui lient la forme d'une molécule à ses propriétés, comme sa capacité à se dissoudre dans l'eau ou la quantité d'énergie qu'elle libère lors de sa combustion. L'espoir est que ces modèles puissent ensuite examiner une molécule entièrement nouvelle et inédite pour deviner avec précision son comportement, permettant ainsi aux chercheurs de concevoir le futur de la chimie sur un écran d'ordinateur.

Cependant, il y a un obstacle majeur. La plupart de ces modèles d'IA sont excellents pour reconnaître les motifs au sein des données sur lesquelles ils ont été formés, mais ils trébuchent souvent lorsqu'on leur demande de prédire les propriétés de molécules qui sont véritablement différentes de tout ce qui figure dans leur bibliothèque d'entraînement. Dans le monde de l'apprentissage automatique, c'est ce qu'on appelle le problème de la « distribution hors norme » (out-of-distribution). C'est la différence entre un étudiant qui mémorise les réponses d'un examen blanc et un étudiant capable de résoudre un problème nouveau et inattendu. Si un modèle ne peut pas généraliser au-delà de ses données d'entraînement, il devient un outil pour confirmer ce que nous savons déjà, plutôt qu'un outil pour découvrir l'inconnu. Cette limitation est un goulot d'étranglement majeur pour la prochaine génération de la découverte de médicaments et de la science des matériaux, où l'objectif est de trouver des molécules qui repoussent les limites de ce qui est actuellement possible.

Une équipe de chercheurs du Laboratoire national Lawrence Livermore et de l'Université de Binghamton a examiné de près ce problème avec un nouveau test de référence appelé BOOM. Plutôt que de tester simplement la performance des modèles sur des données familières, ils ont conçu un ensemble rigoureux de tests spécifiquement pour voir si ces systèmes d'intelligence artificielle peuvent gérer l'inconnu. Ils ont rassemblé dix ensembles de données différents contenant des milliers de molécules, allant de petits composés organiques à des structures complexes possédant des propriétés électroniques spécifiques. Pour chaque ensemble de données, ils ont soigneusement séparé les molécules en trois groupes : un ensemble d'entraînement, un ensemble de test standard composé de molécules familières, et un ensemble de test spécial « hors distribution ». Ce groupe spécial comprenait des molécules aux propriétés extrêmes — des valeurs si hautes ou si basses qu'elles apparaissent rarement dans les données d'entraînement. Les chercheurs ont ensuite soumis quinze modèles d'apprentissage automatique à l'épreuve, leur demandant de prédire les propriétés de ces molécules extrêmes.

Les résultats sont sans appel. Malgré les capacités impressionnantes de l'intelligence artificielle moderne, l'étude a révélé qu'aucun modèle ne pouvait prédire de manière cohérente les propriétés de ces molécules extrêmes à travers toutes les tâches. Même les modèles les plus performants commettaient des erreurs sur ces cas difficiles et inédits qui étaient trois fois plus importantes que leurs erreurs sur les données familières. Les chercheurs ont observé un mode de défaillance courant : les modèles étaient doués pour regrouper des molécules similaires, mais ils échouaient à étendre leurs prédictions vers le territoire inconnu. Au lieu de deviner une valeur qui se situerait réellement en dehors de la plage de ce qu'ils avaient vu, les modèles avaient tendance à compresser leurs prédictions, ramenant les valeurs extrêmes vers la moyenne. Ce comportement suggère que les modèles apprennent des raccourcis qui fonctionnent bien pour les données standards, mais qui s'effondrent face à la véritable nouveauté requise pour la découverte scientifique.

L'équipe a également étudié pourquoi ces modèles peinaient et a testé plusieurs stratégies courantes pour résoudre le problème. Ils ont examiné si le pré-entraînement des modèles sur des ensembles de données massifs de milliards de molécules — une technique qui a révolutionné les modèles de langage — aiderait. Étonnamment, ils ont découvert que si ce pré-entraînement rendait les modèles meilleurs pour gérer les données familières, il n'améliorait pas leur capacité à prédire les valeurs extrêmes. En fait, pour certains modèles, le pré-entraînement rendait la performance hors distribution pire encore. Ils ont également testé si le simple ajout de plus de données à l'ensemble d'entraînement aiderait. Bien que l'inclusion d'un petit nombre d'exemples extrêmes ait amélioré les performances pour certaines propriétés, ce n'était pas un remède universel. L'étude suggère que la façon dont ces modèles sont actuellement construits, particulièrement leur dépendance aux représentations textuelles des molécules, pourrait limiter fondamentalement leur capacité à comprendre les lois physiques profondes qui régissent le comportement chimique.

L'une des conclusions les plus révélatrices fut que le type de représentation des données importait plus que la taille du modèle. Les modèles utilisant des informations géométriques tridimensionnelles sur les atomes et leurs positions ont été nettement plus performants que ceux qui reposaient sur des chaînes de texte linéaires, qui sont comme des noms chimiques écrits en séquence. Les modèles tridimensionnels, qui respectent les symétries physiques de l'espace, ont pu beaucoup mieux généraliser aux cas extrêmes. Cela indique une voie claire pour l'avenir : pour construire une IA capable de véritablement découvrir de nouvelles chimies, les modèles doivent être ancrés dans la réalité physique de la manière dont les atomes se déplacent et interagissent, plutôt que dans les motifs de la manière dont ils sont décrits par le texte. Les chercheurs ont conclu que l'obtention de performances solides sur ces tâches difficiles nécessitera probablement une combinaison de jeux de données plus vastes et diversifiés, et de modèles qui comprennent explicitement la structure électronique des molécules.

Le benchmark BOOM sert de rappel à la réalité pour le domaine, montrant que la génération actuelle d'IA chimique, bien que puissante, n'est pas encore prête à naviguer de manière fiable dans l'inconnu. L'étude ne prétend pas que le problème est insoluble, mais elle infirme l'idée que le simple passage à l'échelle des modèles existants ou l'utilisation de techniques de pré-entraînement standard sera suffisant pour le résoudre. Au contraire, elle souligne que la prochaine frontière de l'apprentissage automatique chimique nécessite un changement dans la conception de ces systèmes. En fournissant une manière standardisée de tester cette faiblesse spécifique, les chercheurs espèrent guider la communauté vers la construction de modèles qui ne sont pas seulement bons pour se souvenir du passé, mais qui sont véritablement capables d'imaginer l'avenir. Le chemin vers la découverte de la prochaine génération de médicaments vitaux et de matériaux avancés pourrait dépendre de la résolution de ce puzzle spécifique de la généralisation.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →