A Large Scale Investigation of Scaling Limits in Chemical Language Models
Cette étude à grande échelle portant sur plus de 30 000 expériences révèle que, bien que le passage à l'échelle des modèles de langage chimique améliore la perte de pré-entraînement et la compréhension de la syntaxe chimique, ces gains ne se traduisent pas par des améliorations proportionnelles dans la conception moléculaire orientée vers un objectif, soulignant un décalage critique entre l'apprentissage de représentations et l'utilité en aval malgré l'introduction de la suite de pointe NovoMolGen.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le vaste paysage de la science moderne, une croyance croissante soutient que si l'on se contente d'agrandir un modèle informatique et de l'alimenter avec davantage de données, il deviendra inévitablement plus intelligent. Cette idée, connue sous le nom de mise à l'échelle (scaling), a transformé notre compréhension du langage, permettant aux machines de rédiger des essais, de traduire des textes et de tenir des conversations en apprenant à partir de bibliothèques massives d'écrits humains. Les scientifiques ont récemment appliqué cette même logique à la chimie, créant des « modèles de langage chimique ». Il s'agit de systèmes d'intelligence artificielle entraînés pour lire et écrire les chaînes de caractères qui représentent les molécules, tout comme un ordinateur apprend à lire des phrases. L'espoir était qu'en rendant ces modèles chimiques plus grands et en les entraînant sur plus de molécules, ils deviendraient naturellement plus performants pour concevoir de nouveaux médicaments à partir de zéro, trouvant des composés novateurs capables de guérir des maladies ou de traiter des affections.
Cependant, une récente enquête à grande échelle remet en question cette hypothèse directe. Les chercheurs ont cherché à tester si les règles qui régissent l'apprentissage du langage s'appliquent également au monde complexe de la conception chimique. Ils ont construit une famille de modèles allant de très petits à extrêmement grands, les entraînant sur des milliards de molécules pour voir comment leurs performances évoluaient. L'étude, menée par une équipe issue d'institutions incluant l'IIT Madras et l'Institut Mila – Québec AI, révèle un décalage surprenant. Si les modèles sont effectivement devenus meilleurs pour comprendre la grammaire de base de la chimie à mesure qu'ils grandissaient, cette amélioration ne s'est pas traduite par de meilleurs résultats lorsqu'on leur a demandé de concevoir des médicaments spécifiques et utiles. En fait, les chercheurs ont découvert qu'un modèle relativement petit pouvait être aussi performant qu'un modèle massif lorsqu'il était chargé de la tâche difficile de trouver de nouveaux médicaments, suggérant que le simple fait d'agrandir l'ordinateur n'est pas la clé pour déverrouiller les secrets de la découverte de médicaments.
Les chercheurs ont commencé par entraîner plus de trente mille versions différentes de ces modèles chimiques. Ils ont fait varier la taille des modèles, de cinq cent mille paramètres à un milliard de paramètres, les ont nourris avec différents types de données moléculaires et les ont testés à l'aide de diverses méthodes de représentation des structures chimiques. L'une des conclusions clés est que les modèles ont appris à prédire la partie suivante d'une chaîne chimique avec une précision croissante à mesure qu'ils devenaient plus grands et qu'ils voyaient plus de données. Cela ressemble à la façon dont un enfant apprenant une langue finit par devenir meilleur pour deviner le mot suivant dans une phrase. Les modèles sont devenus excellents pour comprendre la syntaxe chimique, sachant quelles combinaisons d'atomes forment des molécules valides et lesquelles ne le sont pas. Cette compréhension interne de la structure chimique a continué de s'améliorer, même pour les plus grands modèles, suggérant que l'ordinateur mémorisait avec succès le « vocabulaire » et la « grammaire » de la chimie.
Pourtant, lorsque les chercheurs ont testé ces modèles sur l'objectif réel de la conception de médicaments, l'histoire change radicalement. Ils ont demandé aux modèles de générer de nouvelles molécules qui se lieraient à des cibles de maladies spécifiques ou répondraient à un ensemble de propriétés chimiques désirables, un processus qui implique une boucle complexe d'essais et d'erreurs. Ici, les bénéfices de la taille ont disparu. La performance des modèles dans la conception de ces molécules orientées vers un objectif a plafonné, ou s'est stabilisée, une fois que les modèles ont atteint une taille d'environ cinq millions de paramètres. Augmenter la taille du modèle jusqu'à un milliard de paramètres, soit deux cents fois plus, n'a apporté presque aucune amélioration supplémentaire de la qualité des médicaments qu'ils pouvaient concevoir. Un modèle de cinq millions de paramètres a obtenu des résultats tout aussi bons que le modèle massif d'un milliard de paramètres pour trouver de nouveaux candidats à la découverte de médicaments.
Ce résultat suggère que la méthode actuelle d'entraînement de ces modèles, qui se concentre sur la prédiction du caractère suivant dans une chaîne chimique, enseigne à l'ordinateur les règles de la chimie mais pas nécessairement le sens profond de la manière dont ces molécules interagissent avec les systèmes biologiques. Les modèles ont appris à parler couramment la langue de la chimie, mais ils n'ont pas appris à utiliser cette langue pour résoudre des problèmes spécifiques. Les chercheurs ont constaté que, bien que les modèles plus grands puissent générer des molécules valides, ils ne devenaient pas significativement meilleurs pour trouver les molécules spécifiques et de haute qualité nécessaires à la médecine. L'étude indique que le goulot d'étranglement n'est pas la taille du modèle ou la quantité de données, mais plutôt la manière dont les modèles sont entraînés et les objectifs qu'ils doivent optimiser.
Les implications de cette découverte sont significatives pour l'avenir de l'intelligence artificielle en science. Cela suggère que la voie à suivre pour la découverte de médicaments ne réside peut-être pas dans la construction de modèles informatiques toujours plus grands, mais dans le développement de méthodes plus intelligentes pour entraîner les modèles que nous possédons déjà. Les chercheurs proposent qu'au lieu de simplement apprendre aux ordinateurs à prédire le prochain symbole chimique, nous devons leur apprendre à comprendre les propriétés fonctionnelles des molécules, telles que leur interaction avec les protéines ou leur comportement dans le corps humain. En se concentrant sur ces significations chimiques plus profondes plutôt que sur les motifs de surface, les scientifiques pourraient être en mesure de créer des outils plus efficaces et plus performants pour concevoir la prochaine génération de médicaments vitaux. Ce travail sert de rappel que dans le monde complexe de la chimie, plus grand n'est pas toujours mieux, et que la véritable intelligence requiert plus qu'une vaste mémoire de motifs.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.