A foundation model enables prediction of natural product molecular properties, bioactivity, and structural similarity from biosynthetic gene cluster sequence
Cet article présente BGC-MLM, un modèle de fond préentraîné sur des séquences non étiquetées d'ensembles de gènes biosynthétiques qui améliore significativement la prédiction des propriétés, de la bioactivité et de la similitude structurelle des produits naturels, améliorant ainsi l'efficacité du minage génomique pour de nouveaux produits naturels.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Imaginez que vous êtes un chercheur de trésors à la recherche de potions magiques rares cachées à l'intérieur d'une vaste bibliothèque de livres anciens. Dans le monde de la science, ces « potions » sont des produits naturels (comme des médicaments ou des substances chimiques), et les « livres » sont des clusters de gènes biosynthétiques (des groupes d'instructions dans l'ADN qui disent aux bactéries ou aux champignons comment fabriquer ces potions).
Le problème est que les scientifiques ont découvert des millions de ces « livres d'instructions », mais ils n'ont que le temps et les ressources pour en ouvrir et en tester une infime partie. La majeure partie de la bibliothèque reste intacte, et nous ne savons pas quels livres contiennent les trésors les plus passionnants.
L'ancienne méthode vs la nouvelle méthode
Auparavant, les scientifiques essayaient d'utiliser des programmes informatiques (apprentissage automatique) pour deviner quel type de potion un ensemble spécifique d'instructions produirait. Cependant, ces programmes étaient comme des étudiants essayant d'apprendre une langue en ne lisant que quelques pages d'un dictionnaire. Parce qu'il n'y avait pas assez de données « étiquetées » (des livres où nous connaissons déjà la potion à l'intérieur), les programmes n'étaient pas très doués pour deviner.
La solution du « Modèle de fondation »
Ce document présente un nouvel outil appelé BGC-MLM. Voyez cet outil comme un étudiant super intelligent qui utilise une astuce ingénieuse pour apprendre :
- L'entraînement par « texte à trous » (Pré-entraînement) : D'abord, l'étudiant reçoit des millions de livres d'instructions, mais avec certains mots cachés (masqués). Le travail de l'étudiant est de deviner les mots manquants en se basant sur le contexte de la phrase. Même si l'étudiant ne connaît pas encore la potion finale de ces livres, ce processus lui apprend la grammaire et la structure de la manière dont ces instructions biologiques fonctionnent. Il apprend le « langage » de la chimie de la nature.
- Le test spécialisé (Affinage) : Une fois que l'étudiant a maîtrisé la langue, on lui donne une tâche spécifique : « Regarde ce livre d'instructions et dis-moi si la potion à l'intérieur est susceptible de tuer les bactéries, quelle forme la molécule possède, ou quelles parties chimiques elle contient. » Parce que l'étudiant comprend déjà si bien la langue, il peut apprendre ces tâches spécifiques très rapidement, même avec très peu d'exemples.
Ce que l'article a découvert
Les chercheurs ont testé ce nouveau « modèle de fondation » par rapport aux anciennes méthodes. Ils ont découvert que :
- Apprendre la langue d'abord aide : Le modèle qui a effectué cet entraînement par « texte à trous » a obtenu de meilleurs résultats que les modèles qui essayaient d'apprendre directement sans ce bagage de connaissances.
- C'est un outil polyvalent : BGC-MLM peut prédire beaucoup de choses différentes sur la potion potentielle, telles que sa bioactivité (ce qu'elle pourrait faire biologiquement), sa classe structurelle (à quelle famille elle appartient), et même compter des parties chimiques spécifiques (groupes fonctionnels).
- Il tient tête aux autres : Il est aussi performant, voire plus, que les outils spécialisés conçus pour une seule tâche spécifique.
En résumé, cet article présente une IA intelligente et adaptable qui apprend d'abord le « langage » des manuels d'instructions de la nature, ce qui lui permet de prédire efficacement quelles instructions cachées sont susceptibles de produire les trésors chimiques les plus intéressants, rendant la recherche de nouveaux médicaments beaucoup plus rapide et efficace.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.