RNASeek: A Cross-Phyla Generative Foundation Model for Multipurpose RNA Modeling and Reinforcement Learning-Based Design
RNASeek est un modèle de fond génératif de 1,6 milliard de paramètres qui exploite l'apprentissage par renforcement pour unifier la représentation des séquences d'ARN, la prédiction fonctionnelle et la conception de novo, générant avec succès des ribozymes et des 3' UTR validés expérimentalement avec des performances accrues.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Au cœur de chaque cellule vivante, une conversation vaste et complexe se déroule, non pas avec des mots, mais avec des molécules. Au centre de ce dialogue se trouve l'ARN, une molécule polyvalente qui agit à la fois comme un messager et un régulateur, transportant les instructions du plan génétique et décidant de la manière dont ces instructions sont exécutées. Pendant des décennies, les scientifiques ont compris que l'ordre spécifique des lettres dans un brin d'ARN détermine sa forme et sa fonction, tout comme l'agencement des lettres dans une phrase détermine son sens. Cependant, prédire exactement comment une nouvelle séquence de lettres se comportera a été un défi redoutable. Les règles sont complexes, impliquant des interactions à longue portée et des nuances structurelles subtiles qu'il est difficile de cartographier manuellement. Désormais, des chercheurs ont développé un nouvel outil qui apprend ces règles en lisant la littérature biologique de la vie elle-même, leur permettant non seulement de prédire comment l'ARN se comportera, mais aussi de concevoir des molécules entièrement nouvelles dotées de propriétés spécifiques et désirées.
L'équipe derrière ce travail, dirigée par des chercheurs de l'Université de Californie à Riverside et de l'Université de Columbia, a créé un programme informatique massif qu'elle appelle RNASeek. Considérez ce programme comme un étudiant qui aurait lu tous les livres d'une bibliothèque contenant les instructions génétiques de plus de cent espèces différentes, des plantes et des animaux aux champignons et aux virus. Contrairement aux outils précédents qui étaient conçus pour résoudre un seul puzzle spécifique, RNASeek a été construit pour comprendre le langage général de l'ARN. Il a été entraîné sur un ensemble de données comprenant environ 150 milliards de fragments d'informations génétiques, apprenant à reconnaître les motifs dans la façon dont les différents organismes construisent leur ARN. Le programme a également appris à lire des instructions en langage naturel, ce qui signifie qu'un scientifique peut simplement lui dire ce qu'il veut, par exemple « créer une séquence d'ARN stable » ou « concevoir une molécule qui se coupe elle-même », et le modèle tentera de générer une solution.
Pour tester si cet étudiant numérique avait véritablement appris la langue, les chercheurs ont d'abord demandé au modèle de prédire le comportement de ribozymes. Ce sont des molécules d'ARN qui agissent comme des enzymes, capables de se couper elles-mêmes ou de couper d'autres molécules. L'équipe a fourni au modèle des milliers de séquences de ribozymes connues ainsi que leurs vitesses de coupure mesurées. RNASeek a réussi à apprendre à prédire quelles séquences couperaient rapidement et lesquelles seraient lentes, identifiant des caractéristiques subtiles qui contribuent à la vitesse, telles que la flexibilité de certaines boucles dans la structure de la molécule. Le modèle a performé aussi bien, voire mieux, que de nombreux outils spécialisés conçus spécifiquement pour cette tâche, prouvant qu'il avait saisi les principes sous-jacents de la manière dont la structure de l'ARN dicte la fonction.
Encouragés par ce succès, les chercheurs ont poussé le modèle plus loin, en lui demandant de concevoir de nouvelles séquences d'ARN à partir de zéro. Ils se sont concentrés sur un type d'ARN différent trouvé dans la région 3' non traduite, une section de la molécule qui aide à déterminer la durée de vie de l'ARN à l'intérieur d'une cellule. Une durée de vie plus longue signifie que la cellule produit plus de la protéine que l'ARN code, ce qui est crucial pour des thérapies comme les vaccins à ARNm. Les chercheurs ont utilisé une technique appelée apprentissage par renforcement, une méthode où le programme informatique joue un jeu d'essais et d'erreurs. Il a généré des milliers de séquences candidates, et une partie distincte du modèle agissait comme un juge, les évaluant en fonction de la stabilité prédite. Le programme a ensuite ajusté sa stratégie pour générer de meilleurs candidats, apprenant progressivement à produire des séquences hautement stables.
Les résultats étaient frappants. Les séquences conçues par RNASeek n'étaient pas de simples combinaisons aléatoires de lettres ; elles contenaient des motifs spécifiques, tels qu'une abondance d'adénine et d'uracile, qui sont connus pour aider à stabiliser l'ARN. Lorsque les chercheurs ont testé ces conceptions générées par ordinateur en laboratoire, ils ont constaté que les nouvelles séquences performaient exceptionnellement bien. Certaines des molécules conçues étaient même plus stables que les meilleures séquences trouvées dans la nature ou celles créées par d'autres outils d'intelligence artificielle. Crucialement, lorsque les chercheurs ont mélangé les lettres de ces conceptions réussies, en brouillant leur ordre tout en conservant les mêmes ingrédients, la stabilité a disparu. Cela a confirmé que le succès provenait de l'agencement spécifique des lettres, et non de la simple composition chimique, prouvant que le modèle avait appris la véritable syntaxe du langage.
L'étude a également démontré que le modèle pouvait suivre des instructions complexes. Les scientifiques pouvaient demander au programme de générer une séquence d'ARN stable incluant un motif spécifique pour le clonage ou excluant un motif particulier qui pourrait poser problème. Le modèle a réussi à respecter ces contraintes tout en optimisant la stabilité. Cette capacité à suivre des commandes en langage naturel et à produire des composants biologiques fonctionnels suggère une nouvelle façon d'ingénierie du vivant. Au lieu de s'appuyer sur des cycles lents et coûteux d'essais et d'erreurs en laboratoire, les scientifiques peuvent désormais utiliser un système unifié pour prédire comment l'ARN se comportera et concevoir de nouvelles molécules pour répondre à des besoins précis. Ce travail établit qu'un seul modèle à grande échelle peut combler le fossé entre la compréhension des données biologiques et la création de nouveaux outils biologiques fonctionnels, ouvrant la voie à une conception plus efficace des thérapies et des outils de recherche.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.