← Derniers articles
💻 bioinformatics

CodonMamba: a foundation model for programmable mRNA coding sequence design

CodonMamba est un modèle de fondation de pointe pour la conception de séquences codantes d'ARNm qui, grâce à un pré-entraînement sur des corpus à grande échelle, atteint une performance supérieure dans les tâches de prédiction et permet un pilotage programmable, lors de l'inférence, de l'optimisation des codons afin de répondre à des préférences spécifiques d'hôtes ou d'applications sans réentraînement.

Auteurs originaux : Lang, M., Fang, X., Wang, Z., Chen, M., Cheng, Z., Zhu, X., Tam, K. Y., Zhang, J., Li, X.

Publié 2026-08-24
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Lang, M., Fang, X., Wang, Z., Chen, M., Cheng, Z., Zhu, X., Tam, K. Y., Zhang, J., Li, X.

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète

Au cœur de chaque cellule vivante, une chaîne de montage complexe transforme les instructions génétiques en protéines qui maintiennent la vie en mouvement. Ces instructions sont écrites dans un langage composé de quatre lettres chimiques, regroupées en triplets appelés codons. Bien que le code génétique soit universel, la manière dont différents organismes utilisent ces triplets varie ; certains préfèrent certaines combinaisons plutôt que d'autres, un peu comme différents dialectes qui privilégient certains mots pour une même idée. Les scientifiques cherchent depuis longtemps à réécrire ces messages génétiques pour créer des médicaments puissants, particulièrement l'ARN messager, ou ARNm, qui agit comme un plan temporaire pour la fabrication de protéines thérapeutiques. Cependant, la conception de ces séquences est un équilibre délicat. Le code doit non seulement produire la bonne protéine, mais aussi se replier correctement, rester stable et être lu efficacement par la cellule hôte spécifique qu'il intègre. Pendant des années, les chercheurs se sont appuyés sur des programmes informatiques pour optimiser ces séquences, mais ces outils nécessitaient souvent une refonte complète chaque fois qu'un scientifique voulait changer les règles pour un nouvel hôte ou une application médicale différente.

Une équipe de chercheurs a maintenant introduit une nouvelle approche appelée CodonMamba, un système conçu pour comprendre et générer ces séquences génétiques avec une flexibilité sans précédent. Plutôt que de simplement mémoriser des motifs à partir de données existantes, ce système fonctionne comme un modèle de fondation, un type d'intelligence artificielle entraînée sur une vaste bibliothèque de séquences de codage naturelles pour saisir les règles sous-jacentes du langage biologique. Les chercheurs ont testé ce modèle par rapport à un ensemble complet de douze tâches différentes liées à la prédiction du comportement de l'ARNm. Dans ces tests, CodonMamba a obtenu de meilleurs résultats que toute méthode précédente, se classant au premier rang dans dix des douze catégories. Ce succès suggère que le modèle a acquis une compréhension profonde et généralisable du fonctionnement des séquences génétiques, lui permettant de prédire les résultats avec un haut degré de précision à travers un large éventail de scénarios biologiques.

Ce qui distingue ce travail, ce n'est pas seulement sa précision, mais sa capacité à être guidé par l'utilisateur au moment de la création. Traditionnellement, si un scientifique voulait concevoir une séquence pour un organisme spécifique, il devait réentraîner l'intégralité du modèle informatique avec de nouvelles données, un processus lent et rigide. CodonMamba change cette dynamique en permettant aux scientifiques de spécifier leurs préférences directement lors de la phase de génération. En introduisant des règles définies par l'utilisateur sur la fréquence d'apparition de certains codons, le système peut s'adapter instantanément aux besoins d'un hôte ou d'une application spécifique sans avoir besoin d'être réentraîné. Cela signifie qu'un seul modèle peut être utilisé pour concevoir des séquences destinées à différents environnements en ajustant simplement les instructions qui lui sont données, préservant la logique biologique centrale tout en déplaçant les choix stylistiques pour s'adapter au nouveau contexte.

Dans leurs expériences, les chercheurs ont démontré que ce système pouvait coordonner plusieurs objectifs de conception à la fois, en optimisant simultanément plusieurs propriétés de la séquence. Ils ont montré que le modèle pouvait prendre une conception génétique destinée à un hôte et la réorienter pour un autre, en changeant les préférences sous-jacentes tout en conservant intactes les choix structurels essentiels. Cette capacité marque un passage de l'optimisation statique à un cadre programmable, où le processus de conception devient une conversation entre le scientifique et le modèle. Les résultats indiquent que ce modèle de fondation offre un outil précis et adaptable pour l'ingénierie de l'ARNm, faisant progresser le domaine vers un avenir où les séquences génétiques pourront être façonnées avec un niveau de spécificité et de facilité qui était auparavant hors de portée.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →