← Derniers articles
📄 molecular biology

An RNA Language Model trained on sequence alone reveals the structural logic of Internal Ribosome Entry Sites

Les auteurs présentent Albatross, un modèle de langage d'ARN entraîné uniquement sur des données de séquences qui surpasse de manière significative les méthodes existantes dans la prédiction des structures des sites d'entrée internes du ribosome, permettant la découverte de nouvelles sous-classes fonctionnelles et accélérant l'identification de cibles antivirales.

Auteurs originaux : Sychla, A., Bongrand, P., Yang, G., Iyer, A., Rulison, J., Wesselhoeft, R. A., Bisaria, N., Rouskin, S.

Publié 2026-09-24
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sychla, A., Bongrand, P., Yang, G., Iyer, A., Rulison, J., Wesselhoeft, R. A., Bisaria, N., Rouskin, S.

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète

Les virus sont des maîtres du déguisement, mais leurs secrets les plus critiques sont souvent cachés à la vue de tous au sein de leur code génétique. Pour de nombreux virus, y compris les picornavirus qui causent tout, du rhume banal aux maladies neurologiques dévastatrices, les instructions pour fabriquer de nouvelles particules virales ne sont pas une simple liste de lettres. Elles sont repliées en formes tridimensionnelles complexes. Ces formes agissent comme des interrupteurs et des poignées, permettant au virus de détourner la machinerie de fabrication de protéines de la cellule. L'une des formes les plus importantes est appelée site d'entrée interne du ribosome, ou IRES. Contra contrairement aux cellules humaines, qui ont généralement besoin d'une coiffe spécifique au début de leurs instructions génétiques pour commencer à les lire, ces IRES viraux agissent comme une invitation directe, permettant au virus de commencer à construire des protéines immédiatement et de manière indépendante. Comprendre exactement comment ces IRES se replient est essentiel pour comprendre pourquoi certains virus infectent des tissus spécifiques, pourquoi certains causent des maladies graves alors que d'autres non, et comment nous pourrions concevoir des médicaments pour les arrêter. Cependant, ces structures sont notoirement difficiles à cartographier. Elles sont longues, hautement variables et changent de forme selon l'environnement, ce qui rend les méthodes traditionnelles de prédiction lentes et souvent imprécises.

Une équipe de chercheurs a maintenant développé une nouvelle façon de voir ces formes cachées, contournant le besoin d'expériences coûteuses et chronophages. Ils ont créé un système d'intelligence artificielle, qu'ils ont nommé Albatross, entraîné exclusivement sur les séquences génétiques brutes de milliers de ces éléments viraux. Le système n'a reçu aucune information sur la façon dont l'ARN se replie, les règles de la chimie ou la physique de la stabilité. Il a simplement été nourri de millions de séquences et on lui a demandé d'apprendre les motifs qui les composent. Remarquablement, le modèle a appris à prédire la structure tridimensionnelle de ces éléments viraux avec une grande précision, simplement en reconnaissant les relations statistiques entre les lettres de la séquence. Lorsque les chercheurs ont testé Albatross contre une bibliothèque de 96 IRES viraux complets différents, les prédictions du modèle étaient bien plus précises que celles des meilleures méthodes existantes. Alors que d'autres outils identifiaient correctement moins de la moitié des connexions structurelles réelles, Albatross avait raison environ 80 % du temps.

La puissance de cette approche réside dans ce que le modèle a réellement appris. Il n'a pas seulement mémorisé les formes ; il a appris la logique du virus. En analysant comment un changement dans une partie de la séquence affectait la prédiction d'une autre partie, le modèle a identifié quelles pièces de l'ARN doivent être proches les unes des autres pour fonctionner. Cela a permis aux chercheurs de distinguer les formes qui sont simplement stables de celles qui sont essentielles au fonctionnement du virus. En fait, le modèle était si doué pour repérer les structures fonctionnelles qu'il pouvait prédire quelles parties de l'ARN étaient les plus susceptibles d'être impliquées dans le processus de début d'infection. Cette capacité a permis à l'équipe de construire un atlas massif de plus de 75 000 structures prédites, couvrant une vaste diversité de virus qui n'avaient jamais été étudiés avec autant de détails auparavant.

Gr\à ce nouveau plan, les chercheurs ont découvert quelque chose d'entièrement nouveau. Ils ont trouvé un sous-groupe de structures virales auparavant inconnu qui comprenait une tige étendue, un motif de repliement spécifique qui n'avait pas été vu auparavant dans cette classe de virus. Ils ont testé cette découverte en laboratoire, confirmant que la tige étendue était réelle et qu'elle jouait un rôle crucial dans la capacité du virus à fonctionner. Cette découverte suggère que le modèle peut révéler des vérités biologiques qui étaient auparavant invisibles pour les scientifiques. De plus, l'équipe a montré que cette méthode ne se limite pas à un seul type de virus. Lorsqu'ils ont appliqué la même stratégie d'entraînement au matériel génétique des hantavirus et des capteurs bactériens, le modèle a identifié avec succès des interactions complexes à longue distance et même la capacité d'une seule molécule d'ARN à basculer entre deux formes différentes selon son environnement.

Les implications de ce travail s'étendent bien au-delà de la simple cartographie des virus. Pendant des décennies, les scientifiques ont lutté pour prédire la structure de l'ARN car les molécules sont très flexibles et les règles qui les régissent sont si complexes. Les méthodes traditionnelles reposent souvent sur le calcul de l'énergie de chaque forme possible, un processus qui devient impossible pour les séquences longues. D'autres méthodes nécessitent de comparer de nombreux virus similaires pour trouver des motifs, ce qui échoue lorsque les virus sont trop différents. Albatross contourne ces problèmes en apprenant directement à partir des données de séquence elles-mêmes. Les chercheurs ont constaté que la précision du modèle s'améliorait à mesure qu'ils augmentaient la taille des données d'entraînement et la taille du modèle, suggérant que cette approche peut continuer à s'améliorer avec plus de données.

Cette étude représente un changement significatif dans notre approche de la biologie de l'ARN. Au lieu de traiter ces molécules comme des puzzles statiques à résoudre avec des équations de physique, les chercheurs les ont traitées comme une langue à apprendre. Les résultats montrent que l'histoire évolutive d'un virus est encodée dans sa séquence d'une manière qu'une intelligence artificielle peut décoder. En révélant la logique structurelle de ces éléments viraux, ce travail fournit un nouvel outil puissant pour comprendre comment les virus opèrent et comment ils pourraient être arrêtés. La capacité de prédire ces structures à grande échelle signifie que les scientifiques peuvent désormais explorer le potentiel fonctionnel de milliers de séquences virales qui étaient auparavant trop difficiles à étudier, ouvrant la porte à de nouvelles découvertes en virologie et en médecine.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →