Evaluation of multiple sclerosis risk loci reveals that genomic oracles fail to generalise sequence effects across host contexts
Cette étude démontre que les oracles génomiques par apprentissage profond ne parviennent pas à généraliser les effets de séquence à travers différents contextes d'hôtes, car leurs prédictions de l'activité des éléments régulateurs sont fortement dépendantes de la localisation génomique spécifique et ne peuvent être prédites de manière fiable par les seules caractéristiques de la séquence.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le vaste paysage du génome humain, certaines portions d'ADN agissent comme des interrupteurs, activant ou désactivant des gènes pour contrôler le fonctionnement des cellules. Les scientifiques cherchent depuis longtemps à comprendre le code précis qui indique à ces interrupteurs où travailler et quand s'activer. Ces dernières années, de puissants programmes informatiques sont apparus pour aider à décoder ce langage. Ces programmes, souvent appelés « oracles génomiques », peuvent analyser une chaîne de lettres d'ADN et prédire comment elle se comportera à l'intérieur d'une cellule vivante, en estimant si elle s'ouvrira pour permettre l'activité génique ou si elle restera fermée. Parce que ces outils numériques sont rapides et peu coûteux par rapport aux expériences de laboratoire, les chercheurs les utilisent de plus en plus pour concevoir de nouvelles séquences d'ADN, espérant créer des interrupteurs personnalisés qui fonctionnent exactement comme prévu. L'espoir sous-jacent est que si un programme informatique indique qu'une séquence d'ADN spécifique est un bon interrupteur dans une partie du génome, elle restera un bon interrupteur si elle est déplacée à un autre endroit.
Une nouvelle étude remet en question cette hypothèse fondamentale en testant si ces prédictions numériques tiennent la route lorsque la même séquence d'ADN est placée dans différents quartiers du génome. Les chercheurs se sont concentrés sur la sclérose en plaques, une maladie où le système immunitaire attaque le système nerveux, et ont examiné les régions génétiques spécifiques connues pour augmenter le risque de développer cette affection. Ils ont utilisé un modèle d'intelligence artificielle pour générer des milliers de séquences d'ADN candidates qui semblaient pouvoir fonctionner comme des interrupteurs régulateurs dans les cellules immunitaires. Ils ont ensuite utilisé un oracle génomique pour évaluer ces candidates, sélectionnant celles que l'ordinateur prédisait comme étant les plus actives. L'équipe a ensuite réalisé un test rigoureux : elle a pris ces mêmes séquences sélectionnées et les a placées dans vingt-quatre emplacements différents au sein du génome pour voir si la prédiction de l'ordinateur restait cohérente.
Les résultats ont révélé un manque de cohérence frappant. Bien que le programme informatique puisse bien classer les séquences au sein d'un seul emplacement, ses prédictions ne se généralisaient pas lorsque les séquences étaient déplacées. L'effet d'un changement spécifique dans la séquence d'ADN n'était pas une propriété fixe de la séquence elle-même ; au contraire, il dépendait entièrement de l'endroit où la séquence se trouvait dans le génome. Dans certains emplacements, une modification spécifique de l'ADN rendait la séquence plus active, tandis que dans d'autres emplacements, cette même modification la rendait moins active ou n'avait aucun effet. Les chercheurs ont découvert que le comportement de la séquence était si dépendant de son environnement que la variation entre les différents emplacements était massive, l'effet s'inversant de direction dans près de la moitié des sites testés.
Pour comprendre ce que l'ordinateur « voyait » réellement, l'équipe a procédé à des interventions directes sur les séquences d'ADN. Ils ont testé si la préférence de l'ordinateur était dictée par la présence de sites de liaison spécifiques pour des protéines connues pour contrôler les gènes, ou par la densité de ces sites. La réponse est non ; supprimer ces sites ou changer leur nombre n'a pas modifié le score de l'ordinateur de manière prévisible. Au lieu de cela, le facteur qui comptait vraiment était le contenu d'une structure chimique spécifique appelée CpG, qui implique l'appariement de deux lettres d'ADN. Cependant, même ce facteur n'agissait pas seul. Augmenter la quantité de cette structure dans l'ADN améliorait le score dans certains emplacements génomiques, mais nuisait au score dans d'autres. La direction de l'effet était déterminée par l'emplacement hôte, et non par la modification elle-même.
L'étude a également testé si un second programme informatique, entraîné de manière indépendante, produirait les mêmes résultats. Ce nouveau modèle, construit avec une architecture différente et entraîné sur des données différentes, a confirmé la conclusion principale : l'effet de la modification de l'ADN était hautement instable et variait considérablement selon l'emplacement génomique. Cependant, les deux programmes n'étaient pas d'accord sur les emplacements exacts qui montreraient un effet positif ou négatif, suggérant que si l'instabilité est un phénomène réel, les détails précis de la manière dont un modèle interprète un emplacement sont propres à ce modèle.
Plus crucial encore, les chercheurs ont vérifié si les séquences sélectionnées par l'ordinateur fonctionnaient réellement mieux lors d'une expérience en conditions réelles. Ils ont comparé les scores de l'ordinateur à l'activité mesurée à partir d'un essai de laboratoire à grande échelle impliquant des milliers d'éléments d'ADN. Les critères de sélection de l'ordinateur n'ont pas réussi à prédire quelles séquences étaient réellement actives dans les cellules. En fait, les séquences que l'oracle jugeait les plus performantes présentaient souvent le comportement opposé dans le laboratoire, les éléments les plus spécifiques et les plus actifs recevant les scores les plus bas de l'oracle. Ce décalage suggère que l'objectif spécifique que l'ordinateur optimisait ne reflète pas l'activité biologique réelle de l'ADN.
Les chercheurs ont également découvert qu'une méthode mathématique beaucoup plus simple, basée sur le comptage de motifs de lettres dans l'ADN, pouvait générer des séquences aussi bien que les modèles complexes d'intelligence artificielle de type apprentissage profond (deep learning). Cette méthode simple, qui ne nécessite pas d'ordinateurs puissants et peut être ajustée en quelques secondes, égalait les performances des réseaux de neurones avancés sur chaque mesure testée. Cette découverte implique que la complexité des modèles d'apprentissage profond n'était pas nécessaire pour capturer les motifs essentiels des séquences d'ADN dans ce contexte.
En conclusion, l'étude démontre qu'un effet au niveau de la séquence appris ou mesuré par un oracle génomique n'est pas une propriété de la séquence seule. C'est une propriété de la séquence combinée au contexte génomique spécifique dans lequel elle se trouve. Cette dépendance à l'emplacement n'est pas prévisible à partir de caractéristiques simples et peu coûteuses de l'ADN environnant. Pour les scientifiques concevant de nouveaux éléments génétiques, cela signifie qu'un design choisi et validé dans une simulation informatique à un endroit donné ne garantit en rien son comportement une fois déplacé ou inséré ailleurs. Ces conclusions servent de mise en garde : ces outils numériques puissants, bien qu'utiles, ne peuvent pas encore être pleinement fiables pour prédire le comportement de séquences conçues à travers la diversité du paysage du génome humain sans une vérification expérimentale directe à de multiples emplacements.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.