A deep-learning-based score to evaluate multiple sequence alignments
Cet article démontre que le score de somme de paires, largement utilisé, échoue souvent à identifier les alignements de séquences multiples les plus précis et propose un cadre de notation basé sur l'apprentissage profond, spécifiquement le Modèle 2, qui classe efficacement les alignements alternatifs afin d'améliorer la reconstruction phylogénétique en aval.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de mettre en rang un groupe de personnes qui racontent toutes des versions légèrement différentes de la même histoire. Dans le monde de la biologie, ces « personnes » sont des séquences d'ADN ou de protéines, et l'« histoire » est leur histoire évolutive commune. Les scientifiques appellent ce processus l'alignement de séquences multiples (MSA). Réussir ce alignement est crucial car si l'histoire est mal ordonnée, toutes les conclusions que les scientifiques tireront sur la façon dont ces organismes ont évolué seront fausses.
Pendant longtemps, les scientifiques ont utilisé une règle empirique spécifique pour décider quel alignement est le meilleur. Ils appellent cela le score de la « somme des paires » (SP). Considérez le score SP comme un enseignant qui noterait un projet de groupe en se basant uniquement sur le nombre de fois où les réponses des élèves concordent entre elles. Si deux élèves écrivent le même mot au même endroit, ils obtiennent un point. L'alignement avec le plus de points de concordance l'emporte.
Le Problème
Les auteurs de cet article ont découvert une faille dans ce système de notation. Ce n'est pas parce qu'un alignement possède le plus grand nombre de points de concordance (le meilleur score SP) qu'il s'agit en réalité de la version la plus fidèle de l'histoire. C'est comme un élève qui aurait mémorisé les réponses par cœur pour obtenir un score élevé, mais qui aurait complètement mal compris l'intrigue de l'histoire. Dans de nombreux cas, le « vainqueur » selon le score SP était en réalité un mauvais alignement par rapport à la version réelle et correcte.
La Solution : Un nouveau genre de juge
Pour corriger cela, les chercheurs ont construit une IA d'apprentissage profond (deep-learning) pour agir comme un juge plus intelligent. Ils ne se sont pas contentés de regarder de simples correspondances ; ils ont examiné tout un ensemble d'indices et de caractéristiques au sein de l'alignement. Ils ont créé deux « modèles » différents (juges IA) pour résoudre le problème :
Modèle 1 (Le critique individuel) : Ce modèle examine un seul alignement et tente de deviner à quel point il s'éloigne de la vérité. C'est comme un critique qui lit une seule histoire et lui attribue une note en fonction de ce qu'il pense être son exactitude. Ce modèle était meilleur pour prédire l'exactitude que l'ancien score SP, mais il n'était pas très doué pour choisir le meilleur parmi un groupe d'options.
Modèle 2 (L'arbitre de tournoi) : Ce modèle est la véritable star. Au lieu de juger un alignement de manière isolée, il examine un ensemble complet de différents alignements pour la même histoire et les classe les uns par rapport aux autres. C'est comme un arbitre lors d'un tournoi sportif qui compare toutes les équipes pour décider qui a réellement gagné, plutôt que de simplement regarder les statistiques d'une seule équipe.
Les Résultats
Lorsque les chercheurs ont testé ces nouveaux modèles, le Modèle 2 s'est avéré être le meilleur pour trouver l'alignement le plus précis. Il a battu l'ancien score SP, le Modèle 1, et même plusieurs autres programmes informatiques populaires utilisés par les scientifiques.
Enfin, ils ont démontré que lorsque les scientifiques utilisent cette nouvelle IA pour choisir le meilleur alignement, les « arbres généalogiques » (reconstructions phylogénétiques) qui montrent comment les organismes sont apparentés sont beaucoup plus précis. Essentiellement, en utilisant une méthode plus intelligente pour noter les alignements, les scientifiques peuvent raconter la véritable histoire de l'évolution avec beaucoup plus de confiance.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.