PartitionFinder-mAIC: Phylogenetic Partitioning using Marginal Akaike Information Criterion
Cet article présente PartitionFinder-mAIC, une nouvelle fonctionnalité d'IQ-TREE 3 qui utilise le critère d'information d'Akaike marginal pour sélectionner des schémas de partitionnement plus efficaces, ce qui se traduit par moins de partitions et une meilleure précision de l'inférence phylogénétique par rapport aux méthodes traditionnelles AIC et BIC.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
La vie sur Terre est un vaste arbre généalogique ramifié, et les scientifiques passent une grande partie de leur temps à tenter de dessiner correctement ses branches. Pour ce faire, ils examinent le code génétique présent chez les plantes, les animaux et les microbes, en comparant la façon dont ces séquences ont évolué au fil de millions d'années. Cependant, toutes les parties d'une séquence génétique ne changent pas à la même vitesse ou de la même manière. Certaines régions sont comme de vieux murs robustes qui bougent à peine, tandis que d'autres sont comme des briques lâches qui s'effondrent et se réorganisent fréquemment. En raison de cette variété, les chercheurs ne peuvent pas traiter une séquence génétique entière comme un bloc unique et uniforme. Au lieu de cela, ils doivent diviser la séquence en groupes plus petits, ou partitions, où chaque groupe suit son propre ensemble de règles sur la façon dont il évolue. Trouver la bonne façon de regrouper ces sections est crucial ; si les groupes sont trop larges, l'analyse manque des détails importants, mais s'ils sont trop étroits, le modèle devient encombré d'une complexité inutile, menant à une vision confuse de l'histoire.
Pendant des années, un outil populaire appelé PartitionFinder a aidé les scientifiques à décider comment organiser ces sections génétiques. Il utilise des scores mathématiques pour fusionner les groupes similaires, visant à trouver un équilibre qui évite de trop compliquer l'histoire. Ces scores reposaient traditionnellement sur des méthodes qui traitent le regroupement des sections comme un fait établi, supposant que les limites sont gravées dans la pierre avant que l'histoire finale ne soit calculée. Mais une nouvelle approche suggère que cette supposition pourrait être trop rigide. Une méthode récemment introduite, connue sous le nom de critère d'information d'Akaike marginal, adopte un point de vue différent. Au lieu de verrouiller les groupes en place, elle calcule la moyenne de la vraisemblance des données à travers les modèles de toutes les partitions, traitant les limites comme des possibilités fluides. Ce changement permet au modèle de mieux rendre compte de l'incertitude inhérente aux données, ce qui peut mener à une vision plus claire des branches principales de l'arbre.
Dans un nouveau développement, des chercheurs ont intégré cette méthode plus flexible dans le logiciel largement utilisé IQ-TREE, créant un outil qu'ils appellent PartitionFinder-mAIC. En intégrant ce nouveau système de notation dans les algorithmes existants, l'équipe a testé s'il pouvait produire de meilleurs résultats que les méthodes traditionnelles. Ils ont testé leur nouvel outil contre une large gamme de données simulées, où l'arbre généalogique réel était déjà connu, ainsi que des séquences d'ADN et de protéines du monde réel. Les résultats ont montré que la nouvelle méthode choisissait systématiquement d'utiliser moins de partitions que les anciennes approches. Plutôt que de diviser les données génétiques en de nombreux petits groupes trop spécifiques, elle a constaté que des regroupements plus larges étaient suffisants pour expliquer les modèles évolutifs.
Lorsque les chercheurs ont appliqué ces découvertes à l'histoire évolutive des plantes vertes, l'impact a été tangible. Les schémas de partitionnement générés par la nouvelle méthode ont conduit à des inférences plus précises aux branches les plus importantes de l'arbre généalogique des plantes. Cela suggère qu'en permettant au modèle de considérer une gamme plus large de possibilités sur la façon dont les données sont regroupées, les scientifiques peuvent éviter le piège du surapprentissage, où un modèle mémorise le bruit des données plutôt que d'apprendre le signal véritable. L'outil est désormais disponible pour les autres chercheurs dans la dernière version du logiciel, offrant un moyen d'affiner les cartes de l'histoire de la vie avec une méthode qui reconnaît la nature fluide de l'évolution génétique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.