PartitionFinder-mAIC: Phylogenetic Partitioning using Marginal Akaike Information Criterion
Este artículo presenta PartitionFinder-mAIC, una nueva función en IQ-TREE 3 que utiliza el Criterio de Información de Akaike marginal para seleccionar esquemas de particionamiento más eficientes, lo que resulta en menos particiones y una mayor precisión en la inferencia filogenética en comparación con los métodos tradicionales AIC y BIC.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo
La vida en la Tierra es un vasto árbol genealógico ramificado, y los científicos pasan gran parte de su tiempo intentando dibujar las ramas correctamente. Para lograrlo, observan el código genético que se encuentra en plantas, animales y microbios, comparando cómo estas secuencias han cambiado a lo largo de millones de años. Sin embargo, no todas las partes de una secuencia genética cambian a la misma velocidad o de la misma manera. Algunas regiones son como muros antiguos y robustos que apenas se desplazan, mientras que otras son como ladrillos sueltos que se derrumban y se reorganizan con frecuencia. Debido a esta variedad, los investigadores no pueden tratar una secuencia genética completa como un bloque único y uniforme. En su lugar, deben dividir la secuencia en grupos más pequeños, o particiones, donde cada grupo sigue su propio conjunto de reglas sobre cómo evoluciona. Encontrar la forma correcta de agrupar estas secciones es crítico; si los grupos son demasiado amplios, el análisis pierde detalles importantes, pero si son demasiado estrechos, el modelo se llena de una complejidad innecesaria, lo que conduce a una imagen confusa de la historia.
Durante años, una herramienta popular llamada PartitionFinder ha ayudado a los científicos a decidir cómo organizar estas secciones genéticas. Utiliza puntuaciones matemáticas para fusionar grupos similares, con el objetivo de encontrar un equilibrio que evite complicar demasiado la historia. Estas puntuaciones tradicionalmente se han basado en métodos que tratan la agrupación de las secciones como un hecho fijo, asumiendo que los límites están grabados en piedra antes de que se calcule la historia final. Pero un nuevo enfoque sugiere que esta suposición podría ser demasiado rígida. Un método introducido recientemente, conocido como el criterio de información de Akaike marginal, adopta una visión diferente. En lugar de bloquear los grupos en su lugar, promedia la verosimilitud de los datos a través de los modelos de todas las particiones, tratando los límites como posibilidades fluidas. Este cambio permite que el modelo tenga en cuenta mejor la incertidumbre inherente a los datos, lo que potencialmente conduce a una visión más clara de las ramas principales del árbol.
En un nuevo desarrollo, los investigadores han llevado este método más flexible al software ampliamente utilizado IQ-TREE, creando una herramienta que llaman PartitionFinder-mAIC. Al integrar este nuevo sistema de puntuación en los algoritmos existentes, el equipo probó si podía producir mejores resultados que los métodos tradicionales. Pusieron a prueba su nueva herramienta contra una amplia gama de datos simulados, donde el verdadero árbol genealógico ya era conocido, así como con secuencias reales de ADN y proteínas. Los resultados mostraron que el nuevo método elegía consistentemente utilizar menos particiones que los enfoques anteriores. En lugar de dividir los datos genéticos en muchos grupos pequeños y excesivamente específicos, encontró que agrupaciones más amplias eran suficientes para explicar los patrones evolutivos.
Cuando los investigadores aplicaron estos hallazgos a la historia evolutiva de las plantas verdes, el impacto fue tangible. Los esquemas de partición generados por el nuevo método condujeron a inferencias más precisas en las ramas más importantes del árbol genealógico de las plantas. Esto sugiere que, al permitir que el modelo considere una gama más amplia de posibilidades sobre cómo se agrupan los datos, los científicos pueden evitar la trampa del sobreajuste, donde un modelo memoriza el ruido de los datos en lugar de aprender la señal verdadera. La herramienta ya está disponible para que otros investigadores la utilicen en la última versión del software, ofreciendo una forma de refinar los mapas de la historia de la vida con un método que reconoce la naturaleza fluida de la evolución genética.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.