← Últimos artículos
🧬 biology

Entropy-Driven Alignment-Free Phylogenetic Analysis via K-mer Encoding, DNA Physicochemical Properties, and Rough Set Feature Selection

Este estudio propone un marco de análisis filogenético libre de alineamiento que integra estadísticas de k-meros con propiedades fisicoquímicas del ADN y simetría de hebras en un vector de características, el cual es optimizado mediante un método de selección mejorado basado en conjuntos rugosos para lograr una inferencia evolutiva de genoma completo eficiente e interpretable.

Autores originales: Yong Liu, Tongliang Xia, Xu Yan, He Wang, Xinyang Jiang, Shujie Gao, Shusheng Li, Yan Yang

Publicado 2026-08-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Yong Liu, Tongliang Xia, Xu Yan, He Wang, Xinyang Jiang, Shujie Gao, Shusheng Li, Yan Yang

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo

Para comprender la historia de la vida, los científicos suelen observar las instrucciones moleculares escritas dentro de cada célula viva: la secuencia de ADN. Durante décadas, la forma estándar de comparar estas instrucciones entre diferentes especies ha sido alinearlas una al lado de la otra, letra por letra, de forma muy parecida a como se alinean dos párrafos largos de texto para ver dónde coinciden y dónde difieren. Este método, conocido como alineamiento de secuencias múltiples, funciona bien cuando las secuencias son cortas y muy similares. Sin embargo, a medida que la tecnología ha avanzado, los investigadores ahora pueden leer genomas enteros, que tienen millones de letras de longitud. Cuando se comparan estas secuencias masivas, especialmente entre organismos que han barajado su material genético o han evolucionado rápidamente, el método de alineamiento tradicional se vuelve lento, computacionalmente pesado y, a veces, imposible de realizar con precisión. Esto ha llevado a los científicos a buscar métodos "libres de alineamiento", que intentan encontrar relaciones evolutivas sin forzar las secuencias a una alineación rígida. En lugar de emparejar cada letra, estos enfoques más nuevos observan los patrones generales y las frecuencias de pequeños fragmentos de ADN para inferir qué tan estrechamente relacionados están dos organismos.

En un estudio reciente, un equipo de investigadores de China propuso una nueva forma de perfeccionar estas técnicas libres de alineamiento para hacerlas tanto más rápidas como más precisas. Reconocieron que, si bien muchos métodos existentes simplemente cuentan con qué frecuencia aparecen ciertos patrones cortos de ADN, a menudo pasan por alto dos piezas críticas de información: las propiedades químicas específicas de los componentes del ADN y el orden en el que aparecen esos patrones. Para resolver esto, los investigadores desarrollaron un sistema que traduce una secuencia de ADN en un conjunto de siete mapas diferentes. Cada mapa resalta una característica física distinta del ADN, como si una letra forma parte de un enlace químico fuerte o débil, o si pertenece a una familia química específica. Al convertir la secuencia de ADN original en estos siete patrones binarios distintos, pudieron entonces contar la frecuencia de segmentos cortos similares a palabras dentro de cada mapa. Este proceso creó un perfil detallado y multicapa del genoma que preservaba tanto la naturaleza química del ADN como el orden específico de sus partes.

Sin embargo, este perfil detallado creó una cantidad masiva de datos, que contenía miles de patrones potenciales, muchos de los cuales eran redundantes o poco útiles para determinar la historia evolutiva. Para filtrar este ruido, el equipo aplicó una estrategia matemática conocida como teoría de conjuntos aproximados (rough set theory). Piense en este proceso como un filtro altamente eficiente que clasifica una gran pila de pistas para encontrar solo aquellas que realmente ayudan a distinguir entre diferentes grupos. Los investigadores probaron este sistema de filtrado utilizando un conjunto de entrenamiento de once cepas de hantavirus, un tipo de virus que se encuentra en Asia Oriental. Al analizar qué tan bien diferentes patrones podían separar los virus en sus tipos conocidos, el sistema identificó un conjunto específico de 3,005 patrones de las 14,336 posibilidades originales. Estos patrones seleccionados se convirtieron en la "huella dactilar" central utilizada para analizar los virus.

El equipo puso entonces su método a prueba en tres grupos completamente diferentes de virus para ver si podía reconstruir correctamente sus árboles genealógicos. Primero, analizaron treinta y tres genomas de coronavirus, incluyendo las cepas responsables del SARS y del más reciente SARS-CoV-2. El método agrupó con éxito los virus en cuatro ramas distintas que coincidían con la clasificación científica conocida, separando claramente los virus relacionados con el SARS de los demás e incluso distinguiendo entre el virus SARS original y el nuevo SARS-CoV-2. A continuación, examinaron treinta y nueve cepas del virus de la encefalitis japonesa. Nuevamente, el método clasificó correctamente los virus en sus cuatro grupos genéticos conocidos, reflejando los resultados obtenidos mediante los métodos de alineamiento tradicionales, mucho más lentos. Finalmente, analizaron cincuenta y cinco cepas del virus de la influenza aviar H7N9. El árbol resultante mostró dos linajes principales, uno de América del Norte y otro de Eurasia, y agrupó correctamente los virus que fueron aislados en las mismas regiones geográficas y periodos de tiempo.

A lo largo de estas pruebas, el nuevo enfoque demostró ser notablemente rápido. Mientras que otros métodos gráficos para analizar largas secuencias de ADN pueden tardar varios minutos, este método procesó las sec sequences más largas del estudio, que superaban las 31,000 letras, en tan solo cuatro segundos. Los investigadores señalaron que su enfoque no requiere el paso complejo y laborioso de alinear las secuencias y, sin embargo, captura las señales biológicas esenciales necesarias para construir árboles genealógicos precisos. Si bien el método es potente, los autores reconocen que no proporciona una imagen visual de las diferencias entre las secuencias de la misma manera que otras herramientas, y no modela explícitamente eventos complejos de barajado genético. No obstante, el estudio demuestra que, al combinar las propiedades químicas con un filtrado de datos inteligente, los científicos pueden crear una herramienta que sea tanto eficiente como confiable para rastrear la historia evolutiva de virus y otros organismos a través de genomas completos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →