La bioinformática es el puente vital entre la biología y los datos, transformando secuencias genéticas complejas en conocimiento comprensible que impulsa la medicina moderna y la investigación. En Gist.Science, hacemos que estos avances sean accesibles para todos, eliminando las barreras del lenguaje técnico para que cualquier persona pueda seguir el ritmo de los descubrimientos más recientes.

Cada nuevo preimpreso en esta categoría proviene directamente de bioRxiv, la plataforma líder donde los científicos comparten sus hallazgos antes de la publicación formal. Nuestro equipo procesa cada uno de estos documentos para ofrecer tanto resúmenes técnicos detallados como explicaciones en lenguaje sencillo, garantizando que la información fluya sin complicaciones. A continuación, encontrará los últimos artículos publicados en bioinformática seleccionados para su lectura.

💻 bioinformatics

THEOBROMA: an aggregated open database of 1.13 million natural products with per-compound license auditing, three-tier classification, and stereochemistry-aware deduplication

THEOBROMA es una base de datos abierta que agrega más de 1,13 millones de productos naturales de 29 fuentes que se distingue mediante la auditoría de licencias por compuesto, un sistema de clasificación de tres niveles y la deduplicación consciente de la estereoquímica para permitir el cribado virtual con cumplimiento de licencias y el análisis de bioactividad específico de isómeros.

Klamt, T., Jaczkowski, A., Franke, J., Nejdl, W.2026-06-16
💻 bioinformatics

Rapid and consistent clustering of millions of genomes highlights the diversity of prokaryotic life

Los autores presentan gemsparcl, una herramienta altamente escalable y eficiente que agrupa más de 5,6 millones de genomas bacterianos en 92.954 unidades cohesivas genómicas a nivel de especie en aproximadamente 14 horas, superando así los cuellos de botella computacionales para permitir un análisis exhaustivo y libre de referencias de la diversidad y taxonomía procariota.

von Wachsmann, J. H., Lorenz, L. J., Gurbich, T. A., Russell, M. J., Rodriguez Bouza, V., Horsfield, S. T., Lees, J. A. (…)2026-06-15
💻 bioinformatics

Biological meaning in protein embedding space is resolution-dependent

Este estudio demuestra que el significado biológico de los incrustamientos de los modelos de lenguaje de proteínas no es fijo sino que depende de la resolución, donde diferentes niveles de alineación con las jerarquías biológicas preservan selectivamente distintas relaciones organizativas tales como límites de membresía, agrupaciones funcionales o estructuras de familias locales.

Zong, L., Ren, J., Li, Y., Finn, R. D., Wang, J.2026-06-15
💻 bioinformatics

WitChi: Efficient Detection and Pruning of Compositional Bias in Phylogenomic Alignments Using Empirical Chi-Squared Testing

WitChi es una herramienta computacionalmente eficiente que utiliza pruebas de chi-cuadrado empíricas para detectar y podar iterativamente sitios composicionalmente sesgados de alineamientos filogenómicos a gran escala, restaurando así topologías filogenéticas precisas sin el alto costo computacional de los modelos complejos conscientes de la composición.

Koestlbacher, S., Panagiotou, K., Tamarit, D., Ettema, T.2026-06-13
💻 bioinformatics

Testing the reliability of AI-generated protein structures

Este estudio demuestra que AlphaFold2 y ColabFold exhiben una tasa de falsos positivos muy baja al predecir estructuras para secuencias no proteicas, revelando fortuitamente que algunas predicciones con puntuaciones altas en regiones genómicas humanas no codificantes corresponden a pseudogenes no anotados previamente, lo que sugiere posibles errores en las anotaciones génicas existentes y valida la utilidad de las predicciones estructurales de alta puntuación para investigaciones posteriores.

Xu, A., Salzberg, S.2026-06-13
💻 bioinformatics

ADMETron: An AI-driven SaaS platform for comprehensive ADMET prediction and compound prioritisation

ADMETron es una plataforma SaaS impulsada por IA que integra incrustaciones moleculares derivadas de redes neuronales recurrentes (RNN) con máquinas de potenciación del gradiente para predecir 34 parámetros y características de ADMET, y cuenta con una herramienta de visualización de gráficos de radar interactiva, lo que permite una priorización de compuestos de alto rendimiento y una toma de decisiones basada en datos en el descubrimiento de fármacos.

Nair, D. N., Yadav, R. S., Jondhale, P. M., Didhate, S., Gunjal, G., Ranjit, A., Patil, P., Dawande, A., Shisode, A., Bh (…)2026-06-13
💻 bioinformatics

Revealing trajectories of multi-modal voxel-level changes in neurodegenerative diseases using latent event mapping

Este artículo presenta Latent Event Mapping (LEMING), una técnica de modelado no supervisado, escalable e interpretable que reconstruye trayectorias a nivel de vóxel de cambios neuroimágenes multimodales en la enfermedad de Alzheimer, revelando nuevos conocimientos sobre mecanismos dependientes de la progresión, como la asociación en etapa tardía entre la densidad de los receptores de acetilcolina y la patología amiloide.

Pinnawala, S., Hartanto, A., Jairamani, M., Simpson, I. J. A., Wijeratne, P. A.2026-06-11
💻 bioinformatics

STITCH links cellular morphology and gene expression in spatial transcriptomics

El artículo presenta STITCH, un método interpretable basado en el análisis de componentes principales tangenciales en una variedad de forma de Kendall que vincula eficazmente la morfología celular independiente del tamaño con la expresión génica en la transcriptómica espacial, superando a los enfoques existentes de aprendizaje profundo en la identificación de relaciones biológicamente relevantes entre la forma y el transcriptoma a través de diversos conjuntos de datos.

Kumar, S., Shi, Y., Vallius, T., Day, C.-P., Absil, P.- A., Srivastava, A., Hannenhalli, S., Gopalan, V.2026-06-11
💻 bioinformatics

Calibrated Uncertainty Quantification for Patient-Level AML Drug Sensitivity Prediction Using Split Conformal Prediction

Este estudio introduce un marco de predicción conforme dividida aplicado a la cohorte BeatAML 2.0 que genera con éxito intervalos de incertidumbre estadísticamente calibrados para las predicciones de sensibilidad a fármacos a nivel de paciente, revelando patrones de incertidumbre distintos a través de las clases de fármacos al tiempo que demuestra que dicha incertidumbre es independiente de las clasificaciones de riesgo molecular estándar.

Shokrzadeh, A. J., Shokrzadeh, P.2026-06-11