La bioinformática es el puente vital entre la biología y los datos, transformando secuencias genéticas complejas en conocimiento comprensible que impulsa la medicina moderna y la investigación. En Gist.Science, hacemos que estos avances sean accesibles para todos, eliminando las barreras del lenguaje técnico para que cualquier persona pueda seguir el ritmo de los descubrimientos más recientes.

Cada nuevo preimpreso en esta categoría proviene directamente de bioRxiv, la plataforma líder donde los científicos comparten sus hallazgos antes de la publicación formal. Nuestro equipo procesa cada uno de estos documentos para ofrecer tanto resúmenes técnicos detallados como explicaciones en lenguaje sencillo, garantizando que la información fluya sin complicaciones. A continuación, encontrará los últimos artículos publicados en bioinformática seleccionados para su lectura.

💻 bioinformatics

A geometric atlas of how ESM3 organizes modalities across depth

Este estudio revela que en el modelo de lenguaje de proteínas multimodal ESM3, las distintas modalidades físicas (secuencia, estructura, estructura secundaria y accesibilidad al solvente) ocupan inicialmente subespacios separados antes de fusionarse en una representación compartida de baja dimensión entre las capas 25 y 35, mientras que las anotaciones funcionales permanecen ortogonales en todo momento, siendo este proceso de fusión una propiedad aprendida y universal independiente de la longitud de la proteína, pero retrasada por el desorden estructural.

Steenwyk, J. L.2026-07-12
💻 bioinformatics

ProtBLIP2-SST: Protein Function Prediction via BLIP2 with Sequence, Structure, and Text

ProtBLIP2-SST es un novedoso marco de dos etapas que integra la información de la secuencia proteica y de la estructura 3D mediante un modelo de lenguaje sensible a la estructura y un proyector Q-Former para permitir que los modelos de lenguaje de gran tamaño generen descripciones funcionales flexibles y abiertas, superando así las limitaciones de la clasificación rígida de la ontología génica tradicional.

Chen, Z., Luo, Q.2026-07-12
💻 bioinformatics

EcoMorph: Universal morphological trait quantification from natural language prompts for ecological research

EcoMorph es un sistema modular que aprovecha el modelo Segment Anything 3 (SAM3) basado en prompts para cuantificar con precisión rasgos morfológicos como área, tamaño y abundancia a través de diversos contextos ecológicos sin requerir entrenamiento específico por taxón, permitiendo así la investigación ecológica de alto rendimiento a partir de fuentes de imágenes heterogéneas.

Amoah, E. I., Bunch, Z., Thomas, H. M., Patch, H. M., Grozinger, C.2026-07-12
💻 bioinformatics

Tokenizing single-cell transcriptomes as a native language for large language models

El artículo presenta CellTok, un enfoque novedoso que tokeniza perfiles transcriptómicos de célula única continuos en secuencias discretas compatibles con modelos de lenguaje de gran tamaño preentrenados, permitiendo así un marco unificado para procesar conjuntamente datos celulares, contexto biológico e instrucciones textuales para realizar diversas tareas como la identificación de células, la inferencia de enfermedades y la generación de estados.

Xiao, C., Ding, Y., Bian, H., Chen, Y., Wei, L., Zhang, X.2026-07-11
💻 bioinformatics

scDiagnostics: systematic assessment of cell type annotation in single-cell transcriptomics data

El artículo presenta scDiagnostics, un paquete de R de código abierto diseñado para detectar sistemáticamente anotaciones de tipos celulares complejas o engañosas en datos de transcriptómica de célula única, abordando así una brecha crítica en los flujos de trabajo de análisis actuales al asegurar la fiabilidad de las interpretaciones posteriores.

Christidis, A., Ghazi, A. R., Chawla, S., Turaga, N., Gentleman, R., Geistlinger, L.2026-07-11
💻 bioinformatics

onsite: An Integrated Framework for Phosphosite Localization and False Localization Rate Estimation

El artículo presenta **onsite**, un marco de trabajo de Python de código abierto que integra una estrategia de alanina-decoy para estandarizar la estimación de la tasa de localización falsa a través de múltiples algoritmos de localización de fosfositos, demostrando una escalabilidad y precisión superiores en conjuntos de datos de espectrometría de masas a gran escala.

Yue, Q.-X., Wei, Z., Dai, C., Bai, M., Perez-Riverol, Y., Sachsenberg, T.2026-07-11
💻 bioinformatics

PKProbDesign: RNA inverse folding including pseudoknots by optimizing thermodynamic folding probability

PKProbDesign es un novedoso marco de muestreo que aborda el desafío del plegamiento inverso de ARN para estructuras con pseudonudos mediante la optimía directa de las probabilidades de plegamiento termodinámico a través de la descomposición de andamios y la evaluación de conjuntos condicionales, superando a métodos existentes como DesiRNA y MODENA en objetivos de referencia.

Otagaki, T., Iwakiri, J., terai, g., Asai, K., Sato, K.2026-07-11
💻 bioinformatics

Spatial mitochondrial lineage tracing uncovers a premetastatic niche and microenvironment programmed fate switching in osteosarcoma

Al integrar la transcriptómica de célula única y espacial con el rastreo de linaje basado en variantes mitocondriales, este estudio revela que la progresión del osteosarcoma implica una cascada transcripcional escalonada desde progenitores COL3A1 hacia células metastásicas THY1, un cambio de destino estrictamente autorizado por la colocalización espacial con endotelios PLVAP disfuncionales para formar un nicho premetastásico enriquecido en PTN/NOTCH, estableciendo así un marco de "tiempo-espacio-linaje" donde las señales del microambiente impulsan un compromiso clonal irreversible.

Xue, Y., Su, Z., Su, J., Chu, A. S., Wan, L., Chen, M., Cheung, J. P. Y., Cheung, K. S. C., Ho, J. W. K.2026-07-11
💻 bioinformatics

ProtAug: An Empirical Investigation of pLM-Guided Data Augmentation for Protein Sequence Prediction Tasks

Este artículo presenta ProtAug, un marco para el aumento de datos de secuencias proteicas guiado por pLM que demuestra sistemáticamente cómo los niveles de variación controlados por el usuario pueden mejorar consistentemente el rendimiento de la predicción descendente en diversas tareas, revelando que, si bien preservar la plausibilidad biológica es beneficioso con una variación de baja a moderada, el aumento de alta variación también puede impulsar mejoras a través de efectos de regularización.

Chen, Z., Wang, R., Luo, Q.2026-07-11
💻 bioinformatics

High resolution Streptococcus pyogenes core genome MLST and LIN coding scheme for outbreak detection

Este artículo presenta un novedoso, escalable y de acceso global esquema de codificación LIN y MLST de genoma central para *Streptococcus pyogenes*, alojado en PubMLST, para mejorar la detección de brotes y facilitar la colaboración internacional en el seguimiento de variantes genéticas.

Ryan, Y., Jolley, K. A., Hearn, H., Parfitt, K. M., Platt, S., Lamagni, T., Moganeradj, K.2026-07-11