A bioinformática une biologia e computação para desvendar os mistérios da vida através de dados. Nesta área, pesquisadores transformam sequências genéticas complexas em informações compreensíveis, permitindo descobertas rápidas sobre doenças, evolução e tratamentos personalizados sem depender apenas de laboratórios físicos.

No Gist.Science, processamos diariamente cada novo pré-publicação na categoria de bioinformática enviada pelo bioRxiv. Nosso compromisso é tornar esse conhecimento acessível, oferecendo tanto resumos em linguagem simples para o público geral quanto análises técnicas detalhadas para especialistas, garantindo que ninguém fique de fora das últimas inovações científicas.

Abaixo, você encontrará as últimas pesquisas publicadas nesta área, organizadas para facilitar sua leitura e compreensão dos avanços recentes.

💻 bioinformatics

Genomic Annotation Infrastructure (GAIn): Pipelines and Resource Repositories for Annotating Variants, Positions, and Regions

A Infraestrutura de Anotação Genômica (GAIn) é uma plataforma que possibilita a anotação de variantes genômicas transparente, reprodutível e escalável por meio de pipelines declarativos, repositórios de recursos públicos e interfaces flexíveis de web e linha de comando que suportam extensões personalizadas e reanotação automatizada.

Cokol, M., Chorbadjiev, L., Lee, Y.-h., Jamsandekar, M., Gergova, I., Todorov, I., Iossifov, I.2026-07-12
💻 bioinformatics

A geometric atlas of how ESM3 organizes modalities across depth

Este estudo revela que no modelo de linguagem de proteínas multimodal ESM3, modalidades físicas distintas (sequência, estrutura, estrutura secundária e acessibilidade ao solvente) ocupam inicialmente subespaços separados antes de se fundirem em uma representação de baixa dimensão compartilhada entre as camadas 25 e 35, enquanto as anotações funcionais permanecem ortogonais durante todo o processo, sendo que esta fusão é uma propriedade aprendida e universal, independente do comprimento da proteína, mas atrasada pela desordem estrutural.

Steenwyk, J. L.2026-07-12
💻 bioinformatics

ProtBLIP2-SST: Protein Function Prediction via BLIP2 with Sequence, Structure, and Text

O ProtBLIP2-SST é um novo framework de dois estágios que integra informações de sequência proteica e de estrutura 3D por meio de um modelo de linguagem sensível à estrutura e um projetor Q-Former para permitir que modelos de linguagem de grande escala gerem legendas funcionais flexíveis e abertas, superando assim as limitações da tradicional classificação rígida de ontologia gênica.

Chen, Z., Luo, Q.2026-07-12
💻 bioinformatics

EcoMorph: Universal morphological trait quantification from natural language prompts for ecological research

O EcoMorph é um sistema modular que utiliza o Segment Anything Model 3 (SAM3) baseado em prompts para quantificar com precisão traços morfológicos como área, tamanho e abundância através de diversos contextos ecológicos sem exigir treinamento específico para cada táxon, permitindo, assim, pesquisas ecológicas de alto rendimento a partir de fontes de imagens heterogêneas.

Amoah, E. I., Bunch, Z., Thomas, H. M., Patch, H. M., Grozinger, C.2026-07-12
💻 bioinformatics

Tokenizing single-cell transcriptomes as a native language for large language models

O artigo apresenta o CellTok, uma abordagem inovadora que tokeniza perfis transcriptômicos de célula única contínuos em sequências discretas compatíveis com grandes modelos de linguagem pré-treinados, permitindo, assim, um framework unificado para processar conjuntamente dados celulares, contexto biológico e instruções textuais para realizar diversas tarefas, como identificação celular, inferência de doenças e geração de estados.

Xiao, C., Ding, Y., Bian, H., Chen, Y., Wei, L., Zhang, X.2026-07-11
💻 bioinformatics

scDiagnostics: systematic assessment of cell type annotation in single-cell transcriptomics data

O artigo apresenta o scDiagnostics, um pacote de R de código aberto projetado para detectar sistematicamente anotações de tipos celulares complexas ou enganosas em dados de transcriptômica de célula única, abordando assim uma lacuna crítica nos fluxos de trabalho de análise atuais ao garantir a confiabilidade das interpretações subsequentes.

Christidis, A., Ghazi, A. R., Chawla, S., Turaga, N., Gentleman, R., Geistlinger, L.2026-07-11
💻 bioinformatics

onsite: An Integrated Framework for Phosphosite Localization and False Localization Rate Estimation

O artigo apresenta o **onsite**, um framework Python de código aberto que integra uma estratégia de decóia de alanina para padronizar a estimativa da taxa de falso localizamento entre múltiplos algoritmos de localização de fosfosítios, demonstrando superior escalabilidade e precisão em conjuntos de dados de espectrometria de massas de larga escala.

Yue, Q.-X., Wei, Z., Dai, C., Bai, M., Perez-Riverol, Y., Sachsenberg, T.2026-07-11
💻 bioinformatics

PKProbDesign: RNA inverse folding including pseudoknots by optimizing thermodynamic folding probability

O PKProbDesign é um novo framework baseado em amostragem que aborda o desafio do enovelamento inverso de RNA para estruturas com pseudonós através da otimização direta de probabilidades de enovelamento termodinâmico por meio de decomposição de arcabouço e avaliação de ensemble condicional, superando métodos existentes como DesiRNA e MODENA em alvos de referência.

Otagaki, T., Iwakiri, J., terai, g., Asai, K., Sato, K.2026-07-11
💻 bioinformatics

Spatial mitochondrial lineage tracing uncovers a premetastatic niche and microenvironment programmed fate switching in osteosarcoma

Ao integrar transcriptômica de célula única e espacial com o rastreamento de linhagem baseado em variantes mitocondriais, este estudo revela que a progressão do osteossarcoma envolve uma cascata transcricional em etapas, de progenitores COL3A1 para células metastáticas THY1, uma mudança de destino estritamente licenciada pela co-localização espacial com endotélios PLVAP disfuncionais para formar um nicho pré-metastático enriquecido por PTN/NOTCH, estabelecendo, assim, uma estrutura de "tempo-espaço-linhagem" onde sinais do microambiente impulsionam o comprometimento clonal irreversível.

Xue, Y., Su, Z., Su, J., Chu, A. S., Wan, L., Chen, M., Cheung, J. P. Y., Cheung, K. S. C., Ho, J. W. K.2026-07-11
💻 bioinformatics

ProtAug: An Empirical Investigation of pLM-Guided Data Augmentation for Protein Sequence Prediction Tasks

Este artigo apresenta o ProtAug, um framework para aumento de dados de sequências proteicas guiado por pLM que demonstra sistematicamente como níveis de variação controlados pelo usuário podem melhorar consistentemente o desempenho de predição a jusante em diversas tarefas, revelando que, embora a preservação da plausibilidade biológica seja benéfica em níveis de variação baixos a moderados, o aumento de alta variação também pode impulsionar ganhos por meio de efeitos de regularização.

Chen, Z., Wang, R., Luo, Q.2026-07-11