A bioinformática une biologia e computação para desvendar os mistérios da vida através de dados. Nesta área, pesquisadores transformam sequências genéticas complexas em informações compreensíveis, permitindo descobertas rápidas sobre doenças, evolução e tratamentos personalizados sem depender apenas de laboratórios físicos.

No Gist.Science, processamos diariamente cada novo pré-publicação na categoria de bioinformática enviada pelo bioRxiv. Nosso compromisso é tornar esse conhecimento acessível, oferecendo tanto resumos em linguagem simples para o público geral quanto análises técnicas detalhadas para especialistas, garantindo que ninguém fique de fora das últimas inovações científicas.

Abaixo, você encontrará as últimas pesquisas publicadas nesta área, organizadas para facilitar sua leitura e compreensão dos avanços recentes.

💻 bioinformatics

TEDlm: domain-centric protein language models with optional structural pre-training

O artigo introduz o TEDlm, um modelo de linguagem de proteínas centrado em domínios pré-treinado em segmentos de domínios estruturalmente definidos que supera modelos de sequência completa maiores na detecção de homologia remota e na predição de função molecular, demonstrando que focar em sinais intrínsecos aos domínios produz representações compactas e estruturalmente informadas.

Wei, T., Kandathil, S. M., Buchan, D. W. A., Jones, D. T.2026-07-13
💻 bioinformatics

amR: an R package suite to predict antimicrobial resistance in bacterial pathogens

O conjunto de pacotes amR oferece uma estrutura abrangente e interpretável para prever a resistência antimicrobiana em patógenos bacterianos ao integrar a extração de características genômicas multiescala, o treinamento de modelos de aprendizado de máquina e a visualização interativa para descobrir mecanismos de resistência multidrogas e entre espécies.

Ghosh, A., Brenner, E. P., Boyer, E. A., McKim, A. P., Vang, C. K., Wolfe, E. P., Mayer, D. A., Lesiyon, R. L., Ravi, J.2026-07-13
💻 bioinformatics

Capabilities, specificity gaps and training-data dependence of AlphaFold3 across diverse application areas

Este artigo avalia o desempenho do AlphaFold3 em diversas aplicações biomoleculares, constatando que, embora ofereça poderosas capacidades de modelagem de todos os átomos, sua precisão e confiabilidade são desiguais e fortemente dependentes da sobreposição do conjunto de treinamento, necessitando de uma interpretação cautelosa em comparação ao seu predecessor.

Follonier, O., Liu, Y., Campomanes, P., Lafrenaye, L., Racle, J., Alvarez, D., van Gerwen, J., Heinzmann, R., Jänes, J. (…)2026-07-13
💻 bioinformatics

Genomic Annotation Infrastructure (GAIn): Pipelines and Resource Repositories for Annotating Variants, Positions, and Regions

A Infraestrutura de Anotação Genômica (GAIn) é uma plataforma que possibilita a anotação de variantes genômicas transparente, reprodutível e escalável por meio de pipelines declarativos, repositórios de recursos públicos e interfaces flexíveis de web e linha de comando que suportam extensões personalizadas e reanotação automatizada.

Cokol, M., Chorbadjiev, L., Lee, Y.-h., Jamsandekar, M., Gergova, I., Todorov, I., Iossifov, I.2026-07-12
💻 bioinformatics

A geometric atlas of how ESM3 organizes modalities across depth

Este estudo revela que no modelo de linguagem de proteínas multimodal ESM3, modalidades físicas distintas (sequência, estrutura, estrutura secundária e acessibilidade ao solvente) ocupam inicialmente subespaços separados antes de se fundirem em uma representação de baixa dimensão compartilhada entre as camadas 25 e 35, enquanto as anotações funcionais permanecem ortogonais durante todo o processo, sendo que esta fusão é uma propriedade aprendida e universal, independente do comprimento da proteína, mas atrasada pela desordem estrutural.

Steenwyk, J. L.2026-07-12
💻 bioinformatics

ProtBLIP2-SST: Protein Function Prediction via BLIP2 with Sequence, Structure, and Text

O ProtBLIP2-SST é um novo framework de dois estágios que integra informações de sequência proteica e de estrutura 3D por meio de um modelo de linguagem sensível à estrutura e um projetor Q-Former para permitir que modelos de linguagem de grande escala gerem legendas funcionais flexíveis e abertas, superando assim as limitações da tradicional classificação rígida de ontologia gênica.

Chen, Z., Luo, Q.2026-07-12
💻 bioinformatics

EcoMorph: Universal morphological trait quantification from natural language prompts for ecological research

O EcoMorph é um sistema modular que utiliza o Segment Anything Model 3 (SAM3) baseado em prompts para quantificar com precisão traços morfológicos como área, tamanho e abundância através de diversos contextos ecológicos sem exigir treinamento específico para cada táxon, permitindo, assim, pesquisas ecológicas de alto rendimento a partir de fontes de imagens heterogêneas.

Amoah, E. I., Bunch, Z., Thomas, H. M., Patch, H. M., Grozinger, C.2026-07-12
💻 bioinformatics

Tokenizing single-cell transcriptomes as a native language for large language models

O artigo apresenta o CellTok, uma abordagem inovadora que tokeniza perfis transcriptômicos de célula única contínuos em sequências discretas compatíveis com grandes modelos de linguagem pré-treinados, permitindo, assim, um framework unificado para processar conjuntamente dados celulares, contexto biológico e instruções textuais para realizar diversas tarefas, como identificação celular, inferência de doenças e geração de estados.

Xiao, C., Ding, Y., Bian, H., Chen, Y., Wei, L., Zhang, X.2026-07-11
💻 bioinformatics

scDiagnostics: systematic assessment of cell type annotation in single-cell transcriptomics data

O artigo apresenta o scDiagnostics, um pacote de R de código aberto projetado para detectar sistematicamente anotações de tipos celulares complexas ou enganosas em dados de transcriptômica de célula única, abordando assim uma lacuna crítica nos fluxos de trabalho de análise atuais ao garantir a confiabilidade das interpretações subsequentes.

Christidis, A., Ghazi, A. R., Chawla, S., Turaga, N., Gentleman, R., Geistlinger, L.2026-07-11
💻 bioinformatics

onsite: An Integrated Framework for Phosphosite Localization and False Localization Rate Estimation

O artigo apresenta o **onsite**, um framework Python de código aberto que integra uma estratégia de decóia de alanina para padronizar a estimativa da taxa de falso localizamento entre múltiplos algoritmos de localização de fosfosítios, demonstrando superior escalabilidade e precisão em conjuntos de dados de espectrometria de massas de larga escala.

Yue, Q.-X., Wei, Z., Dai, C., Bai, M., Perez-Riverol, Y., Sachsenberg, T.2026-07-11