A bioinformática une biologia e computação para desvendar os mistérios da vida através de dados. Nesta área, pesquisadores transformam sequências genéticas complexas em informações compreensíveis, permitindo descobertas rápidas sobre doenças, evolução e tratamentos personalizados sem depender apenas de laboratórios físicos.

No Gist.Science, processamos diariamente cada novo pré-publicação na categoria de bioinformática enviada pelo bioRxiv. Nosso compromisso é tornar esse conhecimento acessível, oferecendo tanto resumos em linguagem simples para o público geral quanto análises técnicas detalhadas para especialistas, garantindo que ninguém fique de fora das últimas inovações científicas.

Abaixo, você encontrará as últimas pesquisas publicadas nesta área, organizadas para facilitar sua leitura e compreensão dos avanços recentes.

💻 bioinformatics

Handshake: Partner-Specific Protein-Protein Binding Site Prediction at Scale Using ProstT5 and Cross-Chain Attention

O artigo apresenta o Handshake, um modelo de aprendizado profundo apenas de sequência que utiliza o ProstT5 e atenção entre cadeias para prever com precisão locais de ligação proteína-proteína específicos de parceiros em escala, ao mesmo tempo em que revela que a alta redundância de sequências nos dados de treinamento infla significamente as métricas de desempenho em benchmarks existentes.

Haspel, N.2026-06-06
💻 bioinformatics

Divergent Loop Architecture Shapes Pocket2 Variation in Shark Legumains

Este estudo identifica uma alça de superfície divergente que forma o "Pocket2" como uma fonte fundamental de variação estrutural e funcional em legumaínas de tubarão, contrastando com seus núcleos catalíticos, de outra forma altamente conservados, e sugerindo esta região como um alvo para investigações futuras sobre a adaptação de proteases específicas de espécies.

Eijzenga, M., Leibowitz, M., Henley, E. M.2026-06-06
💻 bioinformatics

CryoDiff: An uncertainty-aware diffusion model for Cryo-EM map enhancement

O artigo apresenta o CryoDiff, um modelo de difusão consciente da incerteza que supera os métodos existentes ao aprimorar mapas de criomicroscopia eletrônica (cryo-EM) por meio da melhoria conjunta da resolução estrutural e do fornecimento de estimativas de confiança por voxel, aumentando significativamente a interpretabilidade do mapa e a construção de modelos subsequentes.

Wen, B., He, B., Cheng, Y., Zhou, S., Han, R., Zhang, F.2026-06-06
💻 bioinformatics

Cellpin enables reference-based imputation and denoising of spatial transcriptomes

O artigo apresenta o cellpin, um autoencoder variacional escalável treinado exclusivamente em dados de sequenciamento de RNA de célula única que utiliza destilação latente professor-aluno e simulação de ruído para imputar efetivamente genes não medidos e remover o ruído de perfis de transcriptoma espacial sem exigir o alinhamento entre modalidades.

Putze, P., Lucarelli, D., Wellappili, D., Bahrami, M., Luecken, M. D., Theis, F. J., Saur, D.2026-06-05
💻 bioinformatics

OmniGene-4: A Unified Bio-Language MoE Model with Router-Level Interpretability

O OmniGene-4 introduz um modelo de fundação de Mistura-de-Especialistas unificado e interpretável pelo roteador que demonstra como o pré-treinamento contínuo impulsiona a especialização entre tarefas enquanto a computação de especialistas lida com o raciocínio biológico fundamentado em sequências, alcançando desempenho de estado da arte em homologia de proteínas e conhecimento biológico geral com custos de computação significativamente reduzidos, mesmo quando estendido para entradas multimodais.

Wang, L.2026-06-04
💻 bioinformatics

UnBlender: validating individual analyses in respiratory bulk RNA-seq cell type deconvolution

O artigo apresenta o UnBlender, um pipeline projetado para permitir que cientistas respiratórios realizem a desconvolução de tipos celulares customizável em dados de RNA-seq de bulk, enquanto validam rotineiramente a precisão das proporções estimadas de tipos celulares para garantir conclusões reproduzíveis e confiáveis.

Gillett, T. E., van den Berge, M., Nawijn, M. C., Koppelman, G. H.2026-06-04
💻 bioinformatics

An interpretable machine learning framework for dog breed inference and ancestry decomposition

Este artigo apresenta um framework de aprendizado de máquina interpretável que combina redução de dimensionalidade com um modelo de floresta aleatória de múltiplas saídas para inferir com precisão a identidade da raça e a ancestralidade de cães a partir de dados de SNP de genoma completo, alcançando 91,7% de acurácia no conjunto de dados do Dog Aging Project ao identificar loci genéticos biologicamente relevantes associados a características específicas de cada raça.

Bian, Y., Bierman, R., Snyder-Mackler, N., Promislow, D., Karlsson, E., Dog Aging Project Consortium,, Akey, J. M.2026-06-04
💻 bioinformatics

ROTS 2.0: A reproducibility-driven framework for robust statistical modeling across diverse high-throughput omics study designs

Este artigo apresenta o ROTS 2.0, um framework de código aberto aprimorado disponível em R e Python que estende a estatística de teste otimizada para reprodutibilidade a diversos desenhos de estudos ômicos de alto rendimento, incluindo comparações de múltiplos grupos e análise de sobrevivência, para melhorar a confiabilidade da seleção de características em configurações experimentais complexas.

Suomi, T., Kettunen, J., Pusa, T., Elo, L. L.2026-06-03
💻 bioinformatics

SwiftNJ: Fast Exact Neighbour Joining via Correctness-Gated Coding Agents

Este artigo demonstra que um agente de codificação com portão de correção pode superar significativamente a linha de base RapidNJ estabelecida em filogenética computacional ao produzir o SwiftNJ, uma implementação otimizada de Neighbor Joining que alcança uma razão de tempo de execução geométrica média de 0,565, mantendo a correção exata em relação aos padrões de referência.

Christensen, J.2026-05-29
💻 bioinformatics

Leviathan: A fast, memory-efficient, and scalable taxonomic and pathway profiler for (pan)genome-resolved metagenomics and metatranscriptomics

Leviathan é um pacote de software de código aberto que permite a caracterização taxonômica e funcional ultra-rápida, eficiente em termos de memória e precisa de metagenomas e metatranscriptomas com resolução de genoma e pan-genoma, combinando métodos taxonômicos sem alinhamento com pseudo-alinhamento no espaço de DNA para contornar etapas de busca traduzida computacionalmente dispendiosas.

Espinoza, J. L., Dupont, C. L., Phillips, A.2026-05-28