A bioinformática une biologia e computação para desvendar os mistérios da vida através de dados. Nesta área, pesquisadores transformam sequências genéticas complexas em informações compreensíveis, permitindo descobertas rápidas sobre doenças, evolução e tratamentos personalizados sem depender apenas de laboratórios físicos.

No Gist.Science, processamos diariamente cada novo pré-publicação na categoria de bioinformática enviada pelo bioRxiv. Nosso compromisso é tornar esse conhecimento acessível, oferecendo tanto resumos em linguagem simples para o público geral quanto análises técnicas detalhadas para especialistas, garantindo que ninguém fique de fora das últimas inovações científicas.

Abaixo, você encontrará as últimas pesquisas publicadas nesta área, organizadas para facilitar sua leitura e compreensão dos avanços recentes.

💻 bioinformatics

PanGBank: a large-scale resource of precomputed microbial pangenomes built with PPanGGOLiN

O PanGBank é um banco de dados abrangente e de acesso aberto que fornece pangenomas pré-computados para mais de 4.600 espécies procarióticas usando o PPanGGOLiN, oferecendo recursos baseados em grafos padronizados e múltiplas ferramentas de acesso para facilitar a genômica comparativa em larga escala e o estudo da evolução e adaptação microbiana.

Mainguy, J., Lemane, T., Bazin, A., Arnoux, J., Gautreau, G., Medigue, C., Calteau, A., Vallenet, D.2026-08-09
💻 bioinformatics

Move BeTween modAlities (MBTA) employs flow matching to predict single cell data modalities

O artigo apresenta o Move BeTween modAlities (MBTA), um novo framework que utiliza o fluxo de correspondência (flow matching) para conectar espaços latentes específicos de cada modalidade e abordar o desajuste estrutural em dados de célula única, permitindo assim uma tradução transmodal precisa enquanto preserva a integridade estrutural única de cada modalidade molecular.

Xu, B., Zhang, Y., Michor, F.2026-08-09
💻 bioinformatics

Scalable Extraction of Information on Protein-Protein Interactions using Topological Data Analysis

Este artigo introduz uma estrutura de Análise de Dados Topológicos escalável que reduz significativamente o custo computacional de prever interfaces de interação proteína-proteína a partir de patches de superfície, mantendo uma precisão competitiva em comparação com métodos estabelecidos de aprendizado profundo geométrico.

Mukherjee, A., Park, B., Malmstrom, A., Cisewski-Kehe, J., Van Lehn, R. C., Zavala, V. M.2026-08-09
💻 bioinformatics

A hierarchical orthology framework reveals viral carbohydrate-active genes across the global virosphere

Este estudo introduz o VirGenes, uma estrutura de ortologia hierárquica que integra dados de sequência, estruturais e funcionais para descobrir uma vasta diversidade, anteriormente subestimada, de enzimas de carboidratos virais através da virosfera global, revelando suas complexas origens evolutivas e papéis significativos nas interações vírus-hospedeiro.

Meng, L., Zhang, R., De Castro, C., Uchiyama, I., Kanehisa, M., Ogata, H.2026-08-07
💻 bioinformatics

Phylogeny-aided detection of contamination in nearly 5 million SARS-CoV-2 genomes

O estudo introduz o PhyCD, uma ferramenta computacional auxiliada por filogenia que analisou quase 5 milhões de genomas de SARS-CoV-2 para identificar mais de 10.000 eventos de contaminação e mascarar quase 65.000 substituições errôneas, melhorando, assim, a confiabilidade das análises subsequentes de evolução e transmissão de patógenos.

Anoufa, O., Ly-Trong, N., Goldman, N., De Maio, N.2026-08-07
💻 bioinformatics

SLIM: A small linear model with STRING embeddings for single-cell genetic perturbation prediction

O SLIM é um modelo leve e computacionalmente eficiente que utiliza embeddings de rede STRING de 64 dimensões e um estimador de regressão de ridge de forma fechada para prever com precisão as respostas celulares a perturbações genéticas, frequentemente superando baselines complexos de aprendizado profundo com parâmetros treináveis mínimos.

Hu, D., Pielies Avelli, M., Jensen, L. J., Rasmussen, S.2026-08-07
💻 bioinformatics

From Abandoned Scripts to FAIR Community Pipelines: Rescuing Orphan Bioinformatics Workflows with nf-core - Lessons from Light-Sheet Fluorescence Microscopy

Este artigo demonstra que softwares científicos órfãos, como o abandonado toolkit NuMorph baseado em MATLAB, podem ser resgatados com sucesso e transformados em fluxos de trabalho comunitários sustentáveis e reutilizáveis, como o nf-core/lsmquant, ao aplicar uma reengenharia sistemática guiada pelos princípios FAIR e padrões modernos de engenharia de software.

Schwitalla, C., Kuhn Cuellar, L., Hoertenhuber, M., Grote, N., Woller, T., Lamberti, I., Pavie, B., Kuestner, T., Kyere (…)2026-08-06
💻 bioinformatics

Benchmarking Twist Genotyping-by-Sequencing Against Whole-Genome Sequencing in Nuclear Families

Este estudo avalia o desempenho da plataforma de captura de SNPs em todo o genoma (GxS) da Twist Bioscience em relação ao sequenciamento de genoma completo e ao array Illumina GSA-24, através da avaliação da concordância de genotipagem e das taxas de violação mendeliana em 555 indivíduos em 184 famílias nucleares, visando fornecer uma avaliação de terceiros desta tecnologia emergente de sequenciamento direcionado.

Klugerman, J., Iossifov, I., Ye, K.2026-08-06
💻 bioinformatics

A Comprehensive Database of Simulations and Meshes of Coronary Arteries from the Fame 2 Trial

Este artigo apresenta um banco de dados publicamente disponível contendo simulações de Navier-Stokes instacionárias 3D e malhas hexaédricas de alta qualidade para 779 artérias coronárias reconstruídas a partir do ensaio FAME 2, visando abordar a escassez de dados numéricos de hemodinâmica para aplicações de modelagem baseada em dados e aprendizado de máquina.

Marcinno', F., Hinz, J., Ando', E., Mahendiran, T., Buffa, A., Deparis, S.2026-08-05