A bioinformática une biologia e computação para desvendar os mistérios da vida através de dados. Nesta área, pesquisadores transformam sequências genéticas complexas em informações compreensíveis, permitindo descobertas rápidas sobre doenças, evolução e tratamentos personalizados sem depender apenas de laboratórios físicos.

No Gist.Science, processamos diariamente cada novo pré-publicação na categoria de bioinformática enviada pelo bioRxiv. Nosso compromisso é tornar esse conhecimento acessível, oferecendo tanto resumos em linguagem simples para o público geral quanto análises técnicas detalhadas para especialistas, garantindo que ninguém fique de fora das últimas inovações científicas.

Abaixo, você encontrará as últimas pesquisas publicadas nesta área, organizadas para facilitar sua leitura e compreensão dos avanços recentes.

💻 bioinformatics

Prediction of protein-carbohydrate binding sites from protein primary sequence

Este estudo introduz o StackCBEmbed, um novo modelo de aprendizado de máquina de conjunto que combina características de sequência tradicionais com embeddings de modelos de linguagem de proteínas pré-treinados para prever com precisão sítios de ligação proteína-carboidrato ao nível de resíduo diretamente a partir de sequências primárias.

Nafi, M. M. I., Nawar, Q. F., Islam, T. N., Rahman, M. S.2026-02-05
💻 bioinformatics

Uncovering novel therapeutics for schizophrenia: a multitarget approach using the CANDO platform

Este estudo demonstra que a abordagem de reposicionamento de fármacos multialvo da plataforma CANDO identifica e valida com sucesso novos candidatos terapêuticos para a esquizofrenia ao analisar assinaturas de interação composto-proteoma, revelando tanto mecanismos estabelecidos quanto novos mecanismos potenciais envolvendo sistemas de neurotransmissores e vias de sinalização de cálcio.

Hu, Y., Samudrala, R., Falls, Z.2026-02-05
💻 bioinformatics

A deep-learning-based score to evaluate multiple sequence alignments

Este artigo demonstra que a amplamente utilizada pontuação de soma de pares frequentemente falha em identificar os alinhamentos de múltiplas sequências mais precisos e propõe uma estrutura de pontuação baseada em aprendizado profundo, especificamente o Modelo 2, que classifica efetivamente alinhamentos alternativos para melhorar a reconstrução filogenética subsequente.

Serok, N., Polonsky, K., Ashkenazy, H., Mayrose, I., Thorne, J. L., Pupko, T.2026-02-05
💻 bioinformatics

LongPolyASE: An end-to-end framework for allele-specific gene and isoform analysis in polyploids using long-read RNA-seq

O LongPolyASE é uma estrutura abrangente de ponta a ponta projetada para permitir a análise de genes e isoformas específicos de alelos em poliploides usando dados de RNA-seq de leitura longa, abordando a atual falta de ferramentas especializadas para esses organismos por meio de seus componentes integrados para identificação de genes sintênicos, quantificação de transcritos e análise de expressão diferencial.

Nolte, N. F., Gruden, K., Petek, M.2026-02-05
💻 bioinformatics

Common Pitfalls in CircRNA Detection and Quantification

Este estudo demonstra que dados de RNA-seq enriquecidos em poli(A) são inadequados para a detecção confiável de circRNA devido às altas taxas de falsos positivos e à discordância entre as ferramentas, estabelecendo que o sequenciamento de RNA total com depleção eficaz de RNA ribossômico é o padrão necessário para o perfilamento preciso de circRNA.

Weyrich, M., Trummer, N., Boehm, F., Furth, P. A., Hoffmann, M., List, M.2026-02-04
💻 bioinformatics

RareCapsNet: An explainable capsule networks enable robust discovery of rare cell populations from large-scale single-cell transcriptomics

O RareCapsNet é um framework de rede de cápsulas explicável que identifica robustamente populações de células raras e suas assinaturas transcriptômicas em dados de RNA-seq de célula única em larga escala, superando métodos de última geração ao mesmo tempo em que permite a transferência de conhecimento entre diferentes lotes experimentais.

Ray, S., Lall, S.2026-02-04
💻 bioinformatics

GCP-VQVAE: A Geometry-Complete Language for Protein 3D Structure

O artigo apresenta o GCP-VQVAE, um tokenizador geometricamente completo e SE(3)-equivariante que converte esqueletos de proteínas em um vocabulário discreto de 4.096 tokens enquanto preserva a quiralidade e a orientação, alcançando precisão de reconstrução de estado da arte, generalização zero-shot robusta e velocidades de inferência significativamente mais rápidas em comparação com métodos anteriores.

Pourmirzaei, M., Morehead, A., Esmaili, F., Ren, J., Pourmirzaei, M., Xu, D.2026-02-03
💻 bioinformatics

A modality gap in personal-genome prediction by sequence-to-function models

Este estudo revela que, embora o modelo AlphaGenome preveja eficazmente a variação da acessibilidade da cromatina ao capturar a gramática regulatória local, ele apresenta um desempenho significativamente inferior na previsão da variação da expressão gênica devido ao desafio de modelar a integração regulatória de longo alcance necessária para as diferenças interindividuais.

Mostafavi, S., Tu, X., Spiro, A., Chikina, M.2026-02-03