La bioinformatique se situe à la croisée fascinante de la biologie et de l'informatique, où des données biologiques complexes sont transformées en connaissances actionnables grâce à des algorithmes puissants. Ce domaine permet aux chercheurs de décrypter le code de la vie, d'analyser des séquences génétiques massives et de modéliser des interactions moléculaires avec une précision inédite, accélérant ainsi les découvertes médicales et biologiques.

Sur Gist.Science, nous nous engageons à rendre ces travaux accessibles à tous. Chaque nouvelle prépublication soumise sur bioRxiv dans cette catégorie est traitée par nos soins, offrant à la fois un résumé technique détaillé pour les experts et une explication claire en langage courant pour le grand public.

Vous trouverez ci-dessous la sélection des dernières études parues dans ce domaine, prêtes à être explorées.

💻 bioinformatics

Do Geometric Outliers Identify Important Genes in Single-Cell Foundation Models?

Bien que les modèles de fondation en cellule unique présentent certains motifs structurels partagés dans leurs plongements de gènes, tels que l'enrichissement ribosomal, les valeurs aberrantes géométriques sont largement spécifiques à chaque modèle et n'identifient pas de manière fiable des gènes biologiquement importants ou des cibles pertinentes pour les maladies.

Whalley, J. P.2026-08-03
💻 bioinformatics

RKMR: A Rapid Kernel Machine Regression Framework for Optimal Marker Detection in Spatial Omics Data

RKMR est un cadre évolutif et sensible à l'incertitude qui intègre la modélisation par noyau non linéaire, la sélection de variables de type « spike-and-slab » et la dépendance spatiale pour identifier des panels de marqueurs robustes et prédictifs à partir de données omiques spatiales de haute dimension, surpassant les méthodes existantes en termes d'exactitude et d'interprétabilité.

Seal, S., Chakraborty, A., Mattila, C., Rubinstein, M., Angel, P., Ghosh, D., Chung, D., Neelon, B.2026-08-03
💻 bioinformatics

PG-LLM: Benchmarking General-Purpose Language Models for Protein Variant Ranking

Le benchmark PG-LLM démontre que les modèles de langage à usage général, bien qu'ils n'aient pas accès aux données structurelles ou aux alignements de séquences multiples, peuvent classer efficacement les variants de protéines et surpasser de nombreux prédicteurs basés sur les séquences déjà établis, bien qu'ils restent en retrait par rapport aux outils biomoléculaires spécialisés.

Arora, R. K., Chen, L. T., Du, M., Marks, D., Church, G.2026-08-03
💻 bioinformatics

What limits local ancestry inference at low divergence: a feasibility threshold, a metric that conceals failure, and a deficit of input more than architecture

Cette étude révèle que l'inférence de l'ascendance locale à faible divergence génétique est fondamentalement contrainte par un seuil de faisabilité et par l'insuffisance des données de référence actuelles plutôt que par l'architecture du modèle, démontrant que les mesures de précision par site masquent de graves défaillances structurelles et que la fourniture d'informations haplotypiques plus riches génère des gains de performance plus importants que les innovations architecturales.

Tian, Q.2026-08-03
💻 bioinformatics

Discovery of a buried charge-network GFP-fold family spanning prokaryotes and eukaryotes (Draft manuscript)

Cette étude révèle une famille de protéines à repliement de type GFP, nouvellement découverte et évolutivement conservée, s'étendant des procaryotes aux eucaryotes, qui remplace le chromophore fluorescent canonique par un réseau de charges hautement contraint et enfoui composé de deux arginines, deux glutamates et d'une tyrosine, un motif également présent de manière convergente dans la famille non apparentée DUF2490.

Zimmer, M., Schneider, T. L.2026-08-02
💻 bioinformatics

MassGAT: a graph-based collective learning approach for untargeted detection and annotation of LC-MS data

MassGAT est une approche d'apprentissage collectif basée sur les graphes et en libre accès qui intègre la détection et l'annotation de pics pour les données LC-HRMS en modélisant les espèces ioniques sous forme de graphe et en utilisant un réseau d'attention sur graphes (Graph Attention Network) pour surpasser les pipelines de traitement indépendants existants.

Pinart, P.-H., Damont, A., Dechaumet, S., Thevenot, E.2026-08-02
💻 bioinformatics

Elucidating enzyme-substrate specificity through co-folding foundation model

L'article présente Boltz2ESI, un cadre de bout en bout qui exploite un modèle de fondation biomoléculaire pour prédire les interactions enzyme-substrat par co-repliement natif, capturant ainsi la plasticité du site actif et surpassant les méthodes existantes afin d'accélérer la découverte de biocatalyseurs et l'élucidation de voies métaboliques.

Cheng, X., Seo, S., Huh, C., Chen, J., Jiang, S., Guo, P., Weng, J.-K., Kim, W. Y., Jin, W.2026-08-02
💻 bioinformatics

DPCGS: a computational framework for linking GWAS to single-cell transcriptomics in complex traits and diseases

DPCGS est un nouveau cadre computationnel qui intègre les statistiques de résumé d'études d'association pangénomique (GWAS) avec des données de séquençage d'ARN en cellule unique pour parvenir à une cartographie de haute résolution du risque génétique vers des sous-populations cellulaires et des programmes de régulation spécifiques, démontrant une précision supérieure par rapport aux méthodes existantes et fournissant de nouvelles perspectives sur les mécanismes cellulaires de maladies complexes telles que la maladie d'Alzheimer et l'asthme.

Liu, C., Yuan, B., Shen, B., Li, J., Zhu, R., Yang, P., Wu, B., Xuan, Y., Yang, S., Yang, N., Ma, L., Liu, Q., Dai, S. (…)2026-07-31
💻 bioinformatics

AI4Life Open Calls and Public Challenges: why, how, and what we have learned.

À travers l'exécution de trois appels à projets (Open Calls) et trois défis publics entre 2023 et 2025, l'initiative AI4Life a soutenu 22 projets d'analyse d'images biologiques et a révélé que, si l'adoption de l'apprentissage profond conforme aux principes FAIR se heurte à des obstacles de mise en œuvre importants, le principal goulot d'étranglement pour l'IA scientifique en biologie ne réside pas dans le développement de méthodes, mais dans la disponibilité des données, des annotations et des infrastructures partagées.

Galinova, V., Seifi, M., Serrano Solano, B., Lidayova, K., Dalle Nogare, D., Corbat, A. A., Talks, J., Giacomello, E., G (…)2026-07-30