La bioinformatique se situe à la croisée fascinante de la biologie et de l'informatique, où des données biologiques complexes sont transformées en connaissances actionnables grâce à des algorithmes puissants. Ce domaine permet aux chercheurs de décrypter le code de la vie, d'analyser des séquences génétiques massives et de modéliser des interactions moléculaires avec une précision inédite, accélérant ainsi les découvertes médicales et biologiques.

Sur Gist.Science, nous nous engageons à rendre ces travaux accessibles à tous. Chaque nouvelle prépublication soumise sur bioRxiv dans cette catégorie est traitée par nos soins, offrant à la fois un résumé technique détaillé pour les experts et une explication claire en langage courant pour le grand public.

Vous trouverez ci-dessous la sélection des dernières études parues dans ce domaine, prêtes à être explorées.

💻 bioinformatics

THEOBROMA: an aggregated open database of 1.13 million natural products with per-compound license auditing, three-tier classification, and stereochemistry-aware deduplication

THEOBROMA est une base de données ouverte agrégeant plus de 1,13 million de produits naturels provenant de 29 sources qui se distingue par l'audit des licences par composé, un système de classification à trois niveaux et une déduplication sensible à la stéréochimie afin de permettre un criblage virtuel conforme aux licences et une analyse de la bioactivité spécifique aux isomères.

Klamt, T., Jaczkowski, A., Franke, J., Nejdl, W.2026-06-16
💻 bioinformatics

Rapid and consistent clustering of millions of genomes highlights the diversity of prokaryotic life

Les auteurs présentent gemsparcl, un outil hautement scalable et efficace qui regroupe plus de 5,6 millions de génomes bactériens en 92 954 unités génomiques cohérentes au niveau de l'espèce en environ 14 heures, surmontant ainsi les goulots d'étranglement computationnels pour permettre une analyse exhaustive et sans référence de la diversité et de la taxonomie procaryotes.

von Wachsmann, J. H., Lorenz, L. J., Gurbich, T. A., Russell, M. J., Rodriguez Bouza, V., Horsfield, S. T., Lees, J. A. (…)2026-06-15
💻 bioinformatics

Biological meaning in protein embedding space is resolution-dependent

Cette étude démontre que la signification biologique des plongements de modèles de langage de protéines n'est pas fixe mais dépend de la résolution, où différents niveaux d'alignement avec les hiérarchies biologiques préservent sélectivement des relations organisationnelles distinctes telles que les limites d'appartenance, les regroupements fonctionnels ou les structures de familles locales.

Zong, L., Ren, J., Li, Y., Finn, R. D., Wang, J.2026-06-15
💻 bioinformatics

WitChi: Efficient Detection and Pruning of Compositional Bias in Phylogenomic Alignments Using Empirical Chi-Squared Testing

WitChi est un outil efficace sur le plan computationnel qui utilise des tests de chi carré empiriques pour détecter et élaguer de manière itérative les sites compositionnellement biaisés dans les alignements phylogénomiques à grande échelle, restaurant ainsi des topologies phylogénétiques précises sans le coût de calcul élevé des modèles complexes sensibles à la composition.

Koestlbacher, S., Panagiotou, K., Tamarit, D., Ettema, T.2026-06-13
💻 bioinformatics

Testing the reliability of AI-generated protein structures

Cette étude démontre qu'AlphaFold2 et ColabFold présentent un taux de faux positifs très faible lors de la prédiction de structures pour des séquences non protéiques, tout en révélant de manière fortuite que certaines prédictions à score élevé dans des régions génomiques humaines non codantes correspondent à des pseudogènes auparavant non annotés, suggérant d'éventuelles erreurs dans les annotations géniques existantes et validant l'utilité des prédictions structurales à score élevé pour des investigations plus approfondies.

Xu, A., Salzberg, S.2026-06-13
💻 bioinformatics

ADMETron: An AI-driven SaaS platform for comprehensive ADMET prediction and compound prioritisation

ADMETron est une plateforme SaaS pilotée par l'IA qui intègre des plongements moléculaires dérivés de réseaux de neurones récurrents (RNN) avec des machines à boosting de gradient pour prédire 34 points de terminaison ADMET et propose un outil de visualisation par graphique radar interactif, permettant une hiérarchisation complète et à haut débit des composés ainsi qu'une prise de décision fondée sur les données dans la découverte de médicaments.

Nair, D. N., Yadav, R. S., Jondhale, P. M., Didhate, S., Gunjal, G., Ranjit, A., Patil, P., Dawande, A., Shisode, A., Bh (…)2026-06-13
💻 bioinformatics

Revealing trajectories of multi-modal voxel-level changes in neurodegenerative diseases using latent event mapping

Cet article présente le Latent Event Mapping (LEMING), une technique de modélisation non supervisée, scalable et interprétable, qui reconstruit les trajectoires au niveau du voxel des changements neuroimagerie multimodaux dans la maladie d'Alzheimer, révélant de nouvelles perspectives sur les mécanismes dépendants de la progression, tels que l'association tardive entre la densité des récepteurs de l'acétylcholine et la pathologie amyloïde.

Pinnawala, S., Hartanto, A., Jairamani, M., Simpson, I. J. A., Wijeratne, P. A.2026-06-11
💻 bioinformatics

STITCH links cellular morphology and gene expression in spatial transcriptomics

L'article présente STITCH, une méthode interprétable basée sur l'analyse en composantes principales tangentielle dans une variété de forme de Kendall qui lie efficacement la morphologie cellulaire indépendante de la taille à l'expression génique en transcriptomique spatiale, surpassant les approches existantes d'apprentissage profond pour identifier les relations morphologie-transcriptome biologiquement pertinentes à travers divers ensembles de données.

Kumar, S., Shi, Y., Vallius, T., Day, C.-P., Absil, P.- A., Srivastava, A., Hannenhalli, S., Gopalan, V.2026-06-11
💻 bioinformatics

Calibrated Uncertainty Quantification for Patient-Level AML Drug Sensitivity Prediction Using Split Conformal Prediction

Cette étude introduit un cadre de prédiction conforme par division appliqué à la cohorte BeatAML 2.0 qui génère avec succès des intervalles d'incertitude statistiquement calibrés pour les prédictions de sensibilité aux médicaments de la leucémie aiguë myéloïde (LAM) au niveau du patient, révélant des modèles d'incertitude distincts selon les classes de médicaments tout en démontrant que cette incertitude est indépendante des classifications de risque moléculaire standard.

Shokrzadeh, A. J., Shokrzadeh, P.2026-06-11