La bioinformatique se situe à la croisée fascinante de la biologie et de l'informatique, où des données biologiques complexes sont transformées en connaissances actionnables grâce à des algorithmes puissants. Ce domaine permet aux chercheurs de décrypter le code de la vie, d'analyser des séquences génétiques massives et de modéliser des interactions moléculaires avec une précision inédite, accélérant ainsi les découvertes médicales et biologiques.

Sur Gist.Science, nous nous engageons à rendre ces travaux accessibles à tous. Chaque nouvelle prépublication soumise sur bioRxiv dans cette catégorie est traitée par nos soins, offrant à la fois un résumé technique détaillé pour les experts et une explication claire en langage courant pour le grand public.

Vous trouverez ci-dessous la sélection des dernières études parues dans ce domaine, prêtes à être explorées.

💻 bioinformatics

Children's DNA Methylation and Family Dynamics in a Congo Basin Subsistence Community: Links with Parental Conflict and Fathers' Caregiving

Cette étude démontre que, dans une communauté de subsistance du bassin du Congo, les profils de méthylation de l'ADN des enfants sont significativement associés aux conflits parentaux et aux soins prodigués par le père, liant ces dynamiques familiales à des gènes impliqués dans le stress, l'immunité et le développement, suggérant ainsi que l'incorporation biologique des environnements familiaux est un phénomène universel à travers divers contextes socio-écologiques.

Chan, M. H.-M., Merrill, S. S., Zhuang, B. C., Lin, D. T. S., Macisaac, J. L., Miegakanda, V., Lew-Levy, S., Boyette, A. (…)2026-06-19
💻 bioinformatics

Predicting optimal growth temperatures of bacteria using learned structural information from a single protein

L'article présente ROSEATE, un nouveau cadre qui prédit avec précision les températures de croissance optimales des bactéries en exploitant des signatures structurelles dérivées de l'MSA Transformer à partir d'une protéine ubiquitaire unique, l'adénylate kinase, permettant ainsi une inférence thermique robuste, phylogénétiquement généralisable et à l'échelle de la communauté à travers divers environnements.

Hoffert, M., Myerscough, D., Dragone, N. B., Gebert, M. J., Silberg, J. J., Fierer, N.2026-06-18
💻 bioinformatics

MetaHarmonizer: robust biomedical metadata harmonization and a contamination control for inflated LLM performance on public benchmarks

MetaHarmonizer est un système automatisé robuste, entièrement local et déterministe pour l'harmonisation des métadonnées biomédicales qui combine une cascade multi-étapes avec des vocabulaires contrôlés afin de prévenir les hallucinations et la performance gonflée des benchmarks, atteignant une précision de pointe dans le mappage de schémas et d'ontologies tout en permettant un triage rigoureux avec intervention humaine.

Li, C., Dahl, A., Gravel-Pucillo, K. D., Long, K., Waters, M., de Bruijin, I., Davis, S., Oh, S.2026-06-17
💻 bioinformatics

VLab4Mic: prediction of structural resolvability in super-resolution microscopy

VLab4Mic est une plateforme de simulation qui prédit la résolution structurelle des assemblages protéiques à travers diverses modalités de microscopie de super-résolution en modélisant le placement des sondes et les contraintes stériques, permettant ainsi aux chercheurs d'évaluer la faisabilité expérimentale avant de mener des expériences physiques.

Martinez, D., Saraiva, B. M., Shakespeare, T., Bates, M., Owen, D. M., Leterrier, C., Del Rosario, M., Henriques, R.2026-06-16
💻 bioinformatics

THEOBROMA: an aggregated open database of 1.13 million natural products with per-compound license auditing, three-tier classification, and stereochemistry-aware deduplication

THEOBROMA est une base de données ouverte agrégeant plus de 1,13 million de produits naturels provenant de 29 sources qui se distingue par l'audit des licences par composé, un système de classification à trois niveaux et une déduplication sensible à la stéréochimie afin de permettre un criblage virtuel conforme aux licences et une analyse de la bioactivité spécifique aux isomères.

Klamt, T., Jaczkowski, A., Franke, J., Nejdl, W.2026-06-16
💻 bioinformatics

Rapid and consistent clustering of millions of genomes highlights the diversity of prokaryotic life

Les auteurs présentent gemsparcl, un outil hautement scalable et efficace qui regroupe plus de 5,6 millions de génomes bactériens en 92 954 unités génomiques cohérentes au niveau de l'espèce en environ 14 heures, surmontant ainsi les goulots d'étranglement computationnels pour permettre une analyse exhaustive et sans référence de la diversité et de la taxonomie procaryotes.

von Wachsmann, J. H., Lorenz, L. J., Gurbich, T. A., Russell, M. J., Rodriguez Bouza, V., Horsfield, S. T., Lees, J. A. (…)2026-06-15
💻 bioinformatics

Biological meaning in protein embedding space is resolution-dependent

Cette étude démontre que la signification biologique des plongements de modèles de langage de protéines n'est pas fixe mais dépend de la résolution, où différents niveaux d'alignement avec les hiérarchies biologiques préservent sélectivement des relations organisationnelles distinctes telles que les limites d'appartenance, les regroupements fonctionnels ou les structures de familles locales.

Zong, L., Ren, J., Li, Y., Finn, R. D., Wang, J.2026-06-15
💻 bioinformatics

WitChi: Efficient Detection and Pruning of Compositional Bias in Phylogenomic Alignments Using Empirical Chi-Squared Testing

WitChi est un outil efficace sur le plan computationnel qui utilise des tests de chi carré empiriques pour détecter et élaguer de manière itérative les sites compositionnellement biaisés dans les alignements phylogénomiques à grande échelle, restaurant ainsi des topologies phylogénétiques précises sans le coût de calcul élevé des modèles complexes sensibles à la composition.

Koestlbacher, S., Panagiotou, K., Tamarit, D., Ettema, T.2026-06-13
💻 bioinformatics

Testing the reliability of AI-generated protein structures

Cette étude démontre qu'AlphaFold2 et ColabFold présentent un taux de faux positifs très faible lors de la prédiction de structures pour des séquences non protéiques, tout en révélant de manière fortuite que certaines prédictions à score élevé dans des régions génomiques humaines non codantes correspondent à des pseudogènes auparavant non annotés, suggérant d'éventuelles erreurs dans les annotations géniques existantes et validant l'utilité des prédictions structurales à score élevé pour des investigations plus approfondies.

Xu, A., Salzberg, S.2026-06-13