La bioinformatique se situe à la croisée fascinante de la biologie et de l'informatique, où des données biologiques complexes sont transformées en connaissances actionnables grâce à des algorithmes puissants. Ce domaine permet aux chercheurs de décrypter le code de la vie, d'analyser des séquences génétiques massives et de modéliser des interactions moléculaires avec une précision inédite, accélérant ainsi les découvertes médicales et biologiques.

Sur Gist.Science, nous nous engageons à rendre ces travaux accessibles à tous. Chaque nouvelle prépublication soumise sur bioRxiv dans cette catégorie est traitée par nos soins, offrant à la fois un résumé technique détaillé pour les experts et une explication claire en langage courant pour le grand public.

Vous trouverez ci-dessous la sélection des dernières études parues dans ce domaine, prêtes à être explorées.

💻 bioinformatics

DDI_single: Single-Sequence-Based Protein Domain Assembly

DDI_single est un nouvel algorithme basé sur une séquence unique qui exploite le modèle de langage protéique ESM-1b et un module d'attention croisée à porte pour prédire avec précision les interactions entre résidus inter-domaines, atteignant ainsi une précision supérieure dans l'assemblage de structures de protéines multi-domaines par rapport aux méthodes existantes telles que trRosettaX_single.

Shengyi, Z.2026-06-08
💻 bioinformatics

From topography to connectome: Towards an integrated understanding of the resting brain

Cette étude introduit un modèle d'apprentissage profond qui traduit avec succès les cartes de topographie cérébrale individualisées en connectomes fonctionnels, établissant ainsi un lien direct entre l'organisation spatiale et la connectivité de réseau afin d'unifier les diverses perspectives de la recherche en rsfMRI.

Naranjo Rincon, S., Ahmad, F., Easley, T., Shoushtari, S., Glatard, T., Kiar, G., Modi, H., Dahan, S., Robinson, E., Kam (…)2026-06-08
💻 bioinformatics

TRACEY: an updated resource for SNARE protein domain annotation with improved HMMs and expanded sequence coverage

Le document présente une version mise à jour de la ressource TRACEY qui améliore significativement l'annotation des domaines protéiques SNARE en incorporant un ensemble de données non redondantes considérablement élargi de près de 19 000 séquences curées afin de générer des profils HMM améliorés et une interface web redessinée pour une détection plus précise des paralogues divergents et spécifiques à une lignée.

Pulido-Quetglas, C., Fasshauer, D.2026-06-08
💻 bioinformatics

Fasting Status and Epigenetic Clock Stability: Implications for Aging Research

Cette étude démontre que le jeûne aigu induit de faibles décalages systématiques dans des horloges épigénétiques spécifiques — particulièrement les variantes basées sur les composantes principales (PC) et SystemsAge — sous l'effet de la redistribution des cellules immunitaires, alors que les horloges entraînées sur la mortalité restent stables, soulignant que la fiabilité des horloges est dépendante du contexte et nécessite une évaluation spécifique à la perturbation au-delà des mesures standard du CCI.

Seale, K. B., Dwaraka, V. B., Giosan, I., Mendez, T., Smith, R.2026-06-07
💻 bioinformatics

CLASPP: A unified model for predicting post-translational modifications

L'article présente CLASPP, un modèle unifié pour prédire diverses modifications post-traductionnelles qui surmonte les défis de déséquilibre des données grâce à l'apprentissage contrastif, à une curation de données hiérarchique et à une stratégie d'entraînement multi-étapes afin d'améliorer la précision de la prédiction à travers divers organismes.

Gravel, N., Zhou, Z., Fang, R., Soleymani, S., Kannan, N.2026-06-07
💻 bioinformatics

BacteReason: A Reasoning Model for Antimicrobial Resistance Prediction

BacteReason est un grand modèle de langage affiné qui prédit la sensibilité des bactéries aux antibiotiques et fournit des justifications mécanistes en exploitant un modèle enseignant fondé sur les connaissances, ce qui se traduit par une amélioration significative de la précision de la prédiction par rapport aux approches de base.

Oikawa, Y., Kawashima, S., Kinjo, A. R., Demizu, Y., Tamura, R., Tsuda, K.2026-06-07
💻 bioinformatics

GLOF: A large-scale expert-curated benchmark dataset of gain-of-function and loss-of-function missense variants

L'article présente GLOF, un ensemble de données de référence à grande échelle, expertisé, comprenant plus de 112 000 variants faux-sens à travers près de 3 000 gènes humains, qui classifie les variants comme gain de fonction, perte de fonction ou neutres afin de faciliter le développement et l'évaluation de méthodes computationnelles pour prédire les mécanismes des variants.

Maricato, V., Schlesinger, D., de Souza Moura, P. N.2026-06-07
💻 bioinformatics

VelocityFM: Short-Horizon Protein Trajectory Prediction via Flow Matching in Velocity Space

VelocityFM est un nouveau prédicteur de trajectoires protéiques à horizon court qui utilise le flux rectifié (rectified flow matching) dans l'espace des vitesses pour générer des conformations dynamiques géométriquement valides, sans encombrement et préservant le repliement pour des protéines inédites, atteignant une grande précision structurelle avec un TM-score médian de 0,929.

Jayathilake, L., Wijesinghe, C. R., Weerasinghe, R.2026-06-07
💻 bioinformatics

A Web-based software toolkit for accessible and best-practice machine learning analyses in biomedical research

L'article présente GLEAM, un ensemble d'outils logiciels en ligne, sans code, construit sur l'environnement Galaxy, qui permet aux chercheurs en biomédecine de réaliser des analyses d'apprentissage automatique supervisé rigoureuses, reproductibles et accessibles sur divers types de données tout en respectant les meilleures pratiques.

Morais Lyra Junior, P. C., Qiu, J., Van Dang, K., Pybus, A., Narvaez-Bandera, I., Singh, M. A., Gu, Q., Sargent, L., Cre (…)2026-06-07
💻 bioinformatics

Using protein language models for pangenome construction

Cet article présente une méthode de construction de pangénome scalable et accélérée par GPU qui exploite les plongements de modèles de langage protéiques et un partitionnement avancé pour surpasser les outils existants tels que SCARAP dans la génération de clusters protéiques fonctionnellement cohérents et spécifiques, particulièrement sur des ensembles de données validés expérimentalement.

Larsen, N. J., Charusanti, P., Webel, H., Ohl, L., Blin, K., Frellsen, J.2026-06-06