La bioinformatique se situe à la croisée fascinante de la biologie et de l'informatique, où des données biologiques complexes sont transformées en connaissances actionnables grâce à des algorithmes puissants. Ce domaine permet aux chercheurs de décrypter le code de la vie, d'analyser des séquences génétiques massives et de modéliser des interactions moléculaires avec une précision inédite, accélérant ainsi les découvertes médicales et biologiques.

Sur Gist.Science, nous nous engageons à rendre ces travaux accessibles à tous. Chaque nouvelle prépublication soumise sur bioRxiv dans cette catégorie est traitée par nos soins, offrant à la fois un résumé technique détaillé pour les experts et une explication claire en langage courant pour le grand public.

Vous trouverez ci-dessous la sélection des dernières études parues dans ce domaine, prêtes à être explorées.

💻 bioinformatics

A geometric atlas of how ESM3 organizes modalities across depth

Cette étude révèle que dans le modèle de langage protéique multimodal ESM3, les différentes modalités physiques (séquence, structure, structure secondaire et accessibilité au solvant) occupent initialement des sous-espaces distincts avant de fusionner en une représentation partagée de faible dimension entre les couches 25 et 35, tandis que les annotations fonctionnelles restent orthogonales tout au long du processus, cette fusion étant une propriété universelle apprise, indépendante de la longueur de la protéine mais retardée par le désordre structurel.

Steenwyk, J. L.2026-07-12
💻 bioinformatics

ProtBLIP2-SST: Protein Function Prediction via BLIP2 with Sequence, Structure, and Text

ProtBLIP2-SST est un nouveau cadre à deux étapes qui intègre l'information de séquence protéique et de structure 3D via un modèle de langage sensible à la structure et un projecteur Q-Former pour permettre aux grands modèles de langage de générer des légendes fonctionnelles flexibles et ouvertes, surmontant ainsi les limites de la classification traditionnelle rigide de l'ontologie des gènes.

Chen, Z., Luo, Q.2026-07-12
💻 bioinformatics

EcoMorph: Universal morphological trait quantification from natural language prompts for ecological research

EcoMorph est un système modulaire qui exploite le modèle Segment Anything Model 3 (SAM3) basé sur des invites pour quantifier avec précision les traits morphologiques tels que la surface, la taille et l'abondance à travers divers contextes écologiques sans nécessiter d'entraînement spécifique au taxon, permettant ainsi une recherche écologique à haut débit à partir de sources d'images hétérogènes.

Amoah, E. I., Bunch, Z., Thomas, H. M., Patch, H. M., Grozinger, C.2026-07-12
💻 bioinformatics

Tokenizing single-cell transcriptomes as a native language for large language models

L'article présente CellTok, une nouvelle approche qui discrétise les profils transcriptomiques cellulaires continus en séquences discrètes compatibles avec les grands modèles de langage préentraînés, permettant ainsi un cadre unifié pour traiter conjointement les données cellulaires, le contexte biologique et les instructions textuelles afin d'accomplir diverses tâches telles que l'identification de cellules, l'inférence de maladies et la génération d'états.

Xiao, C., Ding, Y., Bian, H., Chen, Y., Wei, L., Zhang, X.2026-07-11
💻 bioinformatics

scDiagnostics: systematic assessment of cell type annotation in single-cell transcriptomics data

L'article présente scDiagnostics, un package R open-source conçu pour détecter systématiquement les annotations de types cellulaires complexes ou trompeuses dans les données de transcriptomique en cellule unique, comblant ainsi une lacune critique dans les flux de travail d'analyse actuels en garantissant la fiabilité des interprétations en aval.

Christidis, A., Ghazi, A. R., Chawla, S., Turaga, N., Gentleman, R., Geistlinger, L.2026-07-11
💻 bioinformatics

onsite: An Integrated Framework for Phosphosite Localization and False Localization Rate Estimation

Le document présente **onsite**, un framework Python open-source qui intègre une stratégie de leurre d'alanine afin de standardiser l'estimation du taux de faux localisations à travers plusieurs algorithmes de localisation de phosphosites, démontrant une scalabilité et une précision supérieures sur des jeux de données de spectrométrie de masse à grande échelle.

Yue, Q.-X., Wei, Z., Dai, C., Bai, M., Perez-Riverol, Y., Sachsenberg, T.2026-07-11
💻 bioinformatics

PKProbDesign: RNA inverse folding including pseudoknots by optimizing thermodynamic folding probability

PKProbDesign est un nouveau cadre d'échantillonnage qui aborde le défi du repliement inverse de l'ARN pour les structures à pseudonoeuds en optimisant directement les probabilités de repliement thermodynamique par la décomposition de l'échafaudage et l'évaluation d'ensembles conditionnels, surpassant les méthodes existantes telles que DesiRNA et MODENA sur des cibles de référence.

Otagaki, T., Iwakiri, J., terai, g., Asai, K., Sato, K.2026-07-11
💻 bioinformatics

Spatial mitochondrial lineage tracing uncovers a premetastatic niche and microenvironment programmed fate switching in osteosarcoma

En intégrant la transcriptomique de cellule unique et spatiale au traçage de lignée basé sur les variants mitochondriaux, cette étude révèle que la progression de l'ostéosarcome implique une cascade transcriptionnelle par étapes, allant des progéniteurs COL3A1 aux cellules métastatiques THY1, un changement de destin strictement autorisé par la co-localisation spatiale avec des endothéliums PLVAP dysfonctionnels pour former une niche prémétastatique enrichie en PTN/NOTCH, établissant ainsi un cadre « temps-espace-lignée » où les signaux microenvironnementaux pilotent un engagement clonal irréversible.

Xue, Y., Su, Z., Su, J., Chu, A. S., Wan, L., Chen, M., Cheung, J. P. Y., Cheung, K. S. C., Ho, J. W. K.2026-07-11
💻 bioinformatics

ProtAug: An Empirical Investigation of pLM-Guided Data Augmentation for Protein Sequence Prediction Tasks

Cet article présente ProtAug, un cadre d'augmentation de données de séquences protéiques guidé par les pLM, qui démontre systématiquement comment des niveaux de variation contrôlés par l'utilisateur peuvent améliorer de manière constante les performances de prédiction en aval à travers diverses tâches, révélant que si la préservation de la plausibilité biologique est bénéfique à des niveaux de variation faibles à modérés, l'augmentation à haute variation peut également générer des gains grâce à des effets de régularisation.

Chen, Z., Wang, R., Luo, Q.2026-07-11
💻 bioinformatics

High resolution Streptococcus pyogenes core genome MLST and LIN coding scheme for outbreak detection

Cet article présente un nouveau schéma de codage MLST et LIN du génome central pour *Streptococcus pyogenes*, évolutif, accessible mondialement et hébergé par PubMLST, afin d'améliorer la détection des épidémies et de faciliter la collaboration internationale dans le suivi des variants génétiques.

Ryan, Y., Jolley, K. A., Hearn, H., Parfitt, K. M., Platt, S., Lamagni, T., Moganeradj, K.2026-07-11