La bioinformatique se situe à la croisée fascinante de la biologie et de l'informatique, où des données biologiques complexes sont transformées en connaissances actionnables grâce à des algorithmes puissants. Ce domaine permet aux chercheurs de décrypter le code de la vie, d'analyser des séquences génétiques massives et de modéliser des interactions moléculaires avec une précision inédite, accélérant ainsi les découvertes médicales et biologiques.

Sur Gist.Science, nous nous engageons à rendre ces travaux accessibles à tous. Chaque nouvelle prépublication soumise sur bioRxiv dans cette catégorie est traitée par nos soins, offrant à la fois un résumé technique détaillé pour les experts et une explication claire en langage courant pour le grand public.

Vous trouverez ci-dessous la sélection des dernières études parues dans ce domaine, prêtes à être explorées.

💻 bioinformatics

SSUplex: fast, both-strand extraction and origin-sorting of small-subunit rRNA for environmental DNA metabarcoding

SSUplex est un outil Rust open-source et rapide qui détecte, extrait et trie par origine les lectures d'ARNr de la petite sous-unité de pleine longueur à partir des deux brins d'ADN en cinq catégories (bactéries, archées, eukaryota, mitochondries et chloroplastes), offrant une alternative haute vitesse et efficace en mémoire à Metaxa2 pour les flux de travail de métabarcodage de l'ADN environnemental.

O'Brien, A., Vargas, J., Acuna, I., Restovic, F., Martinez, P., Parada, P.2026-07-13
💻 bioinformatics

TEDlm: domain-centric protein language models with optional structural pre-training

L'article présente TEDlm, un modèle de langage protéique centré sur les domaines et préentraîné sur des segments de domaines définis structurellement, qui surpasse les modèles de séquences complètes plus larges dans la détection d'homologie lointaine et la prédiction de la fonction moléculaire, démontrant que la focalisation sur les signaux intrinsèques aux domaines produit des représentations compactes et informées sur la structure.

Wei, T., Kandathil, S. M., Buchan, D. W. A., Jones, D. T.2026-07-13
💻 bioinformatics

amR: an R package suite to predict antimicrobial resistance in bacterial pathogens

La suite de packages amR offre un cadre complet et interprétable pour prédire la résistance aux antimicrobiens chez les agents pathogènes bactériens en intégrant l'extraction de caractéristiques génomiques multi-échelles, l'entraînement de modèles d'apprentissage automatique et la visualisation interactive afin de découvrir les mécanismes de résistance multi-résistance et inter-espèces.

Ghosh, A., Brenner, E. P., Boyer, E. A., McKim, A. P., Vang, C. K., Wolfe, E. P., Mayer, D. A., Lesiyon, R. L., Ravi, J.2026-07-13
💻 bioinformatics

Capabilities, specificity gaps and training-data dependence of AlphaFold3 across diverse application areas

Cet article évalue les performances d'AlphaFold3 à travers diverses applications biomoléculaires, concluant que bien qu'il offre de puissantes capacités de modélisation de tous les atomes, sa précision et sa fiabilité sont inégales et fortement dépendantes du chevauchement des ensembles d'entraînement, nécessitant une interprétation prudente par rapport à son prédécesseur.

Follonier, O., Liu, Y., Campomanes, P., Lafrenaye, L., Racle, J., Alvarez, D., van Gerwen, J., Heinzmann, R., Jänes, J. (…)2026-07-13
💻 bioinformatics

Genomic Annotation Infrastructure (GAIn): Pipelines and Resource Repositories for Annotating Variants, Positions, and Regions

L'infrastructure d'annotation génomique (GAIn) est une plateforme qui permet une annotation des variants génomiques transparente, reproductible et évolutive grâce à des pipelines déclaratifs, des répertoires de ressources publiques et des interfaces web et en ligne de commande flexibles qui supportent les extensions personnalisées et la ré-annotation automatisée.

Cokol, M., Chorbadjiev, L., Lee, Y.-h., Jamsandekar, M., Gergova, I., Todorov, I., Iossifov, I.2026-07-12
💻 bioinformatics

A geometric atlas of how ESM3 organizes modalities across depth

Cette étude révèle que dans le modèle de langage protéique multimodal ESM3, les différentes modalités physiques (séquence, structure, structure secondaire et accessibilité au solvant) occupent initialement des sous-espaces distincts avant de fusionner en une représentation partagée de faible dimension entre les couches 25 et 35, tandis que les annotations fonctionnelles restent orthogonales tout au long du processus, cette fusion étant une propriété universelle apprise, indépendante de la longueur de la protéine mais retardée par le désordre structurel.

Steenwyk, J. L.2026-07-12
💻 bioinformatics

ProtBLIP2-SST: Protein Function Prediction via BLIP2 with Sequence, Structure, and Text

ProtBLIP2-SST est un nouveau cadre à deux étapes qui intègre l'information de séquence protéique et de structure 3D via un modèle de langage sensible à la structure et un projecteur Q-Former pour permettre aux grands modèles de langage de générer des légendes fonctionnelles flexibles et ouvertes, surmontant ainsi les limites de la classification traditionnelle rigide de l'ontologie des gènes.

Chen, Z., Luo, Q.2026-07-12
💻 bioinformatics

EcoMorph: Universal morphological trait quantification from natural language prompts for ecological research

EcoMorph est un système modulaire qui exploite le modèle Segment Anything Model 3 (SAM3) basé sur des invites pour quantifier avec précision les traits morphologiques tels que la surface, la taille et l'abondance à travers divers contextes écologiques sans nécessiter d'entraînement spécifique au taxon, permettant ainsi une recherche écologique à haut débit à partir de sources d'images hétérogènes.

Amoah, E. I., Bunch, Z., Thomas, H. M., Patch, H. M., Grozinger, C.2026-07-12
💻 bioinformatics

Tokenizing single-cell transcriptomes as a native language for large language models

L'article présente CellTok, une nouvelle approche qui discrétise les profils transcriptomiques cellulaires continus en séquences discrètes compatibles avec les grands modèles de langage préentraînés, permettant ainsi un cadre unifié pour traiter conjointement les données cellulaires, le contexte biologique et les instructions textuelles afin d'accomplir diverses tâches telles que l'identification de cellules, l'inférence de maladies et la génération d'états.

Xiao, C., Ding, Y., Bian, H., Chen, Y., Wei, L., Zhang, X.2026-07-11
💻 bioinformatics

scDiagnostics: systematic assessment of cell type annotation in single-cell transcriptomics data

L'article présente scDiagnostics, un package R open-source conçu pour détecter systématiquement les annotations de types cellulaires complexes ou trompeuses dans les données de transcriptomique en cellule unique, comblant ainsi une lacune critique dans les flux de travail d'analyse actuels en garantissant la fiabilité des interprétations en aval.

Christidis, A., Ghazi, A. R., Chawla, S., Turaga, N., Gentleman, R., Geistlinger, L.2026-07-11