La bioinformatique se situe à la croisée fascinante de la biologie et de l'informatique, où des données biologiques complexes sont transformées en connaissances actionnables grâce à des algorithmes puissants. Ce domaine permet aux chercheurs de décrypter le code de la vie, d'analyser des séquences génétiques massives et de modéliser des interactions moléculaires avec une précision inédite, accélérant ainsi les découvertes médicales et biologiques.

Sur Gist.Science, nous nous engageons à rendre ces travaux accessibles à tous. Chaque nouvelle prépublication soumise sur bioRxiv dans cette catégorie est traitée par nos soins, offrant à la fois un résumé technique détaillé pour les experts et une explication claire en langage courant pour le grand public.

Vous trouverez ci-dessous la sélection des dernières études parues dans ce domaine, prêtes à être explorées.

💻 bioinformatics

Robust semi-supervised scRNA-seq integration from virtual adversarial learning

L'article présente scCRAFT+, un modèle d'intégration de scRNA-seq semi-supervisé et robuste qui exploite l'entraînement adversaire virtuel pour incorporer les informations sur les gènes marqueurs, surmontant ainsi les limites des méthodes existantes en préservant les distinctions fines entre les sous-types cellulaires et en améliorant la précision de l'annotation, même avec des ensembles de marqueurs bruités ou incomplets.

He, C., Filippidis, P., Xing, J., Kleinstein, S., Guan, L.2026-06-11
💻 bioinformatics

Pillbox: A Leakage-Aware Foundation-Model Predictor and Lineage-Ceiling Diagnostic for Cancer Drug Response

Pillbox est un prédicteur de modèle de fondation audité contre les fuites qui intègre CpGPT, CLAMP et des plongements d'expression génique via une attention de graphe conditionnée par FiLM afin d'atteindre une grande précision dans la prédiction de la réponse aux médicaments anticancéreux, tout en utilisant une corrélation résiduelle inter-architecture pour diagnostiquer la saturation de l'empilement de caractéristiques et confirmer que la lignée tissulaire demeure le facteur dominant de la réponse aux médicaments.

Hill, J. J. K., Ryoo, H. J., Ghanta, A., Singh, S., Anders, D., Jiao, E., Jeong, J.2026-06-11
💻 bioinformatics

GermRL: Alleviating The Germline Bias In Autoregressive Antibody Language Models Through Reinforcement Learning

Cet article introduit GermRL, un cadre d'apprentissage par renforcement léger qui atténue efficacement le biais de la lignée germinale dans les modèles de langage d'anticorps autorégressifs, permettant la génération en une seule étape de candidats anticorps structurellement plausibles et diversifiés avec des seuils de mutation élevés à partir de séquences germinales pour la découverte thérapeutique.

Ludwig, L., Chungyoun, M., Gray, J. J.2026-06-11
💻 bioinformatics

DivQuant: Estimation of Species Richness and Entropy from Small Samples

DivQuant est un outil basé sur l'optimisation qui améliore l'estimation de la richesse spécifique et de l'entropie de Shannon à partir de petits échantillons en formulant le problème comme un programme quadratique convexe avec un objectif de Neyman χ2\chi^2, parvenant ainsi à des intervalles de confiance bien calibrés et à une précision supérieure par rapport aux méthodes de pointe à travers divers ensembles de données biologiques.

Schmitz, J. E., Rahmann, S.2026-06-11
💻 bioinformatics

An AI-Powered Trisomy 21 Research Assistant

Le T21 Research Assistant est un système de génération augmentée par récupération sensible aux sections, construit sur les modèles NVIDIA Nemotron, qui donne la priorité aux résultats expérimentaux de 1 789 publications en libre accès sur la trisomie 21 afin de fournir des réponses rigoureusement citées et fondées sur des preuves aux requêtes de recherche.

NANDI, S., Sundararajan, Z., Subirana-Granes, M., Espinosa, J. M., Pividori, M., Sullivan, K. D., Galbraith, M. D., Cost (…)2026-06-11
💻 bioinformatics

EditorForge: An Active-Site-Aware Framework for Inverse-Folding-Based Protein Redesign

EditorForge est un cadre modulaire qui améliore la conception de protéines par repliement inverse en intégrant des masques de conception explicites, un blindage du site actif et un contrôle de la qualité structurelle afin de générer en toute sécurité des candidats de séquences contraints et à haute confiance pour les domaines enzymatiques et les éditeurs de génome.

Chen, A., Siddiqui, J., Taucar, W., Tiralongo, L., Tkachenko, M., Xu, A., Bawa, S., Guo, S., Pinska, O., Rim, J., Shi, J (…)2026-06-11
💻 bioinformatics

OMIO: A policy-driven Python library for reproducible microscopy image I/O

OMIO est une bibliothèque Python légère et open-source qui garantit la reproductibilité de l'analyse d'images de microscopie en séparant la lecture de fichiers de bas niveau d'une couche centralisée, pilotée par des politiques, qui impose des conventions d'axes canoniques et une normalisation robuste des métadonnées à travers des formats de fichiers hétérogènes.

Musacchio, F., Antony, H., Crux, S., Fuhrmann, F., Gockel, N., Hoffmann, D. M., Mercan, D., Nebeling, F. C., Fuhrmann, M (…)2026-06-11
💻 bioinformatics

Depth normalization for single-cell genomics count data

L'article propose et valide une méthode de normalisation unique appelée PFlogPF, qui combine l'ajustement proportionnel additif et multiplicatif avec une transformation logarithmique pour stabiliser efficacement la variance, tenir compte de la profondeur de séquençage et préserver la monotonicité de l'abondance des caractéristiques dans les données de génomique en cellule unique.

Booeshaghi, A. S., Hallgrimsdottir, I. B., Galvez-Merchan, A., Pachter, L.2026-06-10
💻 bioinformatics

Bias-mitigated microbiome inference refines coronary artery disease signature

L'article présente BootDA, une méthode de bootstrap non paramétrique qui corrige simultanément quatre sources majeures de biais dans les données de microbiote sans recourir à des transformations ou à des pseudocomptes, atteignant ainsi une sensibilité et une spécificité supérieures pour identifier l'abondance différentielle réelle et affiner la signature microbienne de la maladie coronarienne.

Honeybrook, L.2026-06-10
💻 bioinformatics

Pseudoperplexity Probes Memorization in Protein Language Models

Cette étude emploie la pseudoperplexité pour démontrer que le modèle de langage protéique ProtT5 présente une mémorisation détectable mais limitée de ses données d'entraînement, suggérant qu'il généralise principalement la grammaire statistique des protéines plutôt que de simplement mémoriser par cœur des séquences.

Plaikner, A., Ploner, M., Sewald, Z., Senoner, T., Franz, S., Brenner, M., Heinzinger, M., Rost, B.2026-06-10