Die Bioinformatik verbindet Biologie und Informatik, um riesige Mengen an biologischen Daten verständlich zu machen. Statt sich nur auf einzelne Experimente zu konzentrieren, nutzen Forscher hier computergestützte Methoden, um Muster im Leben selbst zu entschlüsseln, von der DNA bis zu komplexen Krankheitsverläufen. Diese Schnittstelle ermöglicht es, die Sprache des Lebens in Zahlen und Algorithmen zu übersetzen und neue Erkenntnisse schnell zu gewinnen.

Auf Gist.Science durchsuchen wir täglich die neuesten Vorab-Veröffentlichungen auf bioRxiv in diesem Bereich. Für jedes neu eingereichte Preprint erstellen wir nicht nur eine detaillierte technische Zusammenfassung für Fachleute, sondern auch eine einfache Erklärung in Alltagssprache, damit jeder den Kern der Forschung verstehen kann. So wird komplexes Wissen für ein breites Publikum zugänglich, ohne dass wichtige Details verloren gehen.

Unten finden Sie die aktuellsten Artikel aus dem Bereich der Bioinformatik, die wir kürzlich für Sie aufbereitet haben.

💻 bioinformatics

PanGBank: a large-scale resource of precomputed microbial pangenomes built with PPanGGOLiN

PanGBank ist eine umfassende Open-Access-Datenbank, die vorberechnete Pangenome für über 4.600 prokaryotische Spezies mittels PPanGGOLiN bereitstellt und standardisierte, graphbasierte Ressourcen sowie mehrere Zugriffswerkzeuge anbietet, um groß angelegte vergleichende Genomik sowie die Untersuchung der mikrobiellen Evolution und Adaptation zu erleichtern.

Mainguy, J., Lemane, T., Bazin, A., Arnoux, J., Gautreau, G., Medigue, C., Calteau, A., Vallenet, D.2026-08-09
💻 bioinformatics

Move BeTween modAlities (MBTA) employs flow matching to predict single cell data modalities

Das Paper stellt Move BeTween modAlities (MBTA) vor, ein neuartiges Framework, das Flow Matching nutzt, um modalitätsspezifische latente Räume zu verbinden und strukturelle Diskrepanzen in Einzelzell-Daten zu adressieren, wodurch eine präzise kreuzmodale Translation ermöglicht wird, während die einzigartige strukturelle Integrität jeder molekularen Modalität bewahrt bleibt.

Xu, B., Zhang, Y., Michor, F.2026-08-09
💻 bioinformatics

Scalable Extraction of Information on Protein-Protein Interactions using Topological Data Analysis

Dieses Paper führt ein skalierbares Framework der topologischen Datenanalyse ein, das die Rechenkosten für die Vorhersage von Protein-Protein-Interaktionsschnittstellen aus Oberflächenpatches signifikant reduziert und dabei eine im Vergleich zu etablierten Methoden des geometrischen Deep Learning wettbewerbsfähige Genauigkeit beibehält.

Mukherjee, A., Park, B., Malmstrom, A., Cisewski-Kehe, J., Van Lehn, R. C., Zavala, V. M.2026-08-09
💻 bioinformatics

A map of human protein-protein interaction embeddings for functional discovery

Das Papier stellt MAPPIE vor, eine neuartige Methode, die eine zweidimensionale Einbettungskarte menschlicher Protein-Protein-Interaktionen generiert, um spezifische funktionelle Rollen für einzelne Interaktionspaare vorherzusagen, wobei sie insbesondere in Regionen des Interaktoms mit spärlichem Funktionswissen bestehende Baselines übertrifft.

Cihan, M., Distler, U., Andrade-Navarro, M. A.2026-08-09
💻 bioinformatics

A hierarchical orthology framework reveals viral carbohydrate-active genes across the global virosphere

Diese Studie stellt VirGenes vor, ein hierarchisches Orthologie-Framework, das Sequenz-, Struktur- und Funktionsdaten integriert, um eine weite, zuvor unterschätzte Diversität viraler kohlenhydrataktiver Enzyme in der globalen Virosphäre aufzudecken und deren komplexe evolutionäre Ursprünge sowie signifikante Rollen in Virus-Wirt-Interaktionen aufzuzeigen.

Meng, L., Zhang, R., De Castro, C., Uchiyama, I., Kanehisa, M., Ogata, H.2026-08-07
💻 bioinformatics

Phylogeny-aided detection of contamination in nearly 5 million SARS-CoV-2 genomes

Die Studie stellt PhyCD vor, ein phylogeniegestütztes computergestütztes Werkzeug, das nahezu 5 Millionen SARS-CoV-2-Genome analysierte, um über 10.000 Kontaminationsereignisse zu identifizieren und nahezu 65.000 fehlerhafte Substitutionen zu maskieren, wodurch die Zuverlässigkeit nachgeschalteter Analysen zur Pathogen-Evolution und -Übertragung verbessert wird.

Anoufa, O., Ly-Trong, N., Goldman, N., De Maio, N.2026-08-07
💻 bioinformatics

SLIM: A small linear model with STRING embeddings for single-cell genetic perturbation prediction

SLIM ist ein leichtgewichtiges, recheneffizientes Modell, das 64-dimensionale STRING-Netzwerk-Embeddings und einen geschlossenen Ridge-Regressions-Schätzer nutzt, um zelluläre Antworten auf genetische Perturbationen präzise vorherzusagen, wobei es häufig komplexe Deep-Learning-Baselines mit minimalen trainierbaren Parametern übertrifft.

Hu, D., Pielies Avelli, M., Jensen, L. J., Rasmussen, S.2026-08-07
💻 bioinformatics

From Abandoned Scripts to FAIR Community Pipelines: Rescuing Orphan Bioinformatics Workflows with nf-core - Lessons from Light-Sheet Fluorescence Microscopy

Diese Arbeit zeigt, dass verwaiste wissenschaftliche Software, wie das aufgegebene MATLAB-basierte NuMorph-Toolkit, durch die Anwendung einer systematischen Re-Engineering-Methode, die von FAIR-Prinzipien und modernen Software-Engineering-Standards geleitet wird, erfolgreich gerettet und in nachhaltige, wiederverwendbare Community-Workflows wie nf-core/lsmquant transformiert werden kann.

Schwitalla, C., Kuhn Cuellar, L., Hoertenhuber, M., Grote, N., Woller, T., Lamberti, I., Pavie, B., Kuestner, T., Kyere (…)2026-08-06
💻 bioinformatics

Benchmarking Twist Genotyping-by-Sequencing Against Whole-Genome Sequencing in Nuclear Families

Diese Studie vergleicht die genomweite SNP-Capture-Plattform (GxS) von Twist Bioscience mit der Ganzgenomsequenzierung und dem Illumina GSA-24-Array durch die Bewertung der Genotyp-Konkordanz und der Raten mendelscher Verletzungen bei 555 Individuen in 184 Kernfamilien, mit dem Ziel, eine unabhängige Bewertung dieser aufkommenden gezielten Sequenzierungstechnologie bereitzustellen.

Klugerman, J., Iossifov, I., Ye, K.2026-08-06
💻 bioinformatics

A Comprehensive Database of Simulations and Meshes of Coronary Arteries from the Fame 2 Trial

Diese Arbeit präsentiert eine öffentlich zugängliche Datenbank, die 3D-instationäre Navier-Stokes-Simulationen und hochwertige Hexaeder-Netze für 779 Koronararterien enthält, die aus der FAME 2-Studie rekonstruiert wurden, mit dem Ziel, den Mangel an numerischen Hämodynamikdaten für datengesteuerte Modellierung und Anwendungen des maschinellen Lernens zu beheben.

Marcinno', F., Hinz, J., Ando', E., Mahendiran, T., Buffa, A., Deparis, S.2026-08-05