Benchmarking 16S rRNA gene amplicon analysis in high-diversity microbial communities reveals fundamental trade-offs in clustering and denoising
Diese Studie benchmarkt vier 16S-rRNA-Amplikon-Analyse-Pipelines unter Verwendung von simulierten und realen hochdiversen Gemeinschaften, um zu demonstrieren, dass die Pipeline-Leistung grundlegende Kompromisse zwischen Artenrepräsentation, Clusterreinheit und Abundanzgenauigkeit beinhaltet, die mit den Datensatzcharakteristika variieren, und argumentiert damit gegen feste analytische Standardeinstellungen zugunsten einer objektiverorientierten Parameterauswahl.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Um die unsichtbare Welt der Mikroben zu verstehen, verlassen sich Wissenschaftler oft auf eine Technik namens DNA-Barcoding. Sie entnehmen eine Probe aus Boden, Wasser oder Sediment, extrahieren das genetische Material und konzentrieren sich auf ein spezifisches Gen, das als eindeutiger Identifikator für Bakterien dient. Durch das Lesen von Millionen dieser genetischen Schnipsel können Forscher zählen, wie viele verschiedene Arten von Bakterien vorhanden sind, und abschätzen, wie häufig jede einzelne davon ist. Diese Methode hat unser Verständnis des Lebens an Orten, die vom menschlichen Darm bis zum tiefen Meeresboden reichen, revolutioniert. Die durch diese Maschinen erzeugten Rohdaten sind jedoch unordentlich. Sie enthalten Fehler, die während des Sequenzierungsprozesses entstanden sind, sowie winzige Variationen, die schwer von echten biologischen Unterschieden zu unterscheiden sind. Um dieses Rauschen zu interpretieren, nutzen Wissenschaftler Computerprogramme, um ähnliche Sequenzen zusammenzufassen, in der Hoffnung, die wahre Gemeinschaft der Organismen zu rekonstruieren, die in der ursprünglichen Probe existierte.
Die Herausforderung besteht darin, das richtige Computerprogramm und die richtigen Einstellungen für die Aufgabe zu wählen. Jahrelang haben sich Forscher auf Standardwerkzeuge verlassen, um diese genetischen Fragmente zu sortieren, aber diese Werkzeuge wurden oft an einfachen, wenig diversen Proben getestet, wie etwa aus dem menschlichen Darm, und nicht an den unglaublich komplexen und überfüllten mikrobiellen Gemeinschaften, die in der Natur vorkommen. Eine neue Studie von Forschern der Norwegischen Universität für Lebenswissenschaften und der Universität Oslo stellt eine kritische Frage: Funktionieren diese Standardwerkzeuge angesichts der extremen Diversität von Umweltproben? Das Team setzte sich zum Ziel, vier populäre Computer-Pipelines – VSEARCH, UNOISE, Swarm und DADA2 – zu testen, indem es sie mit simulierten Daten fütterte, bei denen die wahre Antwort bereits bekannt war. Sie erstellten virtuelle mikrobielle Gemeinschaften mit variierenden Komplexitätsgraden, die von hundert Arten bis zu zehntausend reichten, sowie mit unterschiedlichen Verteilungen der Abundanz, von gleichmäßigen Verteilungen bis hin zu stark ungleichmäßigen, bei denen einige wenige Arten dominieren und viele andere selten sind.
Die Forscher entdeckten, dass sich die Leistung dieser Werkzeuge drastisch ändert, je nachdem, wie komplex die Gemeinschaft ist. In einfacheren Gemeinschaften mit weniger Arten lieferten die verschiedenen Programme sehr ähnliche Ergebnisse, und die Wahl der Software spielte kaum eine Rolle. Doch als die Anzahl der Arten auf Tausende anstieg, wurden die Unterschiede eklatant. Kein einzelnes Programm erwies sich als die perfekte Lösung für jede Situation. Stattdessen gingen die einzelnen Werkzeuge unterschiedliche Kompromisse ein. Einige Programme waren exzellent darin, die relative Abundanz der Arten genau beizubehalten – das heißt, sie zeigten korrekt an, welche Bakterien häufig und welche selten waren –, neigten aber dazu, eine einzige Spezies in viele verschiedene Gruppen aufzuspalten, wodurch es so aussah, als gäbe es mehr Arten von Bakterien, als tatsächlich vorhanden waren. Andere waren besser darin, Arten als einzelne Einheiten zusammenzuhalten, hatten aber Schwierigkeiten, das volle Spektrum der in der Probe vorhandenen seltenen Arten darzustellen.
Einer der bedeutendsten Befunde war, dass eine hohe Punktzahl für die „Reinheit“ keine Garantie für ein genaues Bild der Gemeinschaft war. Ein Cluster von Sequenzen gilt als rein, wenn alle DNA in ihm von derselben Spezies stammt. Mehrere Programme produzierten Cluster, die fast zu einhundert Prozent rein waren, dennoch scheiterten sie daran, die wahre Spezies korrekt zu rekonstruieren, weil sie diese entweder über mehrere Cluster aufteilten oder sie ganz übersehen hatten. Dies deutet darauf hin, dass es irreführend sein kann, nur darauf zu schauen, wie sauber die Gruppen sind. Die Studie untersuchte auch eine spezifische Einstellung namens Mindestabundanz-Schwellenwert, der als Filter fungiert, um sehr seltene Sequenzen zu verwerfen, die Fehler sein könnten. Die Forscher fanden heraus, dass das Erhöhen dieses Schwellenwerts, um strenger zu werden, die Anzahl der aufgespaltenen Spezies reduzierte, aber auch den Verlust echter, seltener Bakterien verursachte. Dieser Effekt war besonders stark, wenn die Gesamtzahl der DNA-Reads gering war, was bedeutet, dass eine Einstellung, die bei einem tiefen Sequencing-Lauf gut funktioniert, bei einem flacheren Lauf wertvolle Daten zerstören könnte.
Um zu bestätigen, dass diese Muster auch in der realen Welt Bestand haben, wandte das Team dieselben Methoden auf tatsächliche Sedimentproben vom Meeresboden an. Ohne die wahre Zusammensetzung dieser natürlichen Proben zu kennen, untersuchten sie, wie oft spezifische DNA-Sequenzen über mehrere Replikate hinweg auftraten, die an demselben Standort entnommen wurden. Sie stellten fest, dass strengere Filter-Einstellungen Sequenzen entfernten, die konsistent über diese Replikate hinweg nachgewiesen worden waren, was bestätigte, dass der beobachtete Datenverlust aus den Simulationen auch in der Natur stattfand. Die Studie kommt zu dem Schluss, dass es keine universell „beste“ Pipeline für die Analyse mikrobieller Diversität gibt. Die Wahl der Software und der Einstellungen muss auf die spezifischen Ziele der Studie und die Eigenschaften der Probe zugeschnitten sein. Wenn ein Forscher genau wissen muss, wie viele Arten vorhanden sind, wählt er vielleicht ein anderes Werkzeug, als wenn er die präzisen Proportionen dieser Arten bestimmen möchte. Die Ergebnisse dienen als Erinnerung daran, dass in der komplexen Welt der Umweltmikrobiologie die Werkzeuge, mit denen wir die unsichtbare Welt betrachten, das Bild prägen, das wir sehen, und dass diese Werkzeuge mit Sorgfalt gewählt werden müssen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.