Classical baselines outperform released deep-learning ITS classifiers, which collapse on ITS2 where predictions follow the flanking regions
Diese Studie zeigt, dass Deep-Learning-Klassifikatoren für pilzliche ITS-Sequenzen zwar eine hohe Genauigkeit bei vollständigen Referenzen erreichen, jedoch bei der häufig verwendeten ITS2-Subregion dramatisch versagen, da sie sich auf die flankierenden Regionen anstatt auf das Barcoding selbst verlassen, was dazu führt, dass klassische Baseline-Methoden in realistischen Szenarien des Umwelt-Metabarcodings die Klassifikatoren signifikant übertreffen.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
In der mikroskopischen Welt der Pilze verlassen sich Wissenschaftler auf einen spezifischen Abschnitt des genetischen Codes, um Arten zu identifizieren, ganz so, wie ein Bibliothekar einen Barcode verwendet, um Bücher zu sortieren. Dieser Code, bekannt als der interne transkribierte Spacer oder ITS, liegt zwischen anderen Genen in der DNA der Pilze und variiert stark genug zwischen den Arten, um als eindeutiger Identifikator zu dienen. Seit Jahrzehnten nutzen Forscher diese Region, um das unsichtbare Pilzleben zu katalogisieren, das uns umgibt – von den Pilzen in einem Wald bis hin zu den Schimmelpilzen, die in einem Haus wachsen. Die moderne Technologie hat jedoch ermöglicht, nur ein kleines, praktisches Fragment dieses Codes zu sequenzieren – speziell einen Abschnitt namens ITS2 – anstatt des gesamten genetischen Datensatzes. Diese Abkürzung ist schneller und kostengünstiger und erlaubt es Wissenschaftlern, tausende Proben gleichzeitig zu verarbeiten, wirft aber eine entscheidende Frage auf: Können selbst die fortschrittlichsten Computerprogramme, die auf dem vollständigen genetischen Datensatz trainiert wurden, den Pilz noch erkennen, wenn sie nur diesen winzigen Bruchteil sehen?
Kürzlich unternahm ein Forscherteam den Versuch, die Grenzen der künstlichen Intelligenz auf diesem Gebiet auszuloten. Sie untersuchten zwei leistungsstarke Deep-Learning-Klassifikatoren – hochentwickelte Computermodelle, die darauf trainiert wurden, Millionen von Pilfsequenzen zu analyseln, um Artennamen mit hoher Genauigkeit vorherzusagen. Diese Modelle wurden für ihre Fähigkeit gefeiert, Pilze mit einer Genauigkeit von über 90 Prozent zu identifizieren, wurden jedoch auf den vollständigen, lückenlosen genetischen Datensätzen trainiert. Die Forscher wollten wissen, ob dieselben Modelle auch funktionieren würden, wenn man ihnen die kurzen, partiellen Sequenzen füttert, die tatsächliche Umweltuntersuchungen produzieren. Um dies herauszufinden, erstellten sie einen fairen Test, bei dem sie tausende Pilfsequenzen untersuchten und die Leistung der künstlichen Intelligenz gegen ältere, traditionellere Methoden verglichen, die auf direktem Vergleich anstatt auf komplexem Lernen beruhen.
Die Ergebnisse zeigten ein schwerwiegendes Versagen der künstlichen Intelligenz. Als die Forscher den Modellen die vollständigen genetischen Datensätze zuführten, zeigten die Deep-Learning-Klassifikatoren eine respektable Leistung, wenngleich sie immer noch etwas weniger genau waren als die traditionellen Methoden. Doch in dem Moment, als die Eingabe auf das kurze ITS2-Fragment beschränkt wurde, brach die Leistung der künstlichen Intelligenz zusammen. Bei diesem kurzen Fragment sank die Genauigkeit der Deep-Learning-Modelle auf etwa 18 bis 28 Prozent – ein katastrophaler Einbruch im Vergleich zu den traditionellen Methoden, die robust und mit nahezu 90 Prozent genau blieben. Die Modelle der künstlichen Intelligenz, die als die Zukunft der Pilzidentifizierung angepriesen worden waren, funktionierten im Grunde nicht mehr, als sie mit den Daten konfrontiert wurden, die sie in der realen Welt am wahrscheinlichsten vorfinden würden.
Die Forscher untersuchten daraufhin, warum dies geschah, und vermuteten, dass die Modelle nicht tatsächlich den Barcode lasen, den sie identifizieren sollten. Sie führten ein kluges Experiment durch, bei dem sie das kurze ITS2-Fragment eines Pilzes nahmen und es mit den flankierenden genetischen Regionen eines völlig anderen Pilzes umgabten. Wenn die Modelle den ITS2-Barcode wirklich lesen würden, müssten sie den ursprünglichen Pilz identifizieren. Stattdessen identifizierten die Modelle überwältigend den Spenderpilz, dessen umliegendes genetisches Material angehängt worden war. In einem Fall identifizierte das Modell korrekt die Familie des Spenders für fast 64 Prozent der Abfragen, während es den eigentlichen Pilz in weniger als 1 Prozent der Fälle identifizierte. Dies bewies, dass die Modelle nicht auf den Barcode selbst schauten, sondern sich auf den umgebenden genetischen Kontext verließen, der in den kurzen Umweltproben vollständig fehlte.
Diese Entdeckung erklärt, warum die Modelle so dramatisch scheiterten. Die künstliche Intelligenz hatte gelernt, Pilze zu erkennen, indem sie den gesamten genetischen Datensatz betrachtete, einschließlich der Regionen vor und nach dem Barcode. Wenn sie mit dem kurzen Fragment allein konfrontiert wurden, waren die Modelle effektiv blind und unfähig, die Merkmale zu finden, die sie gelernt hatten zu erkennen. Schlimmer noch: Die Modelle gaben ihre Verwirrung nicht zu. Ihre Konfidenzwerte verloren die Fähigkeit, zwischen vertrauten Pilzen und neuartigen zu unterscheiden, was bedeutete, dass die Ausgabe keine Warnung lieferte, dass die Vorhersage wahrscheinlich falsch war. Im Fall eines Modells blieb es übermäßig selbstbewusst und vermittelte den Forschern ein falsches Gefühl der Sicherheit, obwohl es größtenteils falsch lag. Die Studie kommt zu dem Schluss, dass die berichtete hohe Genauigkeit dieser Deep-Learning-Werkzeuge eine Illusion ist, die durch Tests auf Daten erzeugt wurde, die nicht den realen Bedingungen von Umweltuntersuchungen entsprechen. Damit diese Werkzeuge nützlich sind, müssen sie neu trainiert oder umgestaltet werden, damit sie verstehen, dass die kurzen Fragmente, die sie erhalten, sich grundlegend von den vollständigen Datensätzen unterscheiden, auf denen sie aufgebaut wurden – andernfalls müssen Wissenschaftler sich auf die einfacheren, zuverlässigeren Methoden verlassen, die die Zeit überdauert haben.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.