Evaluation of Elicit as an adjunct search, screening, and data extraction tool for systematic reviews
Diese Studie bewertet Elicit als KI-Tool für systematische Übersichtsarbeiten und stellt fest, dass es zwar erhebliche Zeiteinsparungen und nützliche Datenextraktionsmöglichkeiten bietet, seine geringe Suchüberschneidung und niedrige Präzision beim Screening jedoch darauf hindeuten, dass es derzeit nur als Ergänzung und nicht als eigenständiger Ersatz für den Prozess der systematischen Übersichtsarbeit geeignet ist.
Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
In der Welt der medizinischen Forschung gilt die systematische Übersichtsarbeit als ein Eckpfeiler der Wahrheit. Es handelt sich um einen strengen Prozess, bei dem Wissenschaftler jede verfügbare Studie zu einer spezifischen Fragestellung sammeln, diese mit äußerster Sorgfalt sichten und ihre Ergebnisse kombinieren, um zu bestimmen, was tatsächlich über ein Gesundheitsthema bekannt ist. Diese Methode ist essenziell für Ärzte bei der Entscheidung über Behandlungen und für politische Entscheidungsträger bei der Festlegung von Gesundheitsrichtlinien, doch sie ist notorisch schwierig. Der Prozess ist langsam, teuer und erfordert immensen menschlichen Aufwand, da Teams von Forschern oft Jahre benötigen, um tausende Titel und Abstracts zu lesen, um zu entscheiden, welche Arbeiten in die endgültige Analyse gehören. Da das Volumen der veröffentlichten Wissenschaft jeden Tag wächst, ist die schiere Aufgabe, mit der neuen Literatur Schritt zu halten, überwältigend geworden, was viele zu der Frage führt, ob künstliche Intelligenz diese schwere Last übernehmen könnte.
Eine aktuelle Studie eines Teams des Centre for Addiction and Mental Health in Toronto untersucht genau diese Möglichkeit, indem sie ein spezifisches KI-Tool namens Elicit testet. Die Forscher wollten wissen, ob diese Software die Arbeit eines menschlichen Teams bei der Durchführung einer systematischen Übersichtsarbeit replizieren kann. Um dies herauszufinden, nahmen sie eine Übersichtsarbeit, die ihre eigene Gruppe bereits manuell abgeschlossen hatte – eine Studie, die untersuchte, ob frühe, leichte psychotische Symptome bei jungen Menschen später auf spätere psychiatrische Diagnosen hindeuten – und baten Elicit, exakt dieselbe Aufgabe zu erledigen. Sie verglichen die Ergebnisse der KI mit der Arbeit des menschlichen Teams in jeder Phase, von der anfänglichen Suche nach Papieren bis hin zur endgültigen Extraktion der Daten, wobei sie maßen, wie viele korrekte Studien die KI fand, wie viele sie übersah und wie viel Zeit sie einsparte.
Die Ergebnisse offenbarten ein Werkzeug, das zwar leistungsstark, aber noch nicht bereit ist, alleine zu arbeiten. Wenn es um die anfängliche Suche ging, hatte Elicit erhebliche Schwierigkeiten. Während das menschliche Team unter Verwendung traditioneller Suchmethoden über 5.000 relevante Studien fand, deckte die Suchmaschine von Elicit nur 158 dieser identischen Studien auf. Das bedeutet, dass die KI die überwiegende Mehrheit der Forschung übersah, die die Menschen identifiziert hatten, was darauf hindeutet, dass ihre derzeitigen Suchkapazitäten nicht umfassend genug sind, um die sorgfältigen, strukturierten Suchen der menschlichen Forscher zu ersetzen. Sob es jedoch die Studien vor sich hatte, zeigte die KI mehr Potenzität. Während des Screening-Prozesses, bei dem Forscher entscheiden, ob ein Papier relevant genug ist, um es im Volltext zu lesen, schnitt Elicit mäßig gut ab. Es identifizierte die meisten wichtigen Studien erfolgreich, beging aber auch eine spezifische Art von Fehler: Es neigte dazu, Arbeiten einzuschließen, die eigentlich ausgeschlossen werden sollten. Es war zu vorsichtig und ließ Konferenzposter und Abstracts zu, die keine vollständigen Forschungsartikel waren, und es beurteilte manchmal falsch, ob eine Studie die richtige Art von medizinischen Diagnosedaten enthielt.
Die ermutigendsten Erkenntnisse zeigten sich in der Phase der Datenextraktion, in der die KI versuchte, spezifische Zahlen und Fakten aus den ausgewählten Papieren zu ziehen. Elicit erwies sich als hilfreicher Assistent und fand in fast allen Fällen exakte Übereinstimmungen für grundlegende Details wie den Namen des Autors, das Veröffentlichungsjahr und das Land der Studie. Selbst wenn es nicht die perfekte Zahl fand, lieferte es oft einen Satz aus dem Originaltext, der den menschlichen Leser auf die korrekte Information hinwies, was eine erhebliche Zeitersparnis darstellt. Bei komplexeren Details, wie dem exakten Alter der Teilnehmer oder spezifischen statistischen Ergebnissen, war die KI weniger präzise; sie entnahm Daten manchmal der falschen Gruppe innerhalb einer Studie oder übersah den spezifischen Wert, der für eine endgültige Berechnung benötigt wurde. Trotz dieser Unvollkommenheiten war der Zeitunterschied atemberaubend. Das menschliche Team benötigte fast 445 Arbeitsstunden, um den gesamten Prozess der Übersichtsarbeit abzuschließen, was die doppelte Überprüfung jedes Schrittes durch mehrere Forscher beinhaltete. Die KI erledigte die Version derselben Aufgabe in etwas mehr als drei Stunden.
Letztlich kommt die Studie zu dem Schluss, dass Elicit ein wertvoller Partner, aber kein Ersatz ist. Es ist noch nicht in der Lage, eine systematische Übersichtsarbeit eigenständig durchzuführen, da es in der Suchphase zu viele Studien übersieht und im Screening-Prozess zu viele Fehler macht, um ohne Aufsicht vertraut werden zu können. Es ist jedoch in der Lage, Dokumente schnell zu scannen und auf spezifische Sätze hinzuweisen, was es zu einem exzellenten Werkzeug macht, um die Arbeit menschlicher Forscher zu beschleunigen. Die Autoren schlagen vor, dass der beste Ansatz darin besteht, die KI als zweiten oder dritten Reviewer einzusetzen, indem man sie die schwere Arbeit des Findens von Informationen erleden lässt, während ein menschlicher Experte den Prozess überwacht, um Fehler abzufangen und sicherzustellen, dass die Endergebnisse korrekt sind. Auf diese Weise kann die Technologie die Zeit und die Kosten der Forschung reduzieren, ohne die Zuverlässigkeit zu opfern, die die medizinische Wissenschaft erfordert.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.