Evaluation of Elicit as an adjunct search, screening, and data extraction tool for systematic reviews
Deze studie evalueert Elicit als een AI-tool voor systematische reviews en stelt vast dat, hoewel het aanzienlijke tijdsbesparing en nuttige extractiemogelijkheden voor gegevens biedt, de slechte zoekoverlap en lage precisie bij het screenen erop wijzen dat het momenteel alleen geschikt is als aanvulling en niet als vervanging voor het proces van de systematische review.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer
In de wereld van medisch onderzoek vormt de systematische review de hoeksteen van de waarheid. Het is een rigoureus proces waarbij wetenschappers elke beschikbare studie over een specifieke vraag verzamelen, deze met uiterste zorg doorzoeken en hun bevindingen combineren om te bepalen wat er daadwerkelijk bekend is over een gezondheidskwestie. Deze methode is essentieel voor artsen die behandelbeslissingen nemen en beleidsmakers die gezondheidsrichtlijnen opstellen, maar het is berucht moeilijk. Het proces is traag, duur en vereist een enorme menselijke inspanning, waarbij het vaak jaren duurt voordat teams van onderzoekers duizenden titels en abstracts hebben gelezen om te beslissen welke artikelen in de uiteindelijke analyse thuishoren. Naarmate het volume van de gepubliceerde wetenschap dagelijks groeit, is de enorme taak om bij te blijven met de nieuwe literatuur overweldigend geworden, wat velen doet afvragen of kunstmatige intelligentie deze zware last zou kunnen dragen.
Een recente studie van een team van het Centre for Addiction and Mental Health in Toronto onderzoekt precies deze mogelijkheid door een specifieke AI-tool genaamd Elicit te testen. De onderzoekers wilden weten of deze software het werk van een menselijk team dat een systematische review uitvoert, kon evenaren. Om dit te achterhalen, namen ze een review die hun eigen groep al handmatig had voltooid—een studie die onderzocht of vroege, milde psychotische symptomen bij jongeren laterlijke mentale diagnoses voorspellen—en vroegen Elicit om exact dezelfde taak uit te voeren. Ze vergeleken de resultaten van de AI met het werk van het menselijke team in elke fase, van de initiële zoektocht naar papers tot de uiteindelijke extractie van gegevens, waarbij ze maten hoeveel correcte studies de AI vond, hoeveel hij miste en hoeveel tijd hij bespaarde.
De resultaten onthulden een tool die krachtig is, maar nog niet klaar om alleen te werken. Wanneer het aankwam op de initiële zoektocht, had Elicit aanzienlijke problemen. Terwijl het menselijke team meer dan 5.000 relevante studies vond met traditionele zoekmethoden, bracht de zoekmachine van Elicit slechts 158 van diezelfde studies aan het licht. Dit betekent dat de AI het overgrote deel van het onderzoek dat de mensen hadden geïdentificeerd, heeft gemist, wat suggereert dat de huidige zoekcapaciteiten van de AI niet breed genoeg zijn om de zorgvuldige, gestructureerde zoekopdrachten van menselijke onderzoekers te vervangen. Zodra de studies echter voor de AI lagen, toonde het meer potentie. Tijdens het screeningsproces, waarbij onderzoekers beslissen of een paper relevant genoeg is om volledig te lezen, presteerde Elicit redelijk goed. Het identificeerde de meeste belangrijke studies succesvol, maar maakte ook een specifiek soort fout: het neigde artikelen op te nemen die uitgesloten hadden moeten worden. Het was te voorzichtig en liet conferentieposters en abstracts toe die geen volledige wetenschappelijke artikelen waren, en het beoordeelde soms verkeerd of een studie wel over de juiste soort medische diagnosegegevens beschikte.
De meest bemoedigende bevindingen verschenen in de fase van de data-extractie, waar de AI probeerde specifieke cijfers en feiten uit de geselecteerde papers te halen. Elicit bleek een nuttige assistent te zijn en vond bijna in alle gevallen exacte overeenkomsten voor basisdetails zoals de naam van de auteur, het jaar van publicatie en het land van de studie. Zelfs wanneer het het perfecte getal niet vond, leverde het vaak een zin uit de originele tekst die de menselijke lezer naar de juiste informatie wees, wat een aanzienlijke tijdbesparing is. Voor complexere details, zoals de exacte leeftijd van de deelnemers of specifieke statistische resultaten, was de AI minder nauwkeurig; het haalde soms gegevens uit de verkeerde groep binnen een studie of miste de specifieke waarde die nodig was voor een uiteindelijke berekening. Ondanks deze imperfecties was het verschil in snelheid verbijsterend. Het menselijke team deed er bijna 445 uur werk over om het volledige reviewproces te voltooien, waarbij meerdere onderzoekers elke stap dubbel controleerden. De AI voltooide zijn versie van dezelfde taak in slechts iets meer dan drie uur.
Uiteindelijk concludeert de studie dat Elicit een waardzame partner is, maar geen vervanging. Het is nog niet in staat om op eigen kracht een systematische review uit te voeren, omdat het te veel studies mist in de zoekfase en te veel fouten maakt in de screeningsfase om zonder toezicht vertrouwd te worden. Het vermogen om echter snel documenten te scannen en naar specifieke zinnen te wijzen, maakt het een uitstekende tool om het werk van menselijke onderzoekers te versnellen. De auteurs suggereren dat de beste aanpak is om de AI als tweede of derde reviewer te gebruiken, waarbij de AI het zware werk van het vinden van informatie op zich neemt terwijl een menselijke expert het proces overziet om fouten op te merken en te garanderen dat de uiteindelijke resultaten accuraat zijn. Op deze manier kan de technologie de tijd en kosten van onderzoek verminderen zonder de betrouwbaarheid op te offeren die de medische wetenschap vereist.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.