Evaluation of Elicit as an adjunct search, screening, and data extraction tool for systematic reviews
Cette étude évalue Elicit en tant qu'outil d'IA pour les revues systématiques, concluant que bien qu'il offre des gains de temps significatifs et des capacités d'extraction de données utiles, son faible chevauchement de recherche et sa faible précision dans le filtrage indiquent qu'il n'est actuellement adapté qu'en tant qu'adjoint plutôt qu'en tant que remplacement autonome du processus de revue systématique.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Dans le monde de la recherche médicale, la revue systématique s'impose comme une pierre angulaire de la vérité. Il s'agit d'un processus rigoureux où les scientifiques rassemblent toutes les études disponibles sur une question spécifique, les passent au crible avec un soin extrême et combinent leurs conclusions pour déterminer ce qui est réellement connu sur un problème de santé. Cette méthode est essentielle pour les médecins prenant des décisions de traitement et les décideurs politiques établissant des directives de santé, pourtant elle est notoirement difficile. Le processus est lent, coûteux et exige un effort humain immense, prenant souvent des années à s'accomplir alors que des équipes de chercheurs lisent des milliers de titres et de résumés pour décider quels articles appartiennent à l'analyse finale. À mesure que le volume de la science publiée croît chaque jour, la tâche colossale consistant à suivre la nouvelle littérature est devenue accablante, amenant beaucoup à se demander si l'intelligence artificielle pourrait assumer ce lourd fardeau.
Une étude récente d'une équipe du Centre for Addiction and Mental Health à Toronto explore cette possibilité même en testant un outil d'IA spécifique appelé Elicit. Les chercheurs voulaient savoir si ce logiciel pouvait reproduire le travail d'une équipe humaine menant une revue systématique. Pour le découvrir, ils ont pris une revue que leur propre groupe avait déjà réalisée manuellement — une étude examinant si les symptômes psychotiques précoces et légers chez les jeunes prédisent des diagnostics de santé mentale ultérieurs — et ont demandé à Elicit de faire exactement le même travail. Ils ont comparé les résultats de l'IA aux travaux de l'équipe humaine à chaque étape, de la recherche initiale des articles jusqu'à l'extraction finale des données, mesurant combien d'études correctes l'IA avait trouvées, combien elle en avait manquées et combien de temps elle avait fait gagner.
Les résultats ont révélé un outil puissant mais pas encore prêt à travailler seul. Lorsqu'il s'agissait de la recherche initiale, Elicit a eu des difficultés significatives. Alors que l'équipe humaine avait trouvé plus de 5 000 études pertinentes en utilisant des méthodes de recherche traditionnelles, le moteur de recherche d'Elicit n'en a découvert que 158 parmi ces mêmes études. Cela signifie que l'IA a manqué la vaste majorité de la recherche que les humains avaient identifiée, suggérant que ses capacités de recherche actuelles ne sont pas assez larges pour remplacer les recherches structurées et méticuleuses effectuées par les chercheurs humains. Cependant, une fois les études devant elle, l'IA a montré plus de promesses. Lors du processus de sélection, où les chercheurs décident si un article est assez pertinent pour être lu intégralement, Elicit s'est comportée de manière modérée. Elle a identifié avec succès la plupart des études importantes, mais elle a aussi commis un type d'erreur spécifique : elle avait tendance à inclure des articles qui auraient dû être exclus. Elle était trop prudente, laissant passer des affiches de conférences et des résumés qui n'étaient pas des articles de recherche complets, et elle évaluait parfois mal si une étude possédait le bon type de données de diagnostic médical.
Les conclusions les plus encourageantes sont apparues lors de la phase d'extraction des données, où l'IA a tenté d'extraire des chiffres et des faits spécifiques des articles sélectionnés. Elicit s'est révélée être un assistant utile, trouvant avec succès des correspondances exactes pour des détails de base comme le nom de l'auteur, l'année de publication et le pays de l'étude dans presque tous les cas. Même lorsqu'elle ne trouvait pas le nombre parfait, elle fournissait souvent une phrase du texte original qui guidait le lecteur humain vers l'information correcte, ce qui constitue un gain de temps considérable. Pour des détails plus complexes, tels que l'âge exact des participants ou des résultats statistiques spécifiques, l'IA était moins précise, extrayant parfois des données du mauvais groupe au sein d'une étude ou manquant la valeur spécifique nécessaire pour un calcul final. Malgré ces imperfections, la différence de vitesse est stupéfiante. L'équipe humaine a mis près de 445 heures de travail pour achever l'ensemble du processus de revue, impliquant plusieurs chercheurs vérifiant chaque étape. L'IA a terminé sa version de la même tâche en un peu plus de trois heures.
En fin de compte, l'étude conclut qu'Elicit est un partenaire précieux mais pas un remplacement. Elle n'est pas encore capable de mener une revue systématique de manière autonome car elle manque trop d'études lors de la phase de recherche et commet trop d'erreurs lors de la phase de sélection pour pouvoir être utilisée sans supervision. Cependant, sa capacité à scanner rapidement les documents et à pointer des phrases spécifiques en fait un excellent outil pour accélérer le travail des chercheurs humains. Les auteurs suggèrent que la meilleure approche consiste à utiliser l'IA comme un deuxième ou troisième réviseur, la laissant gérer le travail de fond pour trouver l'information pendant qu'un expert humain supervise le processus pour corriger les erreurs et garantir l'exactitude des résultats finaux. De cette façon, la technologie peut réduire le temps et le coût de la recherche sans sacrifier la fiabilité qu'exige la science médicale.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.