Developing an open-source framework for LLM evaluation of patients using EHR clinical documentation; performance of LLMs relative to medical professionals
Cette étude démontre que les modèles de langage de grande taille actuels ne parviennent pas à atteindre une fiabilité inter-juges comparable à celle des professionnels de santé lors de l'extraction d'informations cliniques structurées à partir de dossiers de santé électroniques en ORL, suggérant qu'ils sont mieux adaptés à l'extraction initiale de données nécessitant une vérification humaine plutôt qu'à un déploiement clinique autonome.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Les hôpitaux d'aujourd'hui génèrent un océan de documents écrits. Chaque visite de patient, chaque résultat de test et chaque décision de traitement est consigné dans des notes numériques appelées dossiers de santé électroniques. Ces documents sont riches en détails, contenant le langage spécifique que les médecins utilisent pour décrire les symptômes, diagnostiquer des pathologies et planifier les soins. Pendant des décades, transformer ces récits non structurés en données organisées et consultables a été une tâche difficile, nécessitant souvent que des humains lisent et réécrivent l'information à la main. Récemment, un nouveau type de programme informatique appelé modèle de langage étendu a émergé. Ces systèmes sont entraînés sur des quantités massives de texte et peuvent lire, comprendre et résumer le langage humain avec une fluidité surprenante. Ils ont montré qu'ils pouvaient répondre à des questions médicales et réussir des examens de licence, ce qui amène beaucoup de gens à se demander s'ils peuvent également lire les dossiers des patients et en extraire automatiquement les faits vitaux.
Cette question ne concerne pas seulement le gain de temps ; il s'agit de sécurité et de précision. Si un ordinateur doit aider les médecins à gérer les soins des patients, il doit trouver la bonne information sans inventer de faits ou manquer des détails critiques. Une nouvelle étude s'est donné pour tester cette capacité directement. Les chercheurs ont rassemblé près de cent dossiers de patients réels provenant de cliniques d'oto-rhino-laryngologie et ont demandé à la fois à des médecins humains et à sept modèles de langage étendu différents de les lire. La tâche consistait à extraire des faits spécifiques, tels que l'âge du patient, ses symptômes, son diagnostic et les traitements reçus. Pour s'assurer que tout le monde parlait la même langue, les chercheurs ont exigé que chaque information soit traduite en un code standardisé utilisé par les hôpitaux du monde entier. Cela a permis une comparaison précise de la performance des machines par rapport aux humains.
Les résultats ont révélé un écart clair entre l'expertise humaine et l'intelligence artificielle actuelle. Lorsque les quatorze médecins de l'étude ont lu les mêmes dossiers, ils étaient d'accord sur les informations extraites environ 81 % du temps. Ce haut niveau d'accord a montré que les médecins interprétaient les notes de manière cohérente. Cependant, lorsque les modèles informatiques ont été comparés aux médecins, l'accord a chuté de manière significative pour atteindre environ 66 %. En d'autres termes, les machines n'étaient pas encore aussi fiables que les humains pour identifier les mêmes faits à partir du même texte. L'étude a testé des modèles de différentes tailles, allant de systèmes massifs possédant des centaines de milliards de connexions à des modèles plus petits pouvant fonctionner sur des ordinateurs locaux. Aucun d'entre eux n'a atteint le niveau de cohérence affiché par les professionnels de la médecine.
La performance variait selon le type d'information extrait. Les modèles étaient assez bons pour trouver des traitements et des résultats de tests, qui sont souvent rédigés de manière claire et standardisée. Ils étaient moins performants avec les signes et les diagnostics, qui nécessitent souvent une compréhension plus profonde du contexte clinique. Curieusement, les ordinateurs avaient tendance à trouver plus d'informations que les médecins, particulièrement concernant les facteurs de risque. Alors que les médecins se concentrent souvent sur le problème immédiat, les modèles semblaient signaler tous les risques possibles mentionnés dans le texte. Cela suggère que les machines ne se contentent pas de copier le comportement humain, mais traitent le texte différemment, captant parfois des détails qu'un humain pourrait négliger, mais signalant également potentiellement des éléments qui ne sont pas cliniquement pertinents.
Malgré ces différences, les machines ont montré qu'elles pouvaient être des outils utiles si elles sont utilisées correctement. L'étude a révélé que lorsque les modèles identifiaient une information, ils étaient généralement corrects, avec un taux de précision de 97 %. Cela signifie qu'ils inventent rarement des faits qui ne sont pas présents. Cependant, ils passaient à côté de certaines informations environ 15 % du temps. Ce schéma indique un rôle spécifique pour ces outils à l'avenir : ils sont mieux adaptés pour servir de premier passage, scannant rapidement les dossiers pour extraire les candidats probables à l'examen d'un médecin. La décision finale et la vérification doivent toujours revenir à un humain. Les chercheurs ont conclu que bien que ces modèles soient puissants, ils ne sont pas encore prêts à travailler seuls dans un cadre clinique. Ils sont mieux perçus comme des assistants capables d'aider à organiser le flot de données médicales, à condition qu'un expert humain soit toujours présent pour vérifier leur travail.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.