Clinically Grounded AI-Scribing in Psychotherapy: Benchmarking LLMs Against Expert Documentation in the iCARE Framework
Cet article introduit le cadre de documentation cliniquement fondé iCARE et le jeu de données iHOPE correspondant pour évaluer onze grands modèles de langage, révélant que si les modèles à code fermé surpassent généralement ceux à code ouvert en termes de métriques automatisées, l'évaluation par des experts humains met en évidence des forces et faiblesses spécifiques — telles que des difficultés avec le raisonnement temporel et des préférences cliniques variables — qui soulignent la nécessité d'outils d'IA conçus pour assister plutôt que pour remplacer les thérapeutes.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Dans les pièces silencieuses où se déroule la psychothérapie, le travail est profondément humain. Il repose sur un thérapeute qui écoute l'histoire d'un client, remarque le poids d'un silence et comprend le contexte d'une peur qui remonte à des années. Pour que le thérapeute puisse accomplir ce travail efficacement, il doit également tenir un registre. Ces notes ne sont pas de simples documents administratifs ; elles sont la carte du monde intérieur d'une personne, capturant tout, de la crise immédiate à la longue histoire de la famille et des habitudes qui l'ont façonnée. Traditionnellement, la rédaction de ces notes a été un fardeau pesant, détournant l'attention du clinicien du patient vers un écran d'ordinateur. Ces dernières années, l'intelligence artificielle a promis de lever ce fardeau. Ces « scribes IA » peuvent écouter une conversation et la transcrire, mais dans le monde complexe de la santé mentale, la plupart des systèmes actuels sont insuffisants. Ils ont tendance à produire des résumés brefs et secs qui manquent de nuance, de sous-entendus émotionnels et des détails de sécurité critiques qui définissent une séance de thérapie. Le défi consistait à construire une machine qui ne se contente pas de transcrire des mots, mais qui comprend l'histoire.
Une équipe de chercheurs de l'Inde et de Singapour a franchi une étape significative vers la résolution de ce problème en repensant la manière dont les notes de thérapie devraient être structurées et la façon dont les machines devraient apprendre à les écrire. Ils ont commencé par créer un nouveau cadre complet pour la documentation appelé iCARE. Contra�est aux formats abrégés standards utilisés dans de nombreux hôpitaux, qui sont conçus pour des vérifications administratives rapides, iCARE est conçu pour capturer toute la profondeur d'une rencontre clinique. C'est une structure détaillée comprenant dix-sept sections distinctes, allant des informations d'identification de base et des préoccupations principales du client à une analyse approfondie de son historique médical, une évaluation des risques pour les dangers immédiats comme l'automutilation, et un plan pour les séances futures. Les chercheurs ont soutenu qu'un système d'IA doit d'abord être capable de générer cette image riche et complète avant de pouvoir être condensée en un résumé plus court. Pour tester cette idée, ils ont construit un nouveau jeu de données appelé iHOPE. Ils ont pris 174 enregistrements de séances de thérapie provenant d'une collection publique, ont nettoyé l'audio pour s'assurer que chaque mot soit entendu, puis ont demandé à une équipe de psychiatres et de psychologues experts de rédiger des notes parfaites, de référence, pour chaque séance en utilisant le nouveau format iCARE. Cela a créé un point de comparaison, un ensemble de réponses idéales contre lesquelles toute machine pourrait être mesurée.
Les chercheurs ont ensuite mis à l'épreuve onze modèles de langage de grande taille différents. Ces modèles, qui sont les puissants programmes informatiques derrière les chatbots modernes, ont été invités à écouter les enregistrements de thérapie et à rédiger les notes iCARE. Ils ont testé les modèles de deux manières : premièrement, en leur donnant les enregistrements sans aucun exemple à suivre, et deuxièmement, en leur montrant un exemple de note parfaite avant de leur demander de rédiger les autres. Les résultats ont révélé une division claire entre les différents types d'IA. Les modèles à code source fermé, développés par de grandes entreprises technologiques et non ouverts à la modification par le public, ont été systématiquement plus performants que les modèles en code source ouvert, qui sont construits par la communauté publique. Un modèle spécifique, GPT-4o-mini, a obtenu les scores les plus élevés sur les tests informatiques standards qui mesurent la proximité entre les mots de la machine et ceux des experts humains. Un autre modèle, Gemini Pro, a montré une force particulière dans l'identification des marqueurs de crise, tels que les signes de risque de suicide ou d'abus de substances, qui sont des détails de sécurité critiques en thérapie.
Cependant, l'histoire est devenue plus intéressante lorsque les chercheurs ont demandé à des experts humains de juger les notes, plutôt que de s'appuyer sur des scores informatiques. Ils ont fait appel à six professionnels de la santé mentale pour lire les notes à l'aveugle, sans savoir quelle IA les avait rédigées, et pour les évaluer selon cinq qualités clés : la fiabilité, la pertinence, l'exactitude, l'exhaustivité et la clarté. Les experts humains ont constaté que, bien que les meilleurs modèles informatiques soient bons, ils luttaient encore avec la fluidité du temps. Les machines échouaient souvent à distinguer correctement ce qui s'était passé lors d'une séance passée de ce qui était prévu pour la séance suivante, un aspect fondamental de la thérapie qui nécessite une compréhension d'une chronologie. Étonnamment, les experts humains ont préféré les notes d'un modèle plus petit et en code source ouvert, appelé Mistral, aux modèles commerciaux plus puissants. En fait, Mistral était le seul système à avoir obtenu un score légèrement supérieur aux notes écrites par les humains dans une catégorie spécifique : l'exhaustivité. Cette découverte suggère que la façon dont nous mesurons actuellement le succès de l'IA avec des algorithmes informatiques ne correspond pas toujours à ce dont un clinicien humain a réellement besoin. Les modèles commerciaux étaient excellents pour correspondre à des phrases spécifiques, mais le plus petit modèle semblait capturer l'essence clinique de la séance plus efficacement aux yeux des experts.
L'étude conclut que si l'intelligence artificielle est prête à assister les thérapeutes, elle n'est pas encore prête à les remplacer. Les chercheurs ont trouvé que la meilleure voie à suivre est une voie collaborative, où l'IA gère le gros du travail de rédaction des notes détaillées, permettant au thérapeute de réviser, d'affiner et de finaliser le dossier. Cette approche pourrait libérer un temps précieux pour les cliniciens afin qu'ils puissent se concenter sur le patient plutôt que sur le clavier. L'équipe a souligné que leur travail n'est pas une solution finale mais une fondation. Ils ont mis leur nouveau cadre, leur jeu de données de notes d'experts et leur méthode d'évaluation à la disposition d'autres scientifiques afin que le domaine puisse continuer à progresser. L'objectif ultime est de combler l'écart entre le besoin massif de soins de santé mentale et le nombre limité de thérapeutes disponibles, en utilisant la technologie pour soutenir, plutôt que pour substituer, la connexion humaine qui est au cœur de la guérison.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.