How Best to Explain Machine Learning Models to Clinicians: A User Study of Explanation Types
Cette étude impliquant 39 cliniciens démontre que, bien que les explications basées sur l'attribution améliorent de manière la plus significative la confiance et la compréhension des prédictions de l'apprentissage automatique en milieu clinique, près de la moitié des participants préfèrent visualiser plusieurs types d'explications, ce qui suggère que les futures implémentations devraient prioriser les méthodes d'attribution tout en offrant des formats diversifiés adaptés à des rôles cliniques spécifiques.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète
Imaginez que vous ayez construit un robot médecin super intelligent capable d'analyser les données d'un patient et de prédire s'il est sur le point de tomber malade. Mais il y a un hic : le robot est une « boîte noire ». Il vous donne une réponse, mais il ne vous dit pas pourquoi. C'est comme une boule de cristal qui dirait « Oui, danger ! » mais qui refuserait d'expliquer quelle partie de sa boule de cristal lui a permis de voir ce danger.
Pour corriger cela, les chercheurs de cet article ont décidé de tester trois manières différentes d'expliquer le raisonnement du robot à de vrais professionnels de santé (infirmiers et médecins). Ils voulaient voir quel style d'explication permettait aux médecins de faire davantage confiance au robot, de mieux comprendre et de réellement changer d'avis sur l'état du patient.
Les trois styles de « lampe torche »
L'équipe a testé trois façons d'éclairer la décision du robot :
- La lampe torche d'attribution (Le « Scorecard » ou la « Fiche de score ») : Cette méthode attribue un score à chaque donnée individuelle. C'est comme un professeur qui corrige un examen et qui souligne précisément quelles réponses étaient bonnes ou mauvaises et combien de points chacune valait. Elle dit : « Votre fréquence cardiaque était élevée, et cela a ajouté 4,5 points au score de risque. »
- La lampe torche contrefactuelle (Le « Et si ? ») : Celle-ci joue au jeu du « et si ». Elle montre au médecin comment modifier les chiffres du patient pour obtenir un résultat différent. C'est comme un code de triche dans un jeu vidéo qui dirait : « Si vous baissez la fréquence cardiaque et augmentez la pression artérielle, le robot arrêtera de hurler "Danger !" »
- La lampe torche basée sur des règles (La « Recette ») : Cette méthode donne une liste de règles simples, comme une recette de cuisine. Elle dit : « SI le lactate est élevé ET QUE la respiration est rapide, ALORS le robot prédit un danger. »
La grande révélation : Le Scorecard gagne
Après avoir présenté ces trois styles à 39 médecins et infirmiers, les résultats ont été sans appel. Le Scorecard (la Fiche de score) est le grand vainqueur.
- Confiance : Lorsque les médecins voyaient la fiche de score, ils faisaient davantage confiance à la prédiction du robot que lorsqu'ils voyaient les deux autres styles.
- Compréhension : La fiche de score était la plus facile à comprendre. Les médecins avaient le sentiment de vraiment « saisir » le concept.
- Influence : C'est la partie la plus importante. La fiche de score a réellement changé leur perception de ce qui était important. Lorsqu'ils voyaient la fiche de score, ils étaient plus susceptibles de dire : « Oh, j'avais tort sur ce qui causait le risque ; le robot pointe vers autre chose. »
L'article suggère que bien que les deux autres méthodes (le « Et si ? » et la « Recette ») aient été utiles, elles n'avaient pas le même impact. Le style « Et si ? » a été le moins apprécié dans les commentaires en texte libre, de nombreux médecins le trouvant déroutant ou moins utile.
Médecins vs Infirmiers : Une histoire de flux de travail
Voici un tournant intéressant : les deux types de professionnels de santé ont réagi différemment.
- Les Médecins : Avant de voir les explications, ils étaient déjà assez intéressés par elles. Mais après avoir utilisé la fiche de score, leur intérêt a augmenté. C'est comme s'ils s'étaient dit : « Je savais que c'était important, mais maintenant je vois comment cela m'aide à prendre mes grandes décisions. »
- Les Infirmiers : Ils pensaient que les explications étaient importantes dès le départ, mais les voir n'a pas vraiment changé leur avis. L'article suggère que cela pourrait être dû au fait que les infirmiers suivent souvent des protocoles stricts, étape par étape (comme une liste de contrôle), de sorte qu'une explication complexe ne modifie pas leur flux de travail autant qu'elle le ferait pour un médecin qui pose un diagnostic à partir de zéro.
Ce que les médecins voulaient
L'étude a également demandé aux médecins ce qu'ils préféraient voir sur leurs écrans.
- Plus, c'est mieux (Mais pas trop) : Près de la moitié des médecins (46,2 %) ont déclaré vouloir voir les trois types d'explications en même temps. Ils ne voulaient pas choisir un seul type ; ils voulaient la fiche de score, le « et si ? » et la recette, tous ensemble, pour avoir une vue d'ensemble.
- Soyez concis : En ce qui concerne les détails, les médecins voulaient une version « courte et efficace ». Environ 77 % d'entre eux voulaient voir seulement les quelques caractéristiques les plus importantes sur la fiche de score, plutôt qu'une longue liste de tout. De même, 84 % voulaient une liste de règles courte, et non une recette de la longueur d'un roman.
Ce que l'article ne dit PAS
Il est important de savoir ce que cette étude n'a pas prouvé. Les chercheurs n'ont pas affirmé que ces explications rendent le robot médecin parfait ou qu'elles garantissent de meilleurs résultats pour les patients dans le monde réel. Ils ont seulement mesuré ce que les médecins ont dit et ont pensé lors d'une enquête. Ils n'ont pas non plus testé ces méthodes sur tous les types de robots médecins possibles ou sur tous les types d'hôpitaux. Les résultats sont basés sur un robot spécifique entraîné sur des données de séries temporelles (comme les constantes vitales d'un patient au fil du temps) et sur un groupe spécifique de 39 médecins et infirmiers issus de deux universités.
L'essentiel à retenir
Si vous construisez un robot médecin pour un hôpital, ne donnez pas simplement à l'humain une seule explication. L'article suggère que vous devriez donner la priorité à la Fiche de score d'attribution car elle renforce le plus la confiance et la compréhension. Cependant, puisque de nombreux médecins veulent tout voir, vous devriez probablement présenter la Fiche de score plus les autres styles, mais en gardant les listes courtes et faciles à lire. Et n'oubliez pas que si vous vous adressez à un infirmier, l'explication pourrait moins modifier son flux de travail qu'un médecin, alors adaptez votre approche en conséquence.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.