← Derniers articles
💻 computer science

Clinical explainable AI evaluations prioritize trust over effective human oversight: a scoping review

Cette revue de portée de 49 études sur l'XAI clinique révèle que les évaluations privilégient massivement la confiance et les perceptions des utilisateurs au détriment des capacités de surveillance critique telles que la détection des défaillances et des biais, s'appuyant lourdement sur des mesures non validées et évaluant rarement la performance sur des systèmes déployés.

Auteurs originaux : Nicolas Frey, Louis Agha-Mir-Salim, Linn Renner, Stefan Haufe, Lily Voge, Felix Balzer

Publié 2026-09-24
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nicolas Frey, Louis Agha-Mir-Salim, Linn Renner, Stefan Haufe, Lily Voge, Felix Balzer

Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans les hôpitaux modernes, les médecins s'appuient de plus en plus sur des programmes informatiques pour aider à diagnostiquer des maladies et suggérer des traitements. Ces outils, construits sur des modèles mathématiques complexes, peuvent traiter de vastes quantités de données de patients plus rapidement que n'importe quel humain. Cependant, ces modèles fonctionnent souvent comme une « boîte noire », offrant une recommandation sans expliquer comment ils sont parvenus à cette conclusion. Pour remédier à cette opacité, les chercheurs ont développé un domaine appelé l'intelligence artificielle explicable. L'objectif est simple : fournir le raisonnement de l'ordinateur aux côtés de sa réponse, tout comme un médecin montrant son raisonnement sur un tableau noir. L'espoir est qu'en voyant la logique derrière une suggestion, un clinicien puisse décider s'il peut lui faire confiance, repérer une erreur ou l'ignorer si le conseil est dangereux. Cette capacité de vérifier et de corriger la machine est connue sous le nom de supervision humaine, et elle est considérée comme essentielle pour la sécurité dans les décisions médicales à enjeux élevés.

Un nouvel examen de la recherche scientifique suggère toutefois que la manière actuelle dont nous testons ces explications omet la partie la plus critique du travail. Nicolas Frey et ses collègues de la Charité – Universitätsmedizin Berlin ont examiné quarante-neuf études publiées entre 2015 et le début de 2026 qui testaient comment les médecins et les internes en médecine interagissent avec ces outils explicables. Les chercheurs voulaient savoir si les études prouvaient réellement que les explications aident les cliniciens à détecter les erreurs, ou si elles mesuraient simplement à quel point les cliniciens appréciaient l'apparence de l'explication. Ils ont constaté un écart significatif. Bien que les études demandent fréquemment aux médecins s'ils trouvent les explications dignes de confiance ou faciles à comprendre, elles ne testaient presque jamais si ces explications aidaient réellement les médecins à identifier quand l'ordinateur se trompait.

La revue a cartographié précisément ce que mesuraient ces quarante-neuf études. Les résultats ont montré une focalisation massive sur les sentiments et les perceptions. Dans quarante-deux des études, les chercheurs ont demandé aux participants à quel point ils faisaient confiance au système. Dans trente-quatre études, ils ont demandé si les explications étaient utiles, et dans trente-trois, ils ont demandé si elles étaient compréhensibles. Ces questions reposent sur l'auto-évaluation, où un médecin dit simplement : « Je me sens confiant dans cette réponse ». Les chercheurs ont constaté qu'une infime fraction des études allait plus loin pour tester le comportement réel. Seulement trois études ont testé si un médecin pouvait repérer un échec spécifique dans la logique de l'ordinateur, et une seule étude a testé si un médecin pouvait reconnaître un biais systématique dans les conseils du système. Plus frappant encore, aucune étude n'a testé si un médecin pouvait prédire correctement ce que l'ordinateur ferait dans une nouvelle situation, une compétence qui serait fondamentale pour une véritable compréhension.

Les preuves suggèrent que le paysage actuel de la recherche privilégie le sentiment de sécurité sur la mécanique de la sécurité. La plupart des études se sont déroulées dans des environnements contrôlés et simulés plutôt que dans de véritables hôpitaux chargés. Dans ces simulations, on montrait souvent aux médecins des conseils corrects et incorrects de l'ordinateur, mais les études mesuraient rarement si les médecins rejetaient avec succès le mauvais conseil. Au lieu de cela, elles mesuraient souvent si les médecins étaient d'accord avec l'ordinateur, sans savoir si cet accord portait sur une réponse juste ou fausse. Les chercheurs ont noté qu'un médecin peut déclarer une grande confiance en un système et pourtant suivre aveuglément une recommandation dangereuse, ou qu'il peut se sentir confus par une explication mais prendre la bonne décision en ignorant l'ordinateur. Parce que les études se sont concentrées si lourdement sur le premier cas — ce que les médecins disaient ressentir — elles ont fourni peu de preuves que les explications aidaient réellement les médecins à détecter les erreurs lorsque l'ordinateur se trompait.

De plus, les méthodes utilisées pour recueillir ces données étaient souvent faibles. Plus de la moitié des mesures reposaient sur des questions ad hoc ou des échelles non vérifiées plutôt que sur des outils établis et scientifiquement testés. Seule une étude sur deux cent cinquante-trois points de données de la revue utilisait un instrument validé, qui est un test standard et fiable pour des éléments tels que la confiance ou la satisfaction. La vaste majorité des données provenaient de simples sondages où les médecins évaluaient leur expérience sur une échelle. La revue a également souligné que seulement deux des quarante-neuf études portaient sur des systèmes qui étaient réellement déployés et utilisés dans des contextes cliniques réels. Le reste étaient des expériences où le comportement de l'ordinateur était contrôlé par les chercheurs, ce qui signifie que nous ne savons pas si les explications tiennent la route lorsqu'un médecin est soumis à la pression du temps, fatigué ou confronté à un cas de patient complexe.

Les auteurs soutiennent que ce déséquilibre crée un faux sentiment de sécurité. Ils soulignent que la confiance est une attitude, tandis que la supervision est une action. Un médecin peut se sentir très confiant envers un système mais échouer tout de même à rejeter une recommandation erronée. Pour savoir si une explication est réellement sûre, les chercheurs doivent tester des comportements spécifiques : Le médecin peut-il prédire ce que l'ordinateur dira ensuite ? Peut-il repérer une erreur quand l'ordinateur se trompe ? Peut-il reconnaître quand l'ordinateur est biaisé contre un certain groupe de patients ? La revue a constaté que ces compétences spécifiques, critiques pour la sécurité, étaient presque totalement absentes de la littérature actuelle. Les études nous ont montré comment les explications sont ressenties par un clinicien, mais elles n'ont pas montré si ces explications l'aident à mieux faire son travail lorsque la machine échoue.

L'article conclut que pour que l'intelligence artificielle explicable soit véritablement utile et sûre, la manière de la tester doit changer. Les études futures devront aller au-delà de demander aux médecins ce qu'ils ressentent et commencer à tester ce qu'ils font réellement. Cela signifie concevoir des expériences où la justesse de l'ordinateur est manipulée pour voir si les médecins peuvent distinguer le vrai du faux. Cela signifie utiliser des outils éprouvés et fiables pour mesurer les attitudes plutôt que de deviner à partir de simples sondages. Enfin, cela signifie tester ces systèmes dans le monde réel, sur la durée, pour voir si les explications continuent de soutenir une bonne prise de décision lorsque les enjeux sont élevés et que la pression est réelle. Tant que ces changements n'auront pas lieu, la communauté médicale aura une image claire de ce que les médecins aiment dans les explications, mais très peu de preuves que ces explications protègent réellement les patients.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →