Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models
Cet article présente une évaluation à grande échelle de plus de 6 000 grands modèles de langage médicaux déployés sur le web, révélant des risques importants d'hallucinations, de violations des politiques et de failles de confidentialité, tout en introduisant de nouveaux cadres d'évaluation et un jeu de données pour orienter les futures améliorations de sécurité.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez le « App Store » d'internet pour l'IA, mais au lieu de jeux ou d'outils de productivité, il est rempli de milliers de médecins numériques. Ce sont des chatbots IA personnalisés (appelés MedGPT) que n'importe qui peut créer et publier pour donner des conseils médicaux, diagnostiquer des symptômes ou expliquer des traitements.
Le document que vous avez fourni est comme une vaste inspection sanitaire clandestine de ce marché numérique. Les chercheurs n'ont pas seulement examiné les médecins les mieux notés et les plus populaires ; ils ont audité plus de 6 000 d'entre eux pour vérifier s'ils sont sûrs, honnêtes, ou s'ils sont en réalité dangereux.
Voici ce qu'ils ont découvert, décomposé en concepts simples :
1. Le problème du « menteur confiant » (hallucinations)
Imaginez un guide touristique qui parle avec une confiance absolue mais invente des faits sur l'histoire. Dans le monde médical, cela s'appelle une hallucination.
- La découverte : Environ 25 % à 30 % de ces médecins IA « mentent » ou inventent des faits médicaux. Ils pourraient vous dire avec assurance de prendre un médicament dangereux ou d'ignorer un symptôme grave.
- La surprise : Vous pourriez penser que les médecins les plus populaires sont les plus sûrs. Mais l'étude a révélé que la popularité est un mauvais détecteur de mensonges. Les médecins IA « célèbres » étaient tout aussi susceptibles d'inventer des choses que les moins connus. En fait, les moins populaires étaient souvent encore pires.
- Le point aveugle de l'utilisateur : Les chercheurs ont constaté que les utilisateurs ne semblent pas remarquer ces mensonges. Si une IA donne une réponse fluide et confiante, les gens lui attribuent 5 étoiles, même si le conseil est médicalement erroné. C'est comme donner une note de 5 étoiles à un chef qui vous sert un repas apparemment délicieux mais empoisonné.
2. Le problème du « mauvais acteur » (abus de conception)
Certains de ces médecins IA ne sont pas juste accidentellement erronés ; ils sont conçus pour être risqués.
- La découverte : Près de 50 % des médecins IA présentaient des « signaux d'alerte » dans leur conception.
- La métaphore : Imaginez un propriétaire de restaurant qui affiche une pancarte disant « Nous sommes un hôpital » (même s'ils ne le sont pas), cache le menu et refuse de vous montrer d'où vient la nourriture.
- Les détails :
- Certains créateurs ont nommé leurs bots des choses comme « Diagnostic instantané du cancer » pour tromper les gens et les faire croire qu'ils sont de vrais médecins.
- Beaucoup de ces bots possèdent une fonctionnalité appelée « Actions » (qui leur permet de se connecter à des sites web externes), mais 57 % d'entre eux n'avaient pas de politique de confidentialité. C'est comme entrer dans une clinique où le médecin prélève votre échantillon de sang mais refuse de vous dire ce qu'il va en faire.
- Même lorsqu'ils avaient une politique de confidentialité, près de 70 % d'entre eux étaient défectueuses, vagues ou ne protégeaient pas réellement vos données.
3. Le duel « Open Source » contre « Vendu en magasin »
Les chercheurs ont également comparé ces médecins IA vendus en magasin à des versions « open source » (modèles que les développeurs partagent librement, comme un livre de recettes communautaire).
- Les médecins IA vendus en magasin (MedGPT) : Ils étaient généralement meilleurs pour sembler intelligents et précis (ils avaient plus souvent les faits exacts). Cependant, ils étaient moins stables — parfois ils donnaient une excellente réponse, et la prochaine fois que vous posiez la même question, ils donnaient une réponse totalement différente et confuse.
- Les versions Open Source : Elles étaient plus cohérentes (elles donnaient la même réponse à chaque fois), mais elles étaient moins précises sur les faits.
- La leçon : Aucun des deux types n'est parfait. Les versions « sophistiquées » sonnent mieux mais vacillent ; les versions « communautaires » sont stables mais peuvent se tromper sur les détails.
4. Les « signaux de confiance » sont brisés
Dans un magasin d'applications normal, si une application a de mauvaises critiques ou de faibles notes, vous l'évitez.
- La découverte : Dans ce magasin d'IA médicale, les notes et les critiques ne vous disent rien sur la sécurité.
- La métaphore : C'est comme un concessionnaire automobile où les voitures ayant fait le plus d'essais routiers et ayant les meilleures notes « 5 étoiles » sont en réalité celles dont les freins sont défectueux. Les chercheurs ont constaté que la fréquence à laquelle les gens parlaient à l'IA n'avait presque aucun lien avec le fait que l'IA disait ou non la vérité.
Le fond du problème
Le document conclut que nous ne pouvons pas faire confiance à ces médecins IA simplement parce qu'ils sont populaires ou parce qu'ils semblent confiants.
- Le système est brisé : La méthode actuelle de vérification de ces bots (en s'appuyant sur les avis des utilisateurs et les notes en étoiles) échoue.
- Le danger : Parce que les patients n'ont souvent pas de formation médicale, ils ne peuvent pas repérer quand l'IA ment ou quand le médecin « simule » une autorité.
- La solution : Nous avons besoin d'un nouveau type d'« inspecteur de santé » qui vérifie les faits de l'IA, sa conception et ses règles de confidentialité avant qu'elle ne soit autorisée à parler aux patients. Les chercheurs ont publié un nouvel ensemble de données et un ensemble d'outils pour aider à construire ces inspecteurs.
En bref : Le marché médical numérique est rempli de menteurs confiants et de conceptions risquées, et les « avis clients » ne nous aident pas à les repérer. Nous avons besoin de meilleurs contrôles de sécurité avant de laisser ces médecins IA pénétrer dans nos vies.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.