ChainTrust-LLM: Secure and Auditable Hallucination Mitigation in Medical LLMs Using Blockchain and Expert Feedback
Cet article présente ChainTrust-LLM, un nouveau cadre qui intègre le feedback d'experts à un registre blockchain basé sur un graphe orienté acyclique (DAG) pour détecter et atténuer les hallucinations dans les modèles de langage médicaux de grande taille, atteignant une réduction de 64,8 % des taux d'erreur tout en garantissant des interactions sécurisées et auditables avec une latence minimale.
Article original sous licence CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un monde où vous pouvez discuter avec un robot bibliothécaire super intelligent qui a lu tous les manuels de médecine jamais écrits. Ce robot, connu sous le nom de Modèle de Langage Étendu (LLM), est incroyable pour discuter, répondre à des questions et même aider les médecins à expliquer les choses aux patients. Mais il y a un piège : parfois, ce robot devient un peu trop sûr de lui et invente des choses. Il pourrait vous dire qu'un certain médicament guérit une maladie qu'il ne guérit pas, ou qu'un symptôme signifie quelque chose qu'il ne signifie pas. Dans le monde de la médecine, ces faits inventés sont appelés « hallucinations », et ils sont dangereux car ils peuvent conduire à de mauvaises décisions.
Pour corriger cela, les scientifiques essaient de construire un système qui agit comme un éditeur strict. Ils veulent un moyen de vérifier le travail du robot, de tenir un registre permanent de chaque correction et de s'assurer que le robot apprend de ses erreurs sans les oublier. C'est là que l'idée de « confiance » intervient. Si le robot répond correctement à une question, nous lui faisons davantage confiance ; s'il se trompe, nous lui faisons moins confiance. Mais garder une trace de toute cette confiance et s'assurer que personne ne peut modifier secrètement les registres est un défi énorme. C'est pourquoi les chercheurs étudient la combinaison d'experts humains avec un type spécial de registre numérique appelé « blockchain », qui est comme un carnet public que personne ne peut effacer ou altérer une fois que quelque chose y est écrit.
C'est exactement ce dont traite l'article « ChainTrust-LLM ». Les chercheurs, dirigés par Muhammad Ismail Mohmand et son équipe, voulaient résoudre le problème des hallucinations médicales, spécifiquement pour une condition appelée hypothyroïdie (un problème de la glande thyroïde). Ils ont remarqué que lorsque les robots parlent de symptômes comme la fatigue, la prise de poids ou des troubles du cycle menstruel, ils se trompent souvent sur les détails. Pour corriger cela, ils ont construit un nouveau cadre appelé ChainTrust-LLM. Voyez cela comme un filet de sécurité de haute technologie qui enregistre les erreurs et les corrections du robot de manière sécurisée, créant une piste auditable pour améliorer les performances futures.
Voici comment leur système fonctionne, en utilisant une histoire simple : Imaginez que le robot médical est un étudiant passant un examen. Chaque fois qu'il répond à une question, trois médecins de la vie réelle (des experts) vérifient la réponse. Si l'étudiant a raison, ils donnent un pouce levé ; s'il a tort, ils donnent un pouce vers le bas et écrivent la bonne réponse. Mais au lieu de simplement garder ces notes dans un tas de papiers désordonnés, ChainTrust-LLM écrit chaque note et chaque correction dans un « journal numérique » qui utilise la blockchain. Ce journal est immuable, ce qui signifie qu'une fois qu'une erreur est enregistrée, elle y reste pour toujours comme preuve.
Le système possède également une règle spéciale concernant le temps. Si le robot répond correctement à une question aujourd'hui, son « score de confiance » augmente. Mais s'il n'est pas vérifié pendant longtemps, ce score de confiance diminue lentement, comme une batterie qui se décharge. Cela garantit que le système reste à jour et ne repose pas sur des informations anciennes ou potentiellement obsolètes. Lorsque le robot fait une erreur, le système utilise un « détecteur de risque » pour repérer le mensonge en fonction de la différence entre la réponse et la vérité, puis il enregistre l'événement de manière sécurisée.
L'équipe a testé cette idée sur trois robots médicaux célèbres : GPT-4, MedPaLM et Claude. Ils leur ont posé 300 questions différentes sur les symptômes, les traitements et les tests de laboratoire de l'hypothyroïdie. Avant l'utilisation de ChainTrust-LLM, ces robots faisaient des erreurs assez souvent. Par exemple, GPT-4 hallucinait (inventait des faits) environ 23,1 % du temps. Après l'application du nouveau système, ce chiffre a chuté de manière spectaculaire pour atteindre 8,5 %. Cela représente une réduction d'environ 63 %. Pour les autres robots, les améliorations étaient tout aussi importantes, avec des taux d'erreur chutant jusqu'à 64,8 %.
Non seulement les robots faisaient moins d'erreurs, mais le système devenait aussi bien meilleur pour savoir quand il avait raison ou tort. La « précision de la calibration de la confiance » — qui est essentiellement la mesure de la correspondance entre la confiance du robot et la réalité — a bondi d'environ 75 % à plus de 91 % pour GPT-4. Les experts qui vérifiaient les réponses étaient également beaucoup plus souvent d'accord entre eux, leur score d'accord passant de 0,65 à 0,87. Cela signifie que le système ne faisait pas que corriger les erreurs ; il créait une compréhension partagée et fiable de la vérité.
L'un des aspects les plus impressionnants de cette recherche est sa rapidité. Même avec toute la vérification supplémentaire et l'enregistrement sur la blockchain, le système n'a ajouté qu'un délai infime. En moyenne, il n'a fallu que 211 millisecondes (soit moins d'un quart de seconde) pour enregistrer une transaction. Cela suggère qu'un tel système pourrait réellement être utilisé dans les hôpitaux sans ralentir le travail.
L'article conclut que ChainTrust-LLM est un moyen robuste et sécurisé de rendre l'IA médicale plus sûre. En combinant des experts humains, un système de confiance basé sur le temps et un enregistrement immuable sur blockchain, ils ont créé un cadre qui réduit considérablement les mensonges dangereux dans les conseils médicaux. Bien que l'étude se soit concentrée spécifiquement sur les symptômes de l'hypothyroïdie comme la fatigue et la prise de poids, la méthode suggère une voie à suivre pour rendre l'IA digne de confiance dans d'autres domaines médicaux. Ce n'est pas une baguette magique qui répare tout instantanément, mais c'est une étape très prometteuse vers un avenir où nous pourrons faire confiance à nos assistants médicaux numériques.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.