ChainTrust-LLM: Secure and Auditable Hallucination Mitigation in Medical LLMs Using Blockchain and Expert Feedback
Dit artikel introduceert ChainTrust-LLM, een nieuw framework dat deskundige feedback integreert met een op een DAG gebaseerd blockchain-ledger om hallucinaties in medische Large Language Models te detecteren en te mitigeren, waarbij een reductie van 64,8% in foutpercentages wordt bereikt terwijl veilige, controleerbare interacties met minimale latentie worden gewaarborgd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin je kunt praten met een superintelligente robotbibliothecaris die elk medisch tekstboek ooit geschreven heeft gelezen. Deze robot, bekend als een Large Language Model (LLM), is geweldig in chatten, vragen beantwoorden en zelfs artsen helpen bij het uitleggen van zaken aan patiënten. Maar hier zit een addertje onder het gras: soms wordt deze robot een beetje te zelfverzekerd en verzint hij dingen. Hij kan je vertellen dat een bepaald medicijn een ziekte geneest die het niet geneest, of dat een symptoom iets betekent wat het niet is. In de wereld van de geneeskunde worden deze verzonnen feiten "hallucinaties" genoemd, en ze zijn gevaarlijk omdat ze kunnen leiden tot slechte beslissingen.
Om dit op te lossen, proberen wetenschappers een systeem te bouwen dat werkt als een strenge redacteur. Ze willen een manier hebben om het werk van de robot te controleren, een permanent verslag van elke correctie bij te houden, en ervoor te zorgen dat de robot leert van zijn fouten zonder ze te vergeten. Hier komt het idee van "vertrouwen" om de hoek kijken. Als de robot een vraag goed beantwoordt, vertrouwen we hem meer; als hij het fout heeft, vertrouwen we hem minder. Maar het bijhouden van al dit vertrouwen en ervoor zorgen dat niemand de records stiekem kan aanpassen, is een enorme uitdaging. Daarom kijken onderzoekers naar het combineren van menselijke experts met een speciaal soort digitaal grootboek genaamd "blockchain", wat een soort openbaar dagboek is dat niemand kan wissen of wijzigen zodra er iets in is geschreven.
Dit is precies waar het artikel "ChainTrust-LLM" over gaat. De onderzoekers, onder leiding van Muhammad Ismail Mohmand en zijn team, wilden het probleem van medische hallucinaties oplossen, specifijk voor een aandoening genaamd hypothyreoïdie (een probleem met de schildklier). Ze merkten op dat wanneer robots praten over symptomen zoals vermoeidheid, gewichtstoename of problemen met de menstruatiecyclus, ze de details vaak verkeerd krijgen. Om dit op te lossen, hebben ze een nieuw framework gebouwd genaamd ChainTrust-LLM. Denk aan dit als een hoogtechnologisch vangnet dat de fouten van de robot en de correcties veilig vastlegt, waardoor er een controleerbaar spoor ontstaat om toekomstige prestaties te verbeteren.
Zo werkt hun systeem, gebruikmakend van een simpel verhaal: Stel je voor dat de medische robot een student is die een toets maakt. Elke keer als hij een vraag beantwoordt, controleren drie echte artsen (experts) het antwoord. Als de student het goed heeft, geven ze een duim omhoog; als hij het fout heeft, geven ze een duim omlaag en schrijven ze het juiste antwoord op. Maar in plaats van deze aantekeningen alleen in een rommelige stapel papier te bewaren, schrijft ChainTrust-LLM elke enkele beoordeling en correctie in een "digitaal dagboek" dat gebruikmaakt van blockchain. Dit dagboek is onveranderlijk, wat betekent dat zodra een fout is vastgelegd, deze voor altijd blijft staan als bewijs.
Het systeem heeft ook een speciale regel over tijd. Als de robot vandaag een vraag goed beantwoordt, gaat zijn "vertrouwensscore" omhoog. Maar als hij een lange tijd niet is gecontroleerd, vervaagt die vertrouwensscore langzaam, zoals een batterij die leegloopt. Dit zorgt ervoor dat het systeem fris blijft en niet vertrouwt op oude, potentieel verouderde informatie. Wanneer de robot een fout maakt, gebruikt het systeem een "risicodetector" om de leugen op te sporen op basis van hoe sterk het antwoord afwijkt van de waarheid, en legt vervolgens het hele evenement veilig vast.
Het team testte dit idee op drie beroemde medische robots: GPT-4, MedPaLM en Claude. Ze stelden hen 300 verschillende vragen over symptomen, behandelingen en laboratoriumtests van hypothyreoïdie. Voordat het nieuwe systeem werd toegepast, maakten deze robots nogal vaak fouten. Bijvoorbeeld, GPT-4 hallucineerde (verzon de feiten) in 23,1% van de gevallen. Nadat het nieuwe systeem werd toegepast, daalde dat aantal drastisch naar 8,5%. Dat is een vermindering van ongeveer 63%. Voor de andere robots waren de verbeteringen net zo groot, met foutmarges die met wel 64,8% daalden.
Niet alleen maakten de robots minder fouten, maar het systeem werd ook veel beter in weten wanneer het gelijk had of niet. De "vertrouwenskalibratienauwkeurigheid" — wat in feite is hoe goed het zelfvertrouwen van de robot overeenkomt met de werkelijkheid — sprong voor GPT-4 van ongeveer 75% naar meer dan 91%. De experts die de antwoorden controleerden, stemden ook veel vaker met elkaar overeen, waarbij hun overeenstemmingsscore steeg van 0,65 naar 0,87. Dit betekent dat het systeem niet alleen fouten herstelde, maar ook een betrouwbaar, gedeeld begrip van de waarheid creëerde.
Een van de coolste onderdelen van dit onderzoek is hoe snel het werkt. Zelfs met alle extra controles en de blockchain-registratie die plaatsvindt, voegde het systeem slechts een minimale vertraging toe. Gemiddeld duurde het slechts 211 milliseconden (dat is minder dan een kwart seconde) om een transactie te loggen. Dit suggereert dat een dergelijk systeem daadwerkelijk in ziekenhuizen gebruikt kan worden zonder de zaken te vertragen.
Het artikel concludeert dat ChainTrust-LLM een sterke, veilige manier is om medische AI veiliger te maken. Door menselijke experts te combineren met een tijdsgebonden vertrouwenssysteem en een onveranderlijk blockchain-record, hebben ze een framework gecreëerd dat gevaarlijke leugens in medisch advies aanzienlijk vermindert. Hoewel deze studie specifiek gericht was op symptomen van hypothyreoïdie zoals vermoeidheid en gewichtstoename, suggereert de methode een pad voorwaarts om AI betrouwbaar te maken in andere medische gebieden. Het is geen toverstaf die alles direct oplost, maar het is een zeer veelbelovende stap naar een toekomst waarin we onze digitale medische helpers kunnen vertrouwen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.