Performance of a domain-specific large language model in answering patient questions in psychiatry
Hoewel het domeinspecifieke LLM "MIND" algemene chatbots overtrof op het gebied van objectieve rubricscores en volledigheid, gaven door de staat erkende psychiaters uiteindelijk de voorkeur aan de door ChatGPT gegenereerde antwoorden, ondanks de superieure klinische getrouwheidstraining van MIND.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het moderne landschap van de gezondheidszorg wenden patiënten zich steeds vaker tot het internet voor antwoorden over hun medicatie, op zoek naar duidelijkheid over hoe een medicijn werkt, welke bijwerkingen ze kunnen verwachten of hoe het hun dagelijks leven kan beïnvloeden. Hoewel grote taalmodellen — krachtige computerprogramma's die in staat zijn om mensachtige tekst te genereren — veelbelovend zijn gebleken bij het beantwoorden van medische vragen, worstelen ze vaak met de specifieke eisen van de klinische zorg. Deze algemene hulpmiddelen kunnen vloeiende en informatieve antwoorden produceren, maar missen soms de noodzakelijke nuance, laten cruciale veiligheidswaarschuwingen weg of verzinnen feiten die een kwetsbaar persoon kunnen misleiden. In de psychiatrie, waar publieke informatie al inconsistent is en therapietrouw een grote uitdaging vormt, is het risico op het ontvangen van onjuist advies bijzonder hoog. Artsen hebben vaak slechts vijftien tot twintig minuten per consult, waardoor er weinig tijd overblijft om elke vraag van een patiënt te beantwoorden, wat ertoe leidt dat velen op zoek gaan naar informatie via ongeverifieerde online bronnen. De centrale vraag voor onderzoekers is geweest of een gespecialiseerd computermodel, dat uitsluitend getraind is op betrouwbare medische bronnen, de nauwkeurige, veilige en gepersonaliseerde begeleiding kan bieden die patiënten nodig hebben zonder de fouten die gebruikelijk zijn bij algemene chatbots.
Om dit te onderzoeken, ontwikkelde een team van onderzoekers van het Lurie Children's Hospital in Chicago een gespecialiseerd kunstmatig intelligentiesysteem dat zij MIND noemden. In tegen tegenstelling tot algemene chatbots, die getraind zijn op enorme, ongecureerde delen van het internet, werd MIND gebouwd met een veel nauwere en veiligere aanpak. De onderzoekers voedden het systeem uitsluitend met een collectie educatief materiaal voor patiënten afkomstig van zeven gezaghebbende bronnen, waaronder de American Psychiatric Association, de Food and Drug Administration en de National Library of Medicine. Het systeem werd ontworpen met strikte veiligheidsprincipes: het werd geprogrammeerd om antwoorden uitsluitend te halen uit deze geverifieerde documenten, om bronnen te citeren en om duidelijk aan te geven wanneer een patiënt een arts moet raadplegen in plaats van op de computer te vertroun. De onderzoekers testten dit nieuwe instrument tegenover twee andere bekende systemen: een veelgebruikte algemene chatbot en een platform voor medische besluitvorming dat ontworpen is voor artsen maar niet voor het publiek. Ze stelden alle drie de systemen vijftig veelvoorkomende vragen over een specifiek antidepressivum genaamd escitalopram, variërend van hoe het medicijn werkt en hoe men het inneemt, tot de bijwerkingen en de veiligheid voor speciale groepen zoals zwangere vrouwen of ouderen.
De resultaten van de vergelijking toonden een duidelijk voordeel voor het gespecialiseerde model wat betreft betrouwbaarheid en volledigheid. Wanneer de reacties werden geëvalueerd door een gecomputeriseerde rubric die controleerde op nauwkeurigheid, helderheid en veiligheid, presteerde het MIND-systeem beter dan zowel de algemene chatbot als het op artsen gerichte platform in elke categorie. Het bood vollediger antwoorden, erkende onzekerheid effectiever en wist beter wanneer het een patiënt naar een arts moest verwijzen. Het verhaal werd echter genuanceerder toen de onderzoekers tien gecertificeerde psychiaters vroegen om de antwoorden te beoordelen. Hoewel de artsen het erover eens waren dat het gespecialiseerde model veiliger en vollediger was, vonden zij dat de algemene chatbot iets nauwkeuriger was in zijn specifieke beweringen. Misschien nog verrassender was dat de psychiaters een sterke voorkeur hadden voor de antwoorden van de algemene chatbot boven die van het gespecialiseerde model. Deze voorkeur was vooral sterk onder jongere artsen in het begin van hun carrière. De onderzoekers merkten op dat de algemene chatbot de neiging had om kortere, krachtigere antwoorden te geven die directer aanvoelden, terwijl het gespecialiseerde model langere, meer gedetailleerde antwoorden gaf die soms informatie bevatten die de artsen als onnodig of licht onnauwkeurig beschouwden in de context van een korte samenvatting.
De studie benadrukt een complexe afweging in het ontwerp van medische kunstmatige intelligentie. Het gespecialiseerde model slaagde in zijn primaire doel om geworteld te zijn in geverifieerde feiten en de hallucinaties die gebruikelijk zijn bij algemene systemen te vermijden, maar het worstelde ermee om de beknoptheid en stijl te evenaren die menselijke experts het meest aanspraken. De onderzoekers observeerden dat naarmate de antwoorden gedetailleerder en vollediger werden, ze soms als minder nauwkeurig werden beoordeeld, wat suggereert dat het toevoegen van noodzakelijke context een antwoord minder precies kan doen aanvoelen voor een menselijke lezer. Bovendien kon het gespecialiseerde model niet elke vraag beantwoorden; voor twaalf van de vijftig vragen gaf het correct aan dat het niet over de informatie beschikte, terwijl de andere systemen probeerden ze allemaal te beantwoorden. Deze weigering om te gokken was een bewuste veiligheidsfunctie, maar het betekende ook dat het instrument minder veelzijdig was dan zijn concurrenten. De psychiaters merkten ook op dat de antwoorden van het gespecialiseerde model geschreven waren op een hoger taalniveau dan die van de algemene chatbot, een reflectie van het feit dat de brondocumenten zelf geschreven waren op een complex niveau, ver boven het aanbevolen leesniveau voor patiëntenmateriaal.
Uiteindelijk suggereert het onderzoek dat hoewel een gespecialiseerd model met een beperkt corpus een veiligere en volledigere basis kan bieden voor patiënteneducatie dan een algemene chatbot, het nog niet een perfect vervanging is voor menselijk oordeel of de geprefereerde communicatiestijl van clinici. Het gespecialiseerde systeem demonstreerde dat het mogelijk is om een kunstmatige intelligentie te bouwen die strikt vasthoudt aan medisch bewijs en gevaarlijke fouten vermijdt, maar het onthulde ook dat het bereiken van een hoge mate van nauwkeurigheid en volledigheid soms ten koste kan gaan van leesbaarheid en gebruikersvoorkeur. De auteurs concluderen dat hun werk dient als een blauwdruk voor het bouwen van toekomstige instrumenten die de psychiatrische zorg kunnen verbeteren, maar benadrukken dat deze systemen verdere optimalisatie vereisen om een balans te vinden tussen veiligheid, nauwkeurigheid en de manier waarop mensen daadwerkelijk informatie willen ontvangen. De weg vooruit houdt in dat deze modellen worden verfijnd om even betrouwbaar te zijn als het gespecialiseerde systeem, maar even helder en boeiend als de algemene chatbots, om ervoor te zorgen dat patiënten de hoogwaardige, op bewijs gebaseerde begeleiding krijgen die ze nodig hebben zonder verwarring of vertraging.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.