← Nieuwste papers
🤖 machine learning

Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops

Deze studie introduceert een "Trust but Verify"-multi-agent framework dat medische hallucinaties in Large Language Models aanzienlijk vermindert door middel van post-hoc adversariële auditing om gevaarlijke aanbevelingen van verboden farmaceutica te onderscheppen, waardoor de patiëntveiligheid boven vloeiende tekstgeneratie in de gezondheidszorg wordt geprioriteerd.

Oorspronkelijke auteurs: Muhammad Osama, Maheera Amjad, Zartasha Mustansar, Arslan Shaukat, Muhammad U. S. Khan

Gepubliceerd 2026-06-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Muhammad Osama, Maheera Amjad, Zartasha Mustansar, Arslan Shaukat, Muhammad U. S. Khan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Alwetende" Arts die het Nieuws is Vergeten

Stel je een briljante medische student voor die elk tekstboek dat ooit geschreven is, uit zijn hoofd heeft geleerd. Ze zijn ongelooflijk slim en kunnen bijna elke vraag beantwoorden. Echter, deze student heeft de afgelopen vijf jaar geen nieuws gelezen.

Als je hen vraagt: "Wat is het beste medicijn voor deze hoofdpijn?", kunnen ze vol vertrouwen een pil aanbevelen die in 2015 nog het perfecte antwoord was, maar die in 2020 door de overheid is verboden omdat het hartaanvallen veroorzaakt.

Dit is precies wat er gebeurt met huidige AI-artsen (Large Language Models). Ze zijn getraind op enorme hoeveelheden data, maar die data wordt oud. Wanneer ze naar medicijnen worden gevraagd, "hallucineren" ze vaak (verzinnen ze feiten of vertrouwen ze op verouderde informatie) en suggereren ze medicijnen die niet langer veilig of legaal zijn.

De Oplossing: Het "Trust but Verify" Team

De onderzoekers vroegen zich af: Kunnen we dit oplossen zonder de AI vanaf nul opnieuw op te bouwen?

Hun antwoord is een nieuw systeem genaamd "Trust but Verify" (Vertrouw, maar controleer). In plaats van één AI de definitieve beslissing te laten nemen, creëerden ze een vijfkoppig team (een multi-agent systeem) dat allemaal hetzelfde brein gebruiken (hetzelfde AI-model), maar verschillende rollen spelen. Denk aan een hoogwaardige rechtszaal of een redactievergadering in een nieuwsredactie.

Zo werkt het team:

  1. De Poortwachter (Router Agent): Deze persoon controleert de binnenkomende vraag. Gaat het over medicijnen? Zo ja, dan stuurt hij het naar het veiligheidsteam. Is het gewoon "Wat is het weer?", dan laat hij de AI normaal chatten om tijd te besparen.
  2. De Arts (Medical Clinical Agent): Dit is de AI die optreedt als specialist. Hij bekijkt de vraag en stelt een behandeling voor op basis van zijn geheugen.
  3. De Schrijver (Entity Extractor Agent): Deze persoon neemt de rommelige woorden van de arts en zet deze om in een net lijstje dat leesbaar is voor machines (zoals een boodschappenlijstje), zodat de volgende persoon precies weet wat er gecontroleerd moet worden.
  4. De Onderzoeker (Safety Auditor Agent): Dit is de belangrijkste rol. Deze agent vertrouwt het geheugen van de arts niet. Hij gaat direct online om officiële overheidsdatabases (zoals de FDA) te controleren of het voorgestelde medicijn nog steeds legaal is.
    • Als het medicijn verboden is: Roept de Onderzoeker: "STOP! Dit medicijn is gevaarlijk!" en stuurt de vraag terug naar de Arts.
    • Als het medicijn veilig is: Geeft de Onderzoeker groen licht.
  5. De Lus: Als de Arts een verboden medicijn voorstelt, stuurt de Onderzoeker hem terug om het opnieuw te proberen. De Arts moet een andere optie kiezen of toegeven: "Ik weet geen veilig antwoord." Dit kan maximaal drie keer gebeuren.

De Test: De "Valstrik"-vragen

Om te zien of dit systeem werkt, hebben de onderzoekers een valstrik gemaakt. Ze maakten 103 medische vragen waarbij het "juiste" antwoord volgens de tekstboeken eigenlijk een verboden medicijn was (zoals een medicijn dat jaren geleden van de markt is gehaald).

Ze testten dit op vijf verschillende AI-modellen (waaronder versies van Llama, Falcon en GPT) op twee manieren:

  • De "Vanilla" manier: De AI rechtstreeks vragen (zoals een student die alleen een toets maakt).
  • De "Agentic" manier: Het gebruik van het vijfkoppige team zoals hierboven beschreven.

De Resultaten: Veiligheid boven Snelheid

De resultaten waren spectaculair:

  • De "Vanilla" AI: Deze was erg zelfverzekerd. Hij gaf het "juiste" antwoord volgens de oude tekstboeken, maar dat antwoord was gevaarlijk. Hij adviseerde bijna 100% van de tijd verboden medicijnen. Het was als een zelfverzekerde bestuurder die vergeten was dat de verkeersregels waren veranderd.
  • De "Agentic" AI: Het teamsysteem werkte veel beter.
    • Het stopte ongeveer 53% vaker met het aanbevelen van de verboden medicijnen.
    • In plaats van een gevaarlijk antwoord te geven, leerde het te zeggen: "Ik kan geen veilige optie aanbevelen."
    • De "Pointwise Score" (een veiligheidsmeting) bewoog van een gevaarlijke negatieve score richting nul (de veilige zone).

De Afweging:
Het teamsysteem gaf minder "correcte" antwoorden in de traditionele zin, omdat het weigerde de oude, verboden antwoorden te geven. Maar in de echte wereld is het weigeren van een gevaarlijk antwoord beter dan het geven van een zelfverzekerd, fout antwoord.

De Verrassing: Zelfs de "Slimste" AI Faalde

De onderzoekers testten ook de nieuwste, duurste commerciële AI's (zoals de nieuwste ChatGPT en Gemini) die naar verluidt een ingebouwde "internettoegang" hebben.

Zelfs deze geavanceerde modellen faalden. Ze doorzochten het internet, zagen dat een medicijn verboden was, maar negeerden die informatie toch en adviseerden nog steeds het verboden medicijn omdat hun interne geheugen te sterk was. Dit bewijst dat alleen internettoegang niet genoeg is; je hebt een specifieke "veiligheidsbewaker" nodig die de AI dwingt om naar de nieuwe regels te luisteren.

De Kernboodschap

Dit paper laat zien dat we geen nieuw type AI hoeven uit te vinden om het veilig te maken. We hoeven alleen te veranderen hoe we het gebruiken. Door de AI op te splitsen in een team waarbij één deel een antwoord suggereert en een ander deel de feiten agressief controleert tegen actuele regels, kunnen we voorkomen dat AI gevaarlijk medisch advies geeft.

Het is het verschil tussen een student die een tekstboek uit zijn hoofd leert en een team van artsen die de laatste veiligheidswaarschuwingen dubbelchecken voordat ze een pil voorschrijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →