Preferred, Not Safer: Pairwise Preference Is a Poor Proxy for Clinical Safety
Dit artikel toont aan dat de paarvoorkeuren van clinici een onbetrouwbare indicator zijn voor klinische veiligheid in grote taalmodellen, aangezien hooggeplaatste modellen nog steeds significante veiligheidskritische fouten kunnen vertonen, wat evaluatiepraktijken noodzakelijk maakt die direct foutpercentages rapporteren en klinisch onderbouwde rubric-aanpassingen integreren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je de beste chef probeert te kiezen voor een nieuwe ziekenhuiskantine. Je hebt een lijst met beroemde chefs en je vraagt een groep artsen om hun gerechten te proef te maken. De artsen stemmen op welk bord er het meest smakelijk uitziet en op dat moment het lekkerst smaakt. Natuurlijk ga je ervan uit dat de chef met de meeste stemmen de veiligste en meest betrouwbare is om aan te nemen. Maar wat als het "meest aantrekkelijke" gerecht eigenlijk gemaakt is met ingrediënten die over datum waren, of de meest "zelfverzekerde" chef gewoon heel goed was in praten over zijn eten terwijl hij iets gevaarlijks serveerde? Dit is de ingewikkelte wereld van Large Language Models (LLMs) — superintelligente computerprogramma's die kunnen schrijven, chatten en problemen oplossen zoals mensen dat doen. Wetenschappers gebruiken pairwise preferences (vragen om "A of B" te kiezen) om te bepalen welke AI de "beste" is. Maar in hoogwaardige velden zoals de geneeskunde betekent de "favoriet" zijn niet altijd ook de "veiligste" zijn. Als een AI een foutief medisch antwoord geeft, maar dit doet met veel stijl, kan het de stemmen winnen, zelfs als het een patiënt schade zou kunnen berokkenen. Dit artikel stelt een kritische vraag: wanneer artsen de AI kiezen die zij het liefst hebben, kiezen ze dan ook echt degene die geen gevaarlijke fouten zal maken?
De onderzoekers achter deze studie, werkzaam bij het LiGHT Laboratory in Zwitserland, besloten deze aanname te testen met een enorm platform genaamd MOOVE (Massive Open Online Validation and Evaluation). Ze verzamelden meer dan 736 artsen uit meer dan 28 landen om als rechters te fungeren. Deze artsen bekeken 13 verschillende AI-modellen en moesten kiezen welk antwoord beter was in een blind proefje (pairwise preference). Maar hier komt de twist: terwijl ze stemden, gaven de artsen elk antwoord ook een strikte veiligheidsscore, vergelijkbaar met een rapportcijfer dat varieert van -2 (zeer gevaarlijk) tot +2 (zeer veilig). Ze controleerden op twee specifieke zaken: Onschadelijkheid (stelde de AI iets risicovols voor?) en Nauwkeurigheid (was het medische feit correct?).
De resultaten waren een schok. De studie vond dat de AI-modellen die de meeste "populariteitsstemmen" wonnen, vaak dezelfde waren die de hoogste percentages gevaarlijke fouten vertoonden. Het is alsof een student een A krijgt voor het handschrift en zelfvertrouwen, maar faalt voor de wiskundetoets omdat de getallen niet kloppen. Sterker nog, de onderzoekers ontdekten dat het topgerangschikte model in de studie (GPT-OSS) een foutpercentage van 18,0% had voor onschadelijkheid, wat betekent dat bijna één op de vijf antwoorden dat het gaf, potentieel onveilig was. Ondertussen had een voorzichtiger, minder "flitsend" model in de dataset een veel lager foutpercentage van 7,2%, maar stond het veel lager in de populariteitswedstrijd. De studie merkt op dat omdat deze modellen op verschillende soorten medische vragen zijn getest, we niet kunnen zeggen dat het ene model strikt "beter" is dan het andere in een directe race, maar de kloof benadrukt een cruciale waarschuwing: de modellen die mensen het meest leuk vonden, waren niet noodzakelijkerwijs de modellen met het veiligste trackrecord. De studie suggereert dat artsen vaak werden misleid door oppervlakkige kenmerken: de AI die langere, meer gedetailleerde en zelfverzekerder klinkende antwoorden gaf, won de stemmen, zelfs als die antwoorden medisch onjuist of riskant waren.
De onderzoekers gingen dieper in op de vraag waarom dit gebeurde. Ze ontdekten dat het "veiligheidssignaal" (de werkelijke medische juistheid) vaak werd overstemd door het "stijlsignaal" (hoe lang en helder de tekst eruitzag). In hun analyse verklaarden de lengte en helderheid van het antwoord iets meer over waarom een arts een winnaar koos dan de werkelijke veiligheid van het antwoord deed. Het is alsof de jury's stemden op de chef die de langste menubeschrijving schreef, terwijl ze negeerden dat de soep koud was.
Nog zorgwekkender was dat de studie liet zien dat deze risico's niet gelijkmatig verdeeld zijn; ze zijn geconcentreerd in specifieke "no-go zones". Bijvoorbeeld, wanneer de AI probeerde hartmonitorafbeeldingen (ECG's) te lezen, faalde het een verbijsterende 89,9% van de tijd. In andere gebieden, zoals de algemene chirurgie, was het bijna perfect. Dit betekent dat een wereldwijde "leaderboard" die simpelweg zegt "Model X is #1" gevaarlijk is, omdat het de feiten verbergt dat Model X in specifieke, kritieke situaties een ramp kan zijn.
Om dit op te lossen, stellen de auteurs een nieuwe manier voor om deze modellen te rangschikken. In plaats van alleen te tellen wie de meeste stemmen won, stellen ze een Safety-Adjusted Leaderboard (veiligheid-gecorrigeerde ranglijst) voor. Dit systeem neemt de populariteitsstemmen en controleert deze vervolgens tegen de strikte veiligheidsscores. Als een AI een stem wint maar een gevaarlijk antwoord gaf, wordt de rangorde verlaagd. Toen ze deze correctie toepasten, veranderden de rangschikkingen drastisch. Sommige modellen die voorheen onderaan stonden, schoten omhoog naar de top omdat ze daadwerkelijk veiliger waren, terwijl de "flitsende" winnaars naar beneden zakten.
Het paper concludeert dat we niet kunnen vertrouwen op "populariteitswedstrijden" om te bepalen of een AI veilig is voor medisch gebruik. Alleen omdat een AI goed klinkt of slim lijkt, betekent niet dat het betrouwbaar is. De onderzoekers suggereren dat we, in plaats van te zoeken naar één enkel "beste" model, moeten kijken naar specifieke foutpercentages en eerlijk moeten zijn over waar de AI mogelijk faalt. Ze waarschuwen dat het vertrouwen op eenvoudige voorkeursscores is als het inhuren van een piloot omdat hij een rustige stem heeft, zonder te controleren of hij daadwerkelijk een vliegtuig kan besturen. In de wereld van medische AI is de meest geliefde zijn niet hetzelfde als de veiligste zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.