Token Probability Beats Verbalized Condence for Error Detection in Small Open-Weight Language Models: A Medical and Psychiatric Benchmark Study
Deze pilotstudie toont aan dat voor kleine open-weight taalmodellen (1,2B–9,2B parameters) toegepast op medische en psychiatrische taken, het extraheren van interne token-waarschijnlijkheden een aanzienlijk betrouwbaardere methode is voor foutdetectie dan het vertrouwen op de door de modellen verbaal geuite zelfverzekerdheid, met name voor de kleinste modellen waar de verbaal geuite zelfverzekerdheid op het niveau van toeval presteert.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van kunstmatige intelligentie is er een groeiende wens om krachtige computerprogramma's te gebruiken om artsen en psychiaters te helpen bij het nemen van moeilijke beslissingen. Deze programma's, bekend als grote taalmodellen, kunnen enorme hoeveelheden medische literatuur lezen en complexe vragen over de menselijke gezondheid beantwoorden. Er blijft echter een kritiek probleem bestaan: hoe weet een arts wanneer hij de computer moet vertrouwen? Als de machine zegt dat een diagnose zeker is, maar het is in werkelijkheid fout, kunnen de gevolgen ernstig zijn. Jarenlang hebben onderzoekers geprobeerd dit op te lossen door de computer simpelweg te vragen hoe zeker hij is. Ze vragen het model om een percentage aan zijn antwoord te koppelen, een verbale rapportage van vertrouwen. De hoop was dat als de computer zou zeggen dat hij slechts vijftig procent zeker was, een mens kon ingrijpen en het werk kon controleren. Maar recente studies hebben aangetoond dat deze zelfgerapporteerde scores vaak onbetrouwbaar zijn, soms niet beter dan een willekeurige gok.
Deze onzekerheid is vooral urgent voor kleinere, goedkopere versies van deze computerprogramma's die op een enkele kantoorcomputer kunnen draaien in plaats van op enorme, dure datacentra. Dit soort kleinere modellen zijn degenen die het meest waarschijnlijk gebruikt zullen worden in privépraktijken waar patiëntgegevens veilig moeten blijven en de kosten laag moeten zijn. Een nieuwe studie door Kunal Dhanda aan het Indian Institute of Technology Kharagpur onderzoekt of deze kleinere modellen erop kunnen vertrouwen om hun eigen fouten te herkennen. Het onderzoek vergelijkt twee verschillende manieren om zekerheid te meten. De eerste is het verbale vertrouwen, waarbij het model wordt gevraagd hoe zeker het is. De tweede is een verborgen signaal genaamd token-waarschijnlijkheid. Om dit te begrijpen, stel je voor dat de computer woord voor woord een antwoord schrijft. Bij elke stap berekent hij de wiskundige waarschijnlijkheid van het kiezen van de volgende specifieke letter of het volgende woord. De token-waarschijnlijkheid is simpelweg de interne berekening van de computer over hoe waarschijnlijk het was dat hij precies het antwoord koos dat hij uiteindelijk koos. Deze studie stelt een directe vraag: is deze verborgen wiskundige berekening een betere indicator van de waarheid dan de gesproken woorden van het model zelf?
De onderzoekers testten vier verschillende kleine computermodellen, variërend van zeer compact tot middelmatig krachtig. Ze gebruikten deze modellen om 1.600 medische en psychiatrische vragen te beantwoorden die afkomstig waren uit standaardexamens. Voor elke vraag registreerde het team zowel de gesproken vertrouwensscore als de interne token-waarschijnlijkheid van het model. Ze controleerden vervolgens de antwoorden tegen de juiste oplossingen om te zien welk signaal beter in staat was om fouten te voorspellen. De resultaten waren duidelijk en consistent over alle vier de modellen. In elk geval was de interne token-waarschijnlijkheid een veel betere voorspeller van of een antwoord juist of onjuist was dan de verbale vertrouwensscore. Het verschil was niet klein; voor het kleinste model was het interne signaal aanzienlijk nauwkeuriger, terwijl het gesproken vertrouwen zo slecht was dat het niet te onderscheiden was van een muntworp.
De studie onderzocht ook hoe deze signalen zouden werken in een echt veiligheidssysteem, waarbij een arts kan besluiten het antwoord van de computer te negeren als de vertrouwensscore te laag is. Wanneer de onderzoekers de token-waarschijnlijkheid gebruikten om de meest onzekere antwoorden eruit te filteren, verbeterde de nauwkeurigheid van de resterende antwoorden gestaag voor alle vier de modellen. Echter, wanneer zij de verbale vertrouwensscores gebruikten om antwoorden te filteren, waren de resultaten vlak of zelfs schadelijk. Voor het kleinste model maakte het vertrouwen op de gesproken vertrouwensscore het systeem zelfs minder nauwkeurig, omdat het model net zo vaak zelfverzekerd fout was als zelfverzekerd juist. Deze bevinding helpt een vreemd gedrag te verklaren dat werd waargenomen in eerdere experimenten, waarbij het kleinste model slechter presteerde wanneer het werd gevraagd toe te geven dat het het antwoord niet wist. De onderzoekers suggereren dat het model niet daadwerkelijk "wist" dat het onzeker was; het rapporteerde simpelweg een vertrouwensscore die geen echte informatie bevat, terwijl het nuttige signaal verborgen bleef in de eigen berekeningen.
De implicaties van dit werk zijn praktisch en onmiddellijk voor iedereen die deze tools in een medische setting inzet. Als een lokaal computersysteem zijn interne waarschijnlijkheidsscores kan onthullen, moet die data worden gebruikt om te beslissen welke antwoorden menselijke controle vereisen. Vertrouwen op het spreken van het vertrouwen door het model is niet alleen minder effectief; voor de kleinste modellen creëert het zelfs een vals gevoel van veiligheid. De studie concludeert dat hoewel verbale vertrouwensscores acceptabel kunnen zijn voor sommige grotere, meer geavanceerde modellen, het een gevaarlijk instrument is voor de kleinere, op privacy gerichte systemen die steeds gebruikelijker worden in klinieken. De meest betrouwbare manier om fouten in deze systemen te detecteren, is door te kijken naar de getallen die de computer al berekent maar nooit hardop uitspreekt. Deze aanpak biedt een echte weg naar veiligere, nauwkeurigere medische AI zonder dat daarvoor dure hardware of complexe nieuwe software nodig is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.