← Nieuwste papers
💻 computer science

Fixing Abstention with Token Probability: A Budget-Matched Causal Test Across Four Small Open-Weight Models

Dit artikel toont aan dat het vervangen van verbaal geuite zelfverzekerdheid door een budget-gematchte token-waarschijnlijkheidsabstentiebeleid een specifiek nauwkeurigheidsverlagend effect dat wordt waargenomen in het llama3.2:1b-model causaal elimineert, maar faalt om dit voordeel te generaliseren naar andere kleine open-weight modellen, wat aangeeft dat dergelijke fixes modelspecifiek zijn en dat vast-budget abstentie zelfs met verbeterde targeting netto schadelijk kan blijven.

Oorspronkelijke auteurs: Kunal Dhanda

Gepubliceerd 2026-09-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Kunal Dhanda

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de snel evoluerende wereld van kunstmatige intelligentie onderzoeken onderzoekers voortdurend hoe ze computerprogramma's kunnen leren om vragen te beantwoorden. Maar een kritieke uitdaging blijft bestaan: weten wanneer een programma het antwoord niet weet. Wanneer een mens het niet zeker weet, kan hij zeggen: "Ik weet het niet." Deze daad van terugtrekken, genaamd onthouding (abstention), wordt vaak gezien als een veiligheidsfunctie die voorkomt dat de machine wild gaat gokken en desinformatie verspreidt. Echter, recente onderzoeken hebben een vreemde glitch onthuld in enkele van deze systemen. Wanneer gevraagd wordt aan deze modellen om onzekerheid toe te geven, presteren de kleinste en meest lichtgewicht modellen in een specifieke familie van open-source programma's soms slechter dan wanneer ze simpelweg gedwongen zouden worden om elke keer te gokken. Het lijkt erop dat het vragen aan deze modellen om over hun eigen vertrouwen te spreken een breuk veroorzaakt, waardoor ze hun nauwkeurigheid verliezen op precies de vragen die ze zorgvuldig probeerden te behandelen.

Deze nieuwe studie werpt een nadere blik op die breuk om te zien of deze kan worden opgelost. De onderzoekers concentreerden zich op vier kleine, open-weight modellen—versies van kunstmatige intelligentie die compact genoeg zijn om op standaardcomputers te draaien, maar nog steeds in staat zijn tot complexe redeneringen. Ze hadden eerder geobserveerd dat wanneer het kleinste model werd geprompt om "Ik weet het niet" te zeggen als het zich onzeker voelde, de nauwkeurigheid aanzienlijk daalde bij medische en psychiatrische vragen. Het team vermoedde dat het probleem niet de daad van de onthouding zelf was, maar de methode die werd gebruikt om te beslissen wanneer men zich moest onthouden. Het model werd gevraagd zijn vertrouwen te verwoorden, een signaal dat achteraf gezien statistisch nutteloos bleek, in essentie niet beter dan een muntworp. Ondertussen was de interne wiskunde die het model gebruikt om elk woord te genereren, bekend als tokenprobabiliteit, een veel sterkere indicator van of een antwoord correct was. De vraag was of het wisselen van het besluitvormingsproces van de gesproken bevestiging van het model naar zijn interne wiskunde dit verlies aan nauwkeurigheid zou stoppen.

Om het antwoord te vinden, voerden de onderzoekers geen nieuwe experimenten uit en vroegen zij de modellen geen nieuwe tekst te genereren. In plaats daarvan voerden zij een zorgvuldige heranalyse uit van gegevens die al waren verzameld in drie eerdere studies. Zij namen de bestaande verslagen van hoe de modellen vragen beantwoordden en vergeleken twee verschillende manieren om te beslissen wanneer een antwoord overgeslagen moest worden. De eerste methode was de oorspronkelijke: het model zou een antwoord alleen overslaan als het verbaal aangaf onzeker te zijn. De tweede methode was een nieuw beleid: het model zou een antwoord overslaan als de interne wiskunde een lage waarschijnlijkheid aangaf dat het antwoord correct was. Cruciaal was dat de onderzoekers de tweede methode zo aanpasten dat deze exact hetzelfde aantal antwoorden oversloeg als de eerste methode. Dit zorgde ervoor dat eventuele verschillen in resultaten te danken waren aan welke vragen werden overgeslagen, en niet aan hoeveel.

De resultaten waren opmerkelijk voor het kleinste model. Toen de onderzoekers de verbale vertrouwenscontrole vervingen door de interne waarschijnlijkheidscontrole, verdween de ernstige daling in nauwkeurigheid. Onder de oude methode was de nauwkeurigheid van het model met zeven procentpunten gedaald, een aanzienlijk verlies. Onder de nieuwe methode kromp de daling tot bijna nul, een verandering die statistisch ononderscheidbaar was van geen effect. Deze fix werkte consistent voor zowel algemene medische vragen als psychiatrische scenario's. Het bevestigde dat de oorspronkelijke fout inderdaad werd veroorzaakt door het onvermogen van het model om zijn eigen vertrouwen accuraat te rapporteren, en dat het gebruik van zijn interne wiskunde als gids de fout succesvol corrigeerde.

Echter, de studie onthulde ook dat deze oplossing geen universeel geneesmiddel is. Wanneer de onderzoekers dezelfde fix toepasten op een ander model in de groep, dat ook had geleden onder het probleem van de verbale vertrouwen, waren de resultaten anders. Dit tweede model had het beste interne wiskundige signaal van alle geteste modellen, en toch daalde de nauwkeurigheid aanzienlijk toen het nieuwe beleid werd toegepast. De onderzoekers ontdekten dat dit model een veel hogere frequentie had van het zeggen van "Ik weet het niet". Omdat het zoveel vragen oversloeg, verwierp het een groot aantal correcte antwoorden samen met de foute antwoorden. Hoewel de interne wiskunde goed was in het sorteren van de antwoorden, was het enorme volume aan overgeslagen items te hoog om voordelig te zijn. Dit suggereert dat voor modellen die al zeer nauwkeurig zijn, het simpelweg veranderen van het signaal dat wordt gebruikt om te beslissen wat te overslaan, niet voldoende is; het aantal items dat overgeslagen wordt, moet in plaats daarvan worden verminderd.

De studie concludeert dat hoewel het routeren van de beslissing om te onthouden via interne wiskunde in plaats van gesproken vertrouwen een krachtige fix is voor specifieke fouten, het geen oplossing is die voor iedereen werkt. Voor het kleinste model was de verandering een volledige redding, waarbij een schadelijke instructie werd omgezet in een neutrale. Voor het grotere, nauwkeurigere model was het probleem niet het signaal, maar het budget van de overgeslagen items. De bevindingen benadrukken dat er in kunstmatige intelligentie geen enkele veiligheidspatch bestaat die voor elk systeem werkt. Elk model vereist zijn eigen validatie om te begrijpen hoe het met onzekerheid omgaat, en wat als een correctie werkt voor de één, werkt mogelijk niet voor de ander. De onderzoekers waarschuwen dat deze resultaten gebaseerd zijn op een specifieke set gegevens en moeten worden beschouwd als hypothesen voor verder onderzoek in plaats van definitieve instructies voor implementatie, maar ze bieden een duidelijk, causaal bewijs dat het repareren van het communicatiekanaal soms de uitkomst kan repareren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →