Evidence Lock Before Commitment: A Frozen Interface Degrades LLM-as-Judge Evaluation
Dit artikel toont aan dat "evidence locking"—een workflow waarbij LLM-beoordelaars bewijsmateriaal extraheren en vastleggen in een aparte aanroep voordat ze een definitief oordeel vellen—de evaluatieprestaties aanzienlijk verslechtert door de afstemming met menselijke voorkeuren te verminderen en de inconsistentie in antwoordvolgorde te vergroten in vergelijking met gestructureerde één-aanroep beoordeling.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een detective bent die een mysterie probeert op te lossen, maar in plaats van de plaats delict zelf te onderzoeken, ben je gedwongen om een politierapport te lezen dat door iemand anders is geschreven. Je moet beslissen wie de dader is, uitsluitend gebaseerd op die geschreven samenvatting. Dit is de wereld van "AI-rechters". In het veld van kunstmatige intelligentie vragen we slimme computermodellen vaak om als scheidsrechter op te treden, waarbij ze beslissen welk van twee antwoorden beter is. Meestal bekijken deze AI-rechters de oorspronkelijke antwoorden en de vraag tegelijkertijd, waardoor ze een snelle beslissing kunnen nemen. Maar onlangs werd een nieuw idee populair: "Laten we de AI eerst zijn redenen opschrijven!" De hoop was dat als de AI zijn denkproces zou moeten uitleggen en bewijs zou moeten verzamelen voordat het een winnaar kiest, het eerlijker, logischer en moeilijker te misleiden zou zijn. Het is alsof je een leerling vraagt om zijn berekeningen uit te werken op een wiskundetoets voordat je het cijfer geeft. Maar wat als die geschreven "uitwerking" eigenlijk niet genoeg is om het probleem op te lossen? Wat als de handeling van het vastleggen van die geschreven notitie en het weggooien van de oorspronkelijke antwoorden de AI juist slechter maakt in zijn werk?
Dit artikel, getiteld "Evidence Lock Before Commitment", duikt precies in die vraag. De onderzoeker, Divyansh Singh van de Universiteit van Florida, wilde een specifieke workflow testen die veel mensen waren gaan gebruiken. Ze vroegen zich af: Als we een AI dwingen om in één stap zijn bewijsvoering op te schrijven, die notitie op te slaan, en vervolgens alleen die notitie aan een tweede stap geven om de uiteindelijke beslissing te nemen (zonder dat deze de oorspronkelijke antwoorden opnieuw kan zien), maakt het dan nog steeds goede keuzes? Ze testten dit met twee zeer intelligente AI-modellen, Claude Sonnet 4.5 en GPT-5, over 24.000 verschillende beoordelingsscenario's.
De resultaten waren een beetje een schok. De onderzoeker ontdekte dat deze "Evidence Lock"-methode de AI-rechters zelfs slechter maakte. Wanneer de AI werd gedwongen om alleen op zijn bevroren aantekeningen te vertrouwen, stemde het 4 tot 6 procentpunten minder vaak overeen met menselijke voorkeuren dan wanneer het gewoon de oorspronkelijke antwoorden kon bekijken. Het raakte ook veel meer in de war door de volgorde waarin de antwoorden werden gepresenteerd, en werd 8 tot 10 procentpunten vaker inconsistent. Interessant genoeg werkte het simpelweg vragen aan de AI om bewijs op te schrijven terwijl het nog steeds naar de oorspronkelijke antwoorden keek (een "structured one-call" methode), prima. Het probleem was niet het schrijven; het probleem was het "vergrendelen". Door de bewijsvoering te bevriezen en de toegang tot de bron af te snijden, verloor de AI het vermogen om het volledere plaatje te zien. Het artikel suggereert dat hoewel het bijhouden van een schriftelijke verslaglegging geweldig is voor het auditeren en het later controleren van werk, het de oorspronkelijke bronmaterialen niet mag vervangen wanneer de uiteindelijke beslissing wordt genomen. De "bevroren interface" verslechtert de kwaliteit van het vonnis, wat bewijst dat je soms echt de plaats delict zelf moet zien, en niet alleen het rapport.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.