← Nieuwste papers
🤖 machine learning

AsymmetryZero: A Framework for Operationalizing Human Expert Preferences as Semantic Evals

Het artikel introduceert AsymmetryZero, een raamwerk dat menselijke expertvoorkeuren operationaliseert tot expliciete, herbruikbare evaluatiecontracten voor zowel model-only als agentische omgevingen, en aantoont dat compacte jury's vergelijkbare taakniveaus kunnen bereiken als geavanceerde jury's, terwijl ze de beoordelingskosten en latentie aanzienlijk verlagen ondanks een hogere interne onenigheid.

Oorspronkelijke auteurs: Tadhg Looram, Lucas Nuzzi, Kyle Waters, Steven Dillmann

Gepubliceerd 2026-05-07
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Tadhg Looram, Lucas Nuzzi, Kyle Waters, Steven Dillmann

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme kookwedstrijd organiseert. Je hebt duizenden chefs (AI-modellen) die proberen het perfecte gerecht te maken, maar "perfect" is subjectief. De ene jurylid geeft om het zoutgehalte, de ander om de presentatie en een derde om de bereidingstijd.

In het verleden was het proberen om deze gerechten te beoordelen een rommel. Soms schreven juryleden gewoon een vage notitie als "Dit smaakt goed", of ze discussieerden eindeloos over waarom het ene gerecht beter was dan het andere. Dit artikel introduceert een nieuw systeem genaamd AsymmetryZero om die rommel op te lossen, en test vervolgens twee verschillende manieren om juryleden aan te stellen.

Hier is de uitleg in eenvoudige termen:

1. Het Probleem: De "Vage Jurylid"-Valstrik

Momenteel vragen we bij het testen van AI vaak een superintelligente AI om het werk van een andere AI te beoordelen. Maar als je gewoon zegt: "Beoordeel dit essay", kan de beoordelaar zijn eigen verborgen regels gebruiken. Hij kan houden van lange antwoorden, of hij kan in de war raken door het onderwerp. Het is alsof je een foodcriticus huurt die geen checklist heeft; je weet nooit of hij het eten beoordeelt of gewoon zijn stemming.

2. De Oplossing: Het "Beoordelingscontract"

De auteurs hebben AsymmetryZero ontwikkeld, wat in feite een strikte receptuur voor beoordeling is.

In plaats van een vage prompt, krijgt elke taak een "Contract". Dit contract is als een gedetailleerde scorekaart die zegt:

  • Wat beoordelen we? (Bijv. "Heeft de chef zout gebruikt?")
  • Hoe controleren we het? (Bijv. "Als het woord 'zout' voorkomt, geef 10 punten.")
  • Wie beslist? (Een enkele jurylid of een groep?)
  • Wat is het slagenpunt?

Dit contract werkt zowel voor eenvoudige AI (alleen tekst schrijven) als voor complexe AI-agenten (robots die tools gebruiken en meerdere stappen ondernemen). Het leuke deel is dat hetzelfde contract kan worden gebruikt om een eenvoudige tekstbot of een complexe robot te beoordelen, en de scores zullen vergelijkbaar zijn.

3. Het Experiment: De "Grote Juryleden" versus de "Kleine Juryleden"

De auteurs wilden weten: Hebben we dure, superintelligente juryleden nodig om deze contracten te beoordelen, of kunnen we goedkopere, kleinere juryleden gebruiken?

Ze stelden een test op met 75 complexe taken (zoals het oplossen van geavanceerde wiskunde- of programmeerproblemen). Ze gebruikten vier verschillende "deelnemer"-AI-modellen om de taken op te lossen. Vervolgens beoordeelden ze die oplossingen met twee verschillende groepen "jury"-AI's:

  • De Frontier Jury (De Grote Juryleden): Een panel van 5 van de krachtigste, duurste en slimste beschikbare AI-modellen.
  • De Compacte Jury (De Kleine Juryleden): Een panel van 5 kleinere, goedkopere en snellere AI-modellen.

4. De Resultaten: De "Goedkopere Juryleden" zijn Ruiziger

Hier is wat ze ontdekten:

  • De Eindscore is Vergelijkbaar: Als je alle punten optelt, waren de "Grote Juryleden" en de "Kleine Juryleden" het meestal eens over wie de wedstrijd won. Als een taak slaagde voor de Grote Juryleden, slaagde hij meestal ook voor de Kleine Juryleden.
  • De Details zijn Rommelig: Echter, als je kijkt naar de individuele stappen (de specifieke criteria op de scorekaart), waren de Kleine Juryleden het 15% tot 25% van de tijd oneens met de Grote Juryleden.
  • Het "Vingerwijzen"-Probleem: Het grootste probleem was dat de Kleine Juryleden het niet eens konden worden met elkaar.
    • De Grote Juryleden waren als een kalm comité; ze waren het bijna altijd eens (alleen 6–11% van de tijd waren ze verdeeld).
    • De Kleine Juryleden waren als een chaotische kamer; ze discussieerden constant met elkaar (verdeeld in 3 tegen 2 ongeveer 30% van de tijd).

De Analogie: Stel je voor dat je een wiskundetoets beoordeelt.

  • Grote Juryleden: Alle vijf professoren kijken naar het antwoord en zeggen: "Ja, dat is correct."
  • Kleine Juryleden: Drie professoren zeggen "Correct", maar twee zeggen "Incorrect omdat het handschrift rommelig is", zelfs als de wiskunde klopt. Ze discussiëren met zichzelf.

5. De Afweging: Kosten versus Consistentie

De Kleine Juryleden waren ongelooflijk goedkoop en snel.

  • Kosten: Ze kostten ongeveer 97% minder dan de Grote Juryleden.
  • Snelheid: Ze waren ongeveer 82% sneller.

Het Oordeel:
Als je gewoon een snelle, goedkope check wilt om te zien of een systeem over het algemeen werkt (zoals een "gezondheidsscheck"), zijn de Kleine Juryleden geweldig. Ze besparen een fortuin.

Maar, als je precies wilt weten waarom iets faalde, of als je een perfecte audittrail nodig hebt voor beslissingen met hoge risico's, dan zijn de Kleine Juryleden te "ruizig". Ze discussiëren te veel onderling om te worden vertrouwd voor de fijne details.

Samenvatting

Het artikel stelt dat hoe je de beoordelingsregels schrijft (het contract) net zo belangrijk is als wie je huurt om te beoordelen.

Je kunt veel geld besparen door kleinere, goedkopere AI-juryleden te gebruiken, maar je moet accepteren dat ze vaker met elkaar zullen discussiëren. Als je een kalm, consistent oordeel nodig hebt, heb je nog steeds de dure "Frontier"-juryleden nodig. Als je gewoon een ruwe schatting nodig hebt, doen de goedkope het werk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →