← Nieuwste papers
🤖 machine learning

CELEUS: Certifiable and Efficient LLM Evaluation via E-Processes

Dit artikel introduceert CELEUS, een framework dat E-processen benut om certificeerbare, op elk moment geldige betrouwbaarheidsintervallen te bieden voor LLM-evaluatie, terwijl het het aantal vereiste monsters aanzienlijk vermindert door onzekerheidsgestuurde sampling en surrogaat-ondersteunde benaderingen.

Oorspronkelijke auteurs: Zhijian Zhou, Zesheng Ye, Zhaorun Chen, Bo Li, Feng Liu

Gepubliceerd 2026-06-23
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhijian Zhou, Zesheng Ye, Zhaorun Chen, Bo Li, Feng Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme pot hebt met 100.000 knikkers. Sommige zijn rood (dit staat voor een fout die de AI heeft gemaakt) en sommige zijn blauw (dit staat voor een correct antwoord). Je wilt het exacte percentage rode knikkers in de hele pot weten om te beslissen of de AI goed genoeg is om in de echte wereld te gebruiken.

Het probleem? Elke knikker controleren is traag, duur en vereist soms zelfs een mens om ernaar te kijken. Als je gewoon een handvol pakt en een gokje waagt, heb je misschien geluk of pech, maar je weet ook niet hoe dicht je schatting bij de waarheid ligt.

Dit artikel introduceert CELEUS, een slimme, wiskundig gegarandeerde manier om dat percentage snel en veilig te achterhalen.

Zo werkt het, met behulp van eenvoudige analogieën:

1. Het Probleem: "Stop en Ga" versus "Blijven Controleren"

Traditioneel gezien, om zeker van je zaak te zijn, controleer je misschien een vast aantal knikkers (bijvoorbeeld 1.000) en stop je dan. Maar wat als de eerste 1.000 allemaal blauw waren? Dan zou je denken dat de pot perfect is, maar je hebt misschien gewoon geluk gehad.

Sommige nieuwere methoden proberen knikkers één voor één te controleren en te stoppen zodra ze "zeker genoeg" zijn. Echter, het artikel stelt dat deze methoden een fout hebben: als je je voortgang blijft controleren en besluit te stoppen op basis van wat je op dit moment ziet, kun je jezelf per ongeluk voorliegen door te denken dat je zekerder bent dan je in werkelijkheid bent. Het is als een gokker die steeds zijn wedstrategie aanpast op basis van de laatste paar overwinningen; uiteindelijk denkt hij misschien dat hij een "gegarandeerd" systeem heeft, maar hij is in werkelijkheid gewoon gelukkig geweest.

CELEUS lost dit op. Het biedt een "certificeerbare" garantie. Ongeacht wanneer je besluit te stoppen, garandeert de wiskunde dat je antwoord binnen een specifieke marge van de waarheid ligt (zoals zeggen: "We zijn voor 95% zeker dat het aantal rode knikkers tussen de 10% en 12% ligt").

2. Het Geheim: De "Glazen Bol" (Surrogaten)

Het controleren van een knikker is duur (zoals het vragen aan een mens om een essay te beoordelen). CELEUS gebruikt een truc om geld te besparen.

Stel je voor dat je een Glazen Bol hebt (een "surrogaatmodel"). Het is een kleinere, goedkopere AI die naar een knikker kijkt en raadt of deze rood of blauw is.

  • De keerzijde: De Glazen Bol is niet perfect. Soms raadt hij het fout.
  • De CELEUS-strategie: In plaats van elke knikker met een dure mens te controleren, vraagt CELEUS de Glazen Bol eerst om voor alle knikkers een gok te doen.
    • Als de Glazen Bol zeer zelfverzekerd en consistent is, vertrouwt CELEUS erop en verspilt het geen tijd aan het controleren van die knikker met een mens.
    • Als de Glazen Bol verward is of de gok riskant lijkt, zegt CELEUS: "Hé, ik moet deze met de mens controleren om er zeker van te zijn."

Dit wordt Surrogate-Assisted Approximation genoemd. Het stelt het systeem in staat om de dure controles op de makkelijke knikkers over te slaan en zich te concentreren op de lastige exemplaren.

3. De "Onzekerheidsdetective" (Sampling)

CELEUS kiest niet zomaar willekeurig knikkers uit. Het gedraagt zich als een detective die op zoek is naar de meest verwarrende aanwijzingen.

Het maakt gebruik van Uncertainty-Guided Sampling. Als de Glazen Bol zegt dat een knikker "Rood" is, maar de wiskunde suggereert dat het eigenlijk "Blauw" zou kunnen zijn (een grote onenigheid), geeft CELEUS prioriteit aan het controleren van die specifieke knikker met de mens. Het negeert de knikkers waar iedereen het over eens is. Dit is als een docent die een stapel toetsen nakijkt: ze besteden de meeste tijd aan de essays die moeilijk te beoordelen zijn, niet aan de essays die overduidelijk perfect of overduidelijk slecht zijn.

4. Het "Magische Grootboek" (E-Processen)

Hoe weet CELEUS dat het niet heeft valsgespeeld door naar de gokken van de Glazen Bol te kijken?

Het gebruikt een wiskundig hulpmiddel genaamd een E-Process. Denk aan dit als een magisch grootboek of een "eerlijkheidsmeter".

  • Elke keer dat CELEUS een knikker controleert, wordt het grootboek bijgewerkt.
  • Het grootboek is zo ontworpen dat als het systeem liegt of vals speelt (door te vroeg te stoppen of slechte gokken te gebruiken), de "eerlijkheidsmeter" een fluit zal laten horen en een rood vlaggetje zal tonen.
  • Omdat het grootboek op deze manier is gebouwd, kan het systeem zijn betrouwbaarheidsinterval continu bijwerken zonder ooit de regels te breken. Het is als een rechter die een rechtszaak op elk gewenst moment kan pauzeren, naar het verzamelde bewijs kan kijken en kan zeggen: "We hebben genoeg om 95% zeker te zijn," zonder dat de rechtszaak ooit onrechtvaardig wordt.

De Resultaten: Sneller en Goedkoper

Het artikel testte dit op echte AI-modellen (zoals Llama en DeepSeek) met behulp van standaard benchmarks (zoals sentimentanalyse en algemene kennisvragen).

  • De claim: CELEUS bereikte hetzelfde niveau van zekerheid als oudere methoden, maar gebruikte 54% tot 62% minder menselijke controles.
  • De analogie: Als een oude methode een mens nodig had om 10.000 essays te laten beoordelen om zeker te zijn, had CELEUS er slechts ongeveer 4.000 nodig, omdat het de "Glazen Bol" gebruikte om de rest af te handelen.
  • De garantie: Ondanks dat het minder essays controleerde, bewijst het artikel wiskundig dat de uiteindelijke score nog steeds betrouwbaar is en niet "breekt" alleen omdat ze eerder stopten.

Samenvatting

CELEUS is een nieuwe manier om AI te testen die:

  1. Geld bespaart door een goedkope "Glazen Bol" (surrogaat) te gebruiken om de antwoorden voor de meeste items te raden.
  2. Efficiëntie focust door alleen mensen te vragen om de items te controleren waar de Glazen Bol van in de war is.
  3. Veiligheid garandeert door een speciaal wiskundig "Grootboek" (E-Process) te gebruiken dat ervoor zorgt dat de resultaten accuraat zijn, ongeacht wanneer je besluit te stoppen met controleren.

Het stelt onderzoekers in staat om te zeggen: "We zijn statistisch zeker dat deze AI goed is," zonder dat ze tijd en geld hoeven te verspillen aan het controleren van elk afzonderlijk voorbeeld.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →