← Nieuwste papers
💬 NLP

LLM-as-a-Verifier: A General-Purpose Verification Framework

Dit artikel introduceert "LLM-as-a-Verifier", een training-vrij framework dat gebruikmaakt van continue scoring via token logit verwachtingen om verificatie te vestigen als een nieuwe schaalbare as, waarmee state-of-the-art prestaties wordt behaald over diverse agentische benchmarks terwijl verbeterde taakmonitoring en efficiëntie van reinforcement learning samples worden mogelijk gemaakt.

Oorspronkelijke auteurs: Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini

Gepubliceerd 2026-07-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jacky Kwok, Shulu Li, Pranav Atreya, Yuejiang Liu, Yixing Jiang, Chelsea Finn, Marco Pavone, Ion Stoica, Azalia Mirhoseini

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team hebt van briljante maar soms overmoedige AI-assistenten die complexe problemen proberen op te lossen, zoals het schrijven van code, het repareren van een robot of het diagnosticeren van een patiënt. Je weet dat als je hen dezelfde opdracht 100 keer laat proberen, er waarschijnlijk minstens één van hen het goed zal doen. De echte uitdaging is niet het krijgen van de antwoorden; het is weten welk antwoord eigenlijk het beste is zonder telkens een menselijke expert in te huren om het te controleren.

Dit artikel introduceert een nieuwe tool genaamd LLM-as-a-Verifier. Denk aan dit als een "superrechter" die niet alleen een winnaar aanwijst, maar ook begrijpt waarom het ene antwoord beter is dan het andere, zelfs wanneer het verschil minuscuul is.

Zo werkt het, onderverdeeld in eenvoudige concepten:

1. Het Probleen: De "Gelijkspel"-valstrik

Meestal, wanneer we een AI vragen om het werk van een andere AI te beoordelen, vragen we het om een eenvoudige score, zoals "1 tot 5 sterren".

  • De Fout: Als twee antwoorden beide "goed" zijn, maar één is iets beter, geeft de rechter vaak voor beide een "4". Dit creëert een gelijkspel. Het systeem kan het verschil niet zien, dus kiest het willekeurig.
  • De Oplossing van het Papier: In plaats van de AI te dwingen om één enkel getal te kiezen, vraagt de nieuwe methode de AI om naar de waarschijnlijkheid van elke mogelijke score te kijken. Het is alsof je een rechter niet alleen vraagt "Is dit goed?", maar "Hoe waarschijnlijk is het dat dit een 4, een 4.1, een 4.2 of een 4.9 is?" Door al deze kleine waarschijnlijkheden te middelen, krijgt het systeem een continue score (zoals 4.87) in plaats van een ruw geheel getal (zoals 5). Dit elimineert gelijkspelen en ziet de subtiele verschillen.

2. De Drie "Knoppen" om de Kwaliteit Op te Draaien

Het artikel laat zien dat je deze "superrechter" nog beter kunt maken door drie specifieke "knoppen" (schaalassen) omhoog te draaien:

  • Knop 1: Granulariteit (De Liniaal): Gebruik in plaats van een liniaal met alleen inch-markeringen een liniaal met millimeter-markeringen. Hoe gedetailleerder de scoreschaal (tot 20 niveaus), hoe beter de rechter een "goed" antwoord van een "geweldig" antwoord kan onderscheiden.
  • Knop 2: Repetitie (Het Panel): In plaats van één rechter te vragen om te beslissen, vraag je dezelfde rechter om het werk 16 keer te bekijken en hun meningen te middelen. Dit vlakt eventuele willekeurige slechte dagen of momenten van verwarring van de rechter af.
  • Knop 3: Decompositie (De Checklist): In plaats van te vragen "Is dit hele project perfect?", breek je het af. Stel drie aparte vragen: "Voldoe het aan de eisen?", "Is het formaat correct?" en "Zijn er fouten?". Combineer vervolgens de antwoorden. Dit voorkomt dat de rechter wordt afgeleid door één groot probleem en kleine details mist.

3. Het "Toernooi" om de Winnaar te Kiezen

Als je 100 verschillende oplossingen voor een probleem hebt, duurt het controleren van elke oplossing tegen elke andere oplossing eeuwig (en kost het veel geld).

  • De Oplossing van het Papier: Ze hebben een slim toernooi gemaakt genaamd de Probabilistic Pivot Tournament.
    • Stel je een ring van hardlopers voor. Eerst rennen ze een snelle ronde waarbij iedereen één keer tegen zijn buurman rent. Dit identificeert snel de topgevorderden.
    • Daarna richt het systeem zijn energie alleen op de topgevorderden, door hen tegen elkaar te laten racen om de absolute kampioen te vinden.
    • Dit bespaart tijd en geld terwijl het nog steeds de beste oplossing met hoge nauwkeurigheid vindt.

4. Resultaten in de Praktijk

De auteurs hebben deze "superrechter" getest in drie zeer verschillende werelden, en het versloeg in alle gevallen de huidige beste methoden:

  • Coderen: Het hielp bij het selecteren van de beste code-oplossingen voor complexe computertaken (Terminal-Bench V2), met een succespercentage van 86,5%.
  • Robotica: Het keek naar video's van bewegende robots en identificeerde correct welke robot betere vooruitgang boekte (RoboRewardBench), waarbij het modellen versloeg die specifiek jarenlang op robotdata zijn getraind.
  • Geneeskunde: Het hielp bij het selecteren van de beste medische adviesplannen (MedAgentBench), met een succespercentage van 73,3%.

5. Bonusfuncties: Een "Voortgangsbalk" en een "Coach"

Het papier belicht twee extra superkrachten van dit systeem:

  • De Voortgangsbalk: Omdat de rechter zulke gedetailleerde scores geeft, kan het aangeven hoe ver een agent is in een taak. Als een AI code schrijft, stijgt de score gestaag naarmate het werk vordert. Als de AI vastloopt of een fout maakt, vlakt de score af of daalt deze. Dit fungeert als een live "voortgangsbalk" voor complexe AI-taken, waardoor mensen weten of een AI vastzit voordat er uren in wordt verspild.
  • De Coach voor Leren: Het systeem kan fungeren als een "dense reward" (dichte beloning) voor het trainen van andere AI's. In plaats van alleen aan het einde van een taak te zeggen "Je bent gefaald", geeft het kleine, continue punten voor elke kleine stap van vooruitgang. Dit helpt robots en wiskunde-oplossende AI's veel sneller leren (ongeveer 1.8x sneller voor robots) omdat ze vaker feedback krijgen.

Samenvatting

LLM-as-a-Verifier is een nieuwe manier om AI te gebruiken om het werk van andere AI te controleren. Door te kijken naar de details van hoe de AI denkt (waarschijnlijkheden) in plaats van alleen naar het uiteindelijke antwoord, en door slimme strategieën te gebruiken zoals het opdelen van taken in kleinere delen en het organiseren van toernooien, vindt het sneller en nauwkeuriger de beste oplossingen dan ooit tevoren. Het werkt zonder dat het opnieuw getraind hoeft te worden voor specifieke taken, wat het een universele tool maakt voor coderen, robots en geneeskunde.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →