Think-with-Rubrics: From External Evaluator to Internal Reasoning Guidance
Dit artikel introduceert "Think-with-Rubrics", een nieuw paradigma dat rubrics omvormt van externe beoordelaars naar interne redeneerhulpmiddelen door LLM's tijdens het trainen rubrics naast antwoorden te laten genereren, wat leidt tot consistente prestatieverbeteringen ten opzichte van bestaande op beloning gebaseerde baselines.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert een verhaal te schrijven, een raadsel op te lossen of een complexe reeks instructies te volgen. In het verleden leerden we deze robots door ze te laten gokken en hun werk pas te beoordelen nadat ze klaar waren. Als ze het fout hadden, vertelden we hen: "Hier is het cijfer, probeer het opnieuw." Dit is vergelijkbaar met een leraar die een toets teruggeeft met een rode "F" onderaan, maar zonder aantekeningen over hoe de specifieke fouten te herstellen.
Het artikel "Think-with-Rubrics" stelt een slimmere manier om te leren voor. In plaats van alleen het eindantwoord te beoordelen, leert het de robot om een eigen beoordelingsformulier te schrijven voordat het überhaupt aan het werk begint.
Hier is hoe het artikel dit uiteenzet, met behulp van eenvoudige analogieën:
1. Het probleem: De "post-game" criticus
Momenteel gebruiken de meeste AI-trainingen Rubrics als beloning. Denk hierbij aan een sportcoach die pas verschijnt nadat de wedstrijd voorbij is. De coach kijkt naar de eindstand en zegt: "Je hebt de bal drie keer gemist." De speler leert van de score, maar had de checklist van de coach niet in zijn hoofd terwijl hij speelde. Hij kon de regels niet gebruiken om zijn bewegingen in real-time te sturen.
2. De oplossing: De "pre-game" coach
De auteurs introduceren Think-with-Rubrics. Dit verandert het denkproces van de robot. Nu moet de robot, voordat het ook maar één woord van het antwoord schrijft, eerst een Rubric (een checklist met regels) voor zichzelf genereren.
- De analogie: Stel je voor dat je een taart bakt.
- Oude manier: Je bakt de taart, proeft hem, en dan zegt de jury: "Het is te zout en het glazuur is rommelig." Je probeert het de volgende keer opnieuw.
- Nieuwe manier (Think-with-Rubrics): Voordat je de oven aanzet, schrijf je een checklist: "1. Gebruik precies 2 koppen bloem. 2. Geen zout. 3. Het glazuur moet glad zijn." Je bakt de taart vervolgens terwijl je constant je eigen lijst controleert.
Door de AI te dwingen eerst de regels te schrijven, worden de regels onderdeel van haar "denkproces" in plaats van slechts een externe beoordeling.
3. Hoe de training werkt (het "dubbelcheck"-systeem)
Het artikel beschrijft een trainingsproces met twee hoofdfases, vergelijkbaar met een student die zich voorbereidt op een groot examen:
Fase 1: Het formaat leren (SFT-opwarming)
De robot krijgt voorbeelden te zien van hoe je een checklist schrijft gevolgd door een antwoord. Het leert de structuur:<Rubric>en dan<Antwoord>. Het is alsof je een student leert zijn huiswerk correct te formatteren zodat de leraar het kan lezen.Fase 2: De versterkende leerfase (de "coach"-fase)
Hier gebeurt de magie. De robot genereert zijn eigen checklist en antwoord. Vervolgens controleert een "Verifier" (een slimme jury) twee dingen:- De Gouden Check: Stemde het antwoord overeen met de perfecte, door mensen gemaakte checklist? (Dit is het externe cijfer).
- De Zelfcheck: Volgt het antwoord daadwerkelijk de eigen checklist van de robot? (Dit is de interne consistentie).
Het belangrijkste inzicht:
Het artikel vond dat als je alleen de "Gouden Check" (het menselijke cijfer) gebruikt, de robot beter wordt in het volgen van menselijke regels, maar mogelijk nog steeds rommelig blijft in zijn eigen denken. Maar als je de "Zelfcheck" toevoegt, leert de robot om consistent te zijn met zichzelf.
4. De verrassende ontdekking: Zelfevolutie
De meest opwindende bevinding in het artikel is dat de robot zichzelf eigenlijk kan leren zonder dat er helemaal een checklist van een menselijke leraar nodig is!
- De analogie: Stel je een student voor die zo goed is in het maken van zijn eigen studiegidsen en zich vervolgens eraan houdt, dat hij uiteindelijk betere cijfers haalt dan studenten die alleen vertrouwen op het antwoordensleutel van de leraar.
- Het resultaat: Het artikel toont aan dat een model dat alleen is getraind om zijn eigen zelfgegenereerde checklists te volgen (zonder menselijke "Gouden" checklists), net zo goed presteerde, en soms zelfs beter, dan modellen die met menselijke checklists zijn getraind. Dit suggereert dat de AI kan "zelfevolutie" ondergaan door beter te worden in het maken van zijn eigen regels en die vervolgens te volgen.
5. Waarom het beter werkt
De auteurs verklaren dat deze methode werkt omdat het een specifiek probleem oplost: Inconsistentie.
Vaak denkt een AI: "Ik moet kort zijn", maar schrijft vervolgens een lange alinea. Het is een disconnectie tussen wat het denkt dat het moet doen en wat het echt doet.
- Think-with-Rubrics dwingt de AI om te stellen: "Ik zal kort zijn", en bewijst dit vervolgens direct door een kort antwoord te schrijven.
- De training beloont de AI niet alleen voor het juist zijn, maar voor consistent te zijn met zijn eigen plan.
Samenvatting van de resultaten
Het artikel testte dit op verschillende benchmarks (zoals IFEval en IFBench) en vond:
- De nieuwe methode versloeg de oude "Rubric-as-Reward"-methoden consequent met gemiddeld ongeveer 3,87 punten.
- Het werkte goed op zowel grote als kleine AI-modellen.
- Het maakte het denkproces van de AI korter en efficiënter (het "denken" samenvoegen tot een gestructureerde checklist).
Kort samengevat: Het artikel leert AI om te stoppen met gokken en te beginnen met plannen. Door de AI zijn eigen regelboek te laten schrijven voordat het aan het werk begint, en het vervolgens te belonen voor het vasthouden aan dat regelboek, wordt de AI betrouwbaarder, consistenter en in staat zichzelf te verbeteren zonder constante menselijke supervisie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.