OckBench: Measuring the Efficiency of LLM Reasoning
Dit artikel introduceert OckBench, de eerste benchmark die zowel de nauwkeurigheid als de token-efficiëntie van grote taalmodellen bij redeneer- en programmeertaken gezamenlijk evalueert, waarbij significante inefficiënties in huidige modellen worden onthuld en wordt gepleit voor een paradigmaverschuiving naar het optimaliseren van tokengebruik.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je twee mensen inhuurt om een complexe puzzel op te lossen.
Persoon A kijkt naar de puzzel, denkt even na en zegt: "Het antwoord is 42."
Persoon B besteedt drie uur aan het schrijven van een essay van 50 pagina's over de geschiedenis van getallen, de filosofie van de logica en hun jeugdherinneringen, om uiteindelijk te fluisteren: "Het antwoord is 42."
Beide mensen hadden het juiste antwoord. Maar als je hen zou betalen per gesproken woord, zou Persoon B je een fortuin kosten, er eeuwig over doen en veel energie verspillen.
Dit artikel, OckBench, is in feeklijk een rapportcijfer dat stopt met het beoordelen van AI-modellen enkel op of ze het juiste antwoord geven. In plaats daarvan beoordeelt het ze op hoe efficiënt ze daar komen. Het past "Occam's Razor" toe op AI: Entiteiten mogen niet zonder noodzaak worden vermenigvuldigd. Met andere woorden: gebruik geen 1.000 woorden als er 10 genoeg zijn.
Hier is de uitsplitsing van wat de onderzoekers hebben ontdekt, eenvoudig uitgelegd:
1. Het Probleen: De "Chatty" AI-belasting
Huidige AI-benchmarks zijn als een meerkeuzetoets die alleen geeft om het feit of je het juiste lettertje hebt ingevuld. Ze geven niet om het feit of je een roman in de marge hebt geschreven om daar te komen.
De onderzoekers merkten op dat moderne AI-modellen (zoals GPT-5.5 of Claude) erg goed zijn geworden in redeneren, maar ook ongelooflijk verbaal zijn geworden. Ze genereren enorme hoeveelheden tekst ("reasoning traces") om problemen op te lossen. Dit is duur. Elk extra woord kost geld, verhoogt de wachttijden en verbruikt meer elektriciteit.
2. De Oplossing: OckBench en OckScore
Om dit blinde vlek te corrigeren, creëerde het team OckBench. Het is een specifieke set van 200 moeilijke vragen in wiskunde, codering en wetenschap.
Maar hier is de truc: Ze hebben niet zomaar willekeurige vragen gekozen. Ze gebruikten een "Differentiatiefilter." Ze kozen specifiek vragen waarbij sommige AI's korte, slimme antwoorden geven en anderen lange, warrige antwoorden. Dit legt de "efficiëntiekloof" bloot.
Ze hebben ook een nieuwe score uitgevonden genaamd OckScore.
- Oude manier: Score = Nauwkeurigheid.
- OckScore: Score = Nauwkeurigheid minus een straf voor te veel woorden gebruiken.
Denk aan een golfscore. Je wilt het laagste getal (hoogste nauwkeurigheid), maar als je 20 slagen nodig hebt om de bal in de hole te krijgen (te veel tokens), wordt je score slechter. De beste spelers laten de bal in één of twee slagen binnen.
3. De Drie Grote Ontdekkingen
Ontdekking 1: De "Overthinking Tax"
Je zou kunnen aannemen dat kleinere, goedkopere AI-modellen altijd beter zijn voor je portemonnee. OckBench laat zien dat dit vaak niet waar is.
Kleinere modellen lijden vaak onder een "Overthinking Tax" (overdenkingsbelasting). Omdat ze minder slim zijn, proberen ze dat te compensen door veel te praten. Ze dwalen af, herhalen zichzelf en genereren enorme muren van tekst om het antwoord te vinden.
- Voorbeeld: Een klein model kost misschien slechts centen per woord, maar omdat het 100.000 woorden schrijft om een probleem op te lossen, kost het uiteindelijk meer dan een slimmer model dat het oplost in 5.000 woorden.
Ontdekking 2: De Open vs. Gesloten Kloof
Er is een groot verschil tussen "gesloten" modellen (zoals die van OpenAI of Anthanthropic) en "open-weight" modellen (zoals DeepSeek of Qwen, die publiekelijk beschikbaar zijn).
- Gesloten Modellen: Deze zijn als efficiënte chirurgen. Ze snijden recht naar de kern van het probleem.
- Open Modellen: Deze zijn als enthousiaste stagiairs. Ze worden steeds beter in het geven van het juiste antwoord, maar ze zijn nog steeds erg praatgraag.
Het artikel laat zien dat een open model dezelfde nauwkeurigheid kan hebben als een gesloten model, maar dat het mogelijk 26 keer meer woorden gebruikt om daar te komen. Dat is een enorme verspilling van middelen.
Ontdekking 3: "Per-Token Intelligentie"
De onderzoekers hebben een nieuwe term bedacht: Per-Token Intelligentie. Dit meet hoeveel "slimheid" er in elk woord zit dat de AI genereert.
- Hoge Per-Token Intelligentie: De AI zegt alleen wat noodzakelijk is. Compact, precies, efficiënt.
- Lage Per-Token Intelligentie: De AI vult de ruimte met onzin. Verspreid, repetitief, inefficiënt.
Verrassend genoeg hebben de slimste modellen de neiging om een hogere Per-Token Intelligentie te hebben. Naarmate modellen slimmer worden, worden ze in hun antwoorden eigenlijk korter, omdat ze niet hoeven te ronddwalen om het antwoord te vinden.
4. Kunnen we dit oplossen?
Ja. Het artikel laat zien dat we modellen kunnen leren om minder praatgraag te zijn zonder dommer te worden.
- Modellen Mixen: Door een "denkend" model te mengen met een standaard model, konden ze het aantal woorden halveren terwijl de nauwkeurigheid stabiel bleef.
- Training: Door modellen te trainen om zichzelf te straffen voor te lange antwoorden (zoals een leraar die zegt: "Wees beknopt!"), kunnen ze de "Overthinking Tax" verminderen.
De Kernboodschap
Het artikel betoogt dat de AI-gemeenschap van mindset moet veranderen. We moeten niet alleen vragen: "Heeft de AI het juiste antwoord gegeven?" We moeten ook vragen: "Is het daar gekomen zonder onze tijd, ons geld en onze elektriciteit te verspillen?"
In de toekomst zal de beste AI niet alleen de slimste zijn; het zal de meest beknopte zijn. Zoals de titel suggereert, moeten we Occam's Razor toepassen: Vermenigvuldig tokens niet zonder noodzaak.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.