← Nieuwste papers
🤖 AI

How Inference Compute Shapes Frontier LLM Evaluation

Dit artikel toont aan dat de prestaties van frontier LLM's zeer gevoelig zijn voor de budgetten voor inferentie-tijd en evaluatieprotocollen, waarbij wordt betoogd dat benchmarks capaciteiten moeten rapporteren als een functie van de beschikbare rekenkracht in plaats van te vertrouwen op beperkende vaste budgetten die het potentieel van een model kunnen onderschatten.

Oorspronkelijke auteurs: Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

Gepubliceerd 2026-06-17
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jessica McFadyen, Ole Jorgensen, Harry Coppock, Kevin Wei, Cozmin Ududec

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een team van briljante detectives test om te zien wie de beste is in het oplossen van complexe mysteries. In het verleden zou je hen misschien een strikte regel hebben gegeven: "Je hebt 10 minuten en één kans om je antwoord op te schrijven." Als ze faalden, zou je zeggen: "Deze detective is niet goed genoeg."

Maar dit artikel betoogt dat deze methode onrechtvaardig is. Het suggereert dat sommige detectives gewoon meer tijd nodig hadden, een tweede kans om hun werk te controleren, of een hint dat hun eerste gok fout was. Als je hen die dingen had gegeven, hadden ze het mysterie perfect kunnen oplossen.

De onderzoekers testten dit idee met de meest geavanceerde AI-modellen ter wereld (de "detectives") op zeven zeer moeilijke uitdagingen, variërend van het schrijven van computercode en het oplossen van geavanceerde wiskundeproblemen tot het diagnosticeren van medische gevallen en het hacken van cybersecurity-systemen.

Hier is wat ze vonden, eenvoudig uitgelegd:

1. De "Tijdslimiet"-valstrik

De meeste AI-tests geven de modellen een strikte limiet op hoeveel "denktijd" (tokens) ze mogen gebruiken. De onderzoekers ontdekten dat voor veel moeilijke taken deze limiet de AI afkapt precies op het moment dat het net iets gaat begrijpen.

  • De Analogie: Stel je een student voor die een wiskundetoets maakt. De student weet hoe hij de som moet oplossen, maar de leraar stopt de toets na 10 minuten. De student krijgt een onvoldoende, niet omdat hij geen wiskunde kan, maar omdat de tijd op was.
  • Het Resultaat: Wanneer de onderzoekers de AI-modellen veel meer tijd gaven (tot wel 30 keer meer dan gebruikelijk), steeg hun score aanzienlijk op moeilijke taken zoals geavanceerde wiskunde en cybersecurity. Echter, bij sommige taken (zoals bepaalde software engineering-problemen) hadden de modellen al zoveel als ze konden opgelost binnen de normale tijdslimiet, waardoor het geven van meer tijd niet veel hielp.

2. Het "Tweede Kans"-effect

De onderzoekers testten ook wat er gebeurt als ze de AI een tweede poging laten doen na een mislukte poging.

  • De Analogie: Denk aan een videogame. Als je doodgaat, verlies je dan gewoon? Of krijg je een nieuw leven om een andere strategie te proberen?
  • Het Resultaat: Het de AI laten "opnieuw starten" of een nieuw antwoord in te dienen, verbeterde de scores op bijna elke test.
    • Met een Hint: Als de AI te horen kreeg: "Dat antwoord was fout, probeer het opnieuw," werd het veel beter in het vinden van de juiste oplossing, vooral bij lange, complexe taken.
    • Zonder een Hint: Als de AI gewoon zelf moest gokken zonder te weten of het goed of fout was, verbeterde het ook, maar niet zo sterk.
    • De Haken en Grenzen: Bij sommige tests had de AI slechts één of twee pogingen nodig om het goed te krijgen. Bij andere moest het wel 10 of 15 keer proberen voordat het eindelijk slaagde.

3. One Size Does Not Fit All (Niet voor alles is dezelfde oplossing geschikt)

De belangrijkste bevinding is dat verschillende soorten problemen verschillende soorten "hulp" nodig hebben.

  • De Analogie: Stel je voor dat je een gereedschapskist hebt. Een hamer is geweldig voor spijkers, maar nutteloos voor schroeven. Je kunt niet zomaar een hamer op alles gebruiken en verwachten dat het werkt.
  • Het Resultaat:
    • Cybersecurity en Wiskunde: Deze taken hielden van meer tijd en meer pogingen. De AI werd steeds beter naarmate hij langer doorwerkte.
    • Medische Diagnose: Deze taak verbeterde niet veel met meer tijd. Het leek erop dat de AI een muur raakte waarbij meer nadenken niet meer hielp.
    • Software Engineering: Deze taken verbeterden een beetje met meer tijd, maar ze hadden vooral nodig dat ze weer opnieuw mochten proberen.

4. Nieuwere Modellen zijn Anders

De onderzoekers testten modellen uit verschillende jaren (oudere versus nieuwere generaties).

  • De Analogie: Denk aan oudere modellen als juniordetectives die veel tijd en veel hints nodig hebben om een zaak op te lossen. Nieuwere modellen zijn als ervaren detectives; ze kunnen moeilijkere zaken oplossen en zijn betrouwbaarder, maar ze worden niet noodzakelijkerwijs sneller in het gebruiken van hun tijd.
  • Het Resultaat: Nieuwere modellen werden niet alleen "sneller" in het gebruik van hun tijd. In plaats daarvan werden ze beter in:
    1. Het ontsluiten van moeilijkere taken: Ze konden problemen oplossen waar de oudere modellen helemaal niet tegenop kwamen.
    2. Betrouwbaarheid: Wanneer ze een probleem oplosten, waren ze minder geneigd om bij de tweede poging een fout te maken.
    • Interessant genoeg hadden de nieuwste modellen soms niet zo veel "tweede kansen" nodig omdat ze het antwoord de eerste keer vaker goed hadden.

De Grote Conclusie

Het artikel betoogt dat we de werkelijke intelligentie van een AI niet kunnen beoordelen aan de hand van één score uit één enkele test met een strikte tijdslimiet.

  • De Score Hangt Af van de Regels: De score van een AI verandert afhankelijk van hoeveel tijd je geeft, of je ze een tweede kans laat maken, en of je hen vertelt of ze het goed of fout hebben.
  • De Aanbeveling: In plaats van te zeggen "Model X scoort 80%", zouden we moeten zeggen: "Model X scoort 80% met 1 minuut, maar 95% met 10 minuten." Dit geeft een veel duidelijker beeld van wat de AI daadwerkelijk kan, vooral voor veiligheids- en beleidsbeslissingen waarbij we het maximale potentieel van deze systemen moeten kennen, niet alleen hun prestaties onder druk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →