← Nieuwste papers
💻 computer science

Think Fast: Estimating No-CoT Task-Completion Time Horizons of Frontier AI Models

Dit artikel evalueert het vermogen van frontier AI-modellen om complexe redeneringen uit te voeren zonder expliciete chain-of-thought tokens door hun taakvoltooiingstijdhorizon te meten tegenover menselijke baselines, waarbij een trend wordt onthuld van een jaarlijkse verdubbeling van de prestaties en wordt geprojecteerd dat deze modellen tegen 2030 in staat zouden kunnen zijn om taken op te lossen die in één passage meer dan 25 minuten menselijke inspanning vereisen.

Oorspronkelijke auteurs: Dewi Gould, Francis Rhys Ward, Anders Cairns Woodruff, Rauno Arike, Josh Hills, Alex Serrano, Ida Caspary, Jason Ross Brown, Jo J. Jiao, Patrick Leask, Twm Stone, Ram Potham, Ionut Gabriel Stan, Harry
Gepubliceerd 2026-08-05
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Dewi Gould, Francis Rhys Ward, Anders Cairns Woodruff, Rauno Arike, Josh Hills, Alex Serrano, Ida Caspary, Jason Ross Brown, Jo J. Jiao, Patrick Leask, Twm Stone, Ram Potham, Ionut Gabriel Stan, Harry Mayne, Simeon Hellsten, Shubhorup Biswas, Ariana Azarbal, William L. Anderson, Elle Najt, Ryan Greenblatt, Julian Stastny

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je naar een goochelaar kijkt die een truc uitvoert. Meestal legt de goochelaar zijn proces aan je uit: "Ik ga de kaarten schudden, dan kijk ik naar de bovenste, en nu ga ik hem laten verdwijnen." Dit praatgedeelte is als de "Chain of Thought" (CoT) van een AI. Het is het stapsgewijze redeneren dat het model aan ons laat zien voordat het een antwoord geeft. Veiligheidsexperts houden hiervan omdat ze het "denken" kunnen beluisteren om er zeker van te zijn dat de AI niets gevaarlijks plant, zoals liegen of proberen zijn menselijke toezichthouders te misleiden.

Maar wat als de goochelaar volledig zou stoppen met praten? Wat als hij al dat complexe geschud, gekijk en geplan volledig in zijn hoofd kon doen, in totale stilte, en dan alleen maar met een knip van zijn vingers het antwoord onthulde? Als een AI dit kan, worden de veiligheidsmonitors in het duister gelaten, niet in staat om het "denken" te zien dat een slecht plan zou kunnen verbergen. Dit artikel stelt een grote, licht angstaanjagende vraag: hoeveel kunnen deze superintelligente AI-modellen eigenlijk in hun hoofd doen zonder ons ook maar één woord van hun werk te laten zien?

De onderzoekers besloten dit uit te zoeken door frontier AI-modellen door een enorme hindernisbaan van meer dan 30.000 puzzels, wiskundige problemen, programmeeruitdagingen en logische spellen te sturen. Maar er was een addertje onder het gras: ze dwongen de modellen om direct te antwoorden, zonder enige "thinking tokens" of interne monoloog. Ze wilden de "Time Horizon" meten — een chique manier om te vragen: "Hoe lang zou het een mens kosten om hetzelfde probleem op te lossen dat de AI zojuist in een fractie van een seconde heeft opgelost?"

Dit is wat ze ontdekten. In de afgelopen zes jaar zijn deze AI-modellen ongelooflijk goed geworden in stil denken. In 2019 kon een AI alleen problemen oplossen die een mens in een fractie van een seconde zonder hulp kon doen. Maar tegen de tijd van de projecties van deze studie voor 2026, worden de nieuwste modellen (zoals GPT-5.5) geschat in staat te zijn om problemen op te lossen die een mens meer dan 3 minuten zouden kosten om uit te vogelen, allemaal zonder een woord van hun redenering te zeggen.

De groei vindt razendsnel plaats. De onderzoekers ontdekten dat de complexiteit van deze stille taken ongeveer elke twee jaar verdubbelt (specifiek, elke 373 dagen). Het is alsoat de AI leert om een jaar aan mentale gymnastiek te doen in slechts één kalenderjaar. Als deze trend zich voortzet, kunnen deze modellen tegen 2028 mogelijk stille taken oplossen die mensen 7 minuten kosten, en tegen 2030 zou dat kunnen springen naar 25 minuten aan pure, verborgen mentale arbeid.

Om hun berekeningen te controleren, keken ze ook naar hoeveel "reasoning tokens" (het digitale equivalent van denkstappen) een referentiemodel nodig zou hebben om precies dezelfde problemen op te lossen. Ze ontdekten dat de stille capaciteit van de AI ook elk jaar verdubbelt in termen van deze tokens, waarbij het voor de nieuwste modellen meer dan 1.500 tokens aan verborgen verwerkingskracht bereikt.

Het artikel suggereert dat hoewel we niet 100% zeker kunnen zijn over de toekomst (de cijfers hebben een brede reeks mogelijkheden), de trend duidelijk is: AI-modellen krijgen razendsnel het vermogen om complexe, meerstapsredeneringen volledig in hun "geest" te voltooien zonder dat ze dit aan ons laten zien. Dit betekent dat het vertrouwen op het beluisteren van de gedachten van een AI om het veilig te houden, in de nabije toekomst veel moeilijker kan worden, omdat de AI al dat denken misschien gewoon in stilte doet. De auteurs dringen er bij ontwikkelaars op aan om dit "stille" vermogen nauwlettend te blijven volgen, omdat het voorspelbaar groeit en de manier waarop we deze krachtige systemen monitoren fundamenteel kan veranderen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →