Measuring AI Ability to Complete Long Software Tasks
Dit artikel introduceert de "50%-taakvoltooiingstijdhorizon"-metriek om AI-capaciteiten te kwantificeren door deze te vergelijken met menselijke inspanning, waarbij wordt vastgesteld dat grensmodellen nu taken kunnen voltooien in 50 minuten waar mensen doorgaans 50 minuten voor nodig hebben, met een verdubbelingstrend die suggereert dat AI binnen vijf jaar maandlange softwaretaken zou kunnen automatiseren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je naar een race kijkt tussen een mens en een robot, maar in plaats van op een atletiekbaan te rennen, proberen ze beiden een gigantische, steeds groter wordende stapel softwarepuzzels op te lossen. Jarenlang hebben we geprobeerd te meten hoe goed deze AI-robots zijn met ingewikkelde tests, maar die tests voelen vaak als kunstmatige videogame-levels die niet echt vertellen hoe snel de robot daadwerkelijk kan werken in de echte wereld.
Om dit op te lossen, besloot een team onderzoekers van METR iets veel intuïtievers te meten: Hoe lang kan een AI werken voordat hij begint te falen?
Ze noemden dit de "Time Horizon" (tijdshorizon). Denk aan dit als de batterijduur van intelligentie. Als een AI een puzzel kan oplossen die een mens 10 minuten kost om af te ronden, dan is de tijdshorizon van die AI 10 minuten. Als het een taak kan afhandelen die een mens 4 uur kost, is de horizon 4 uur. De onderzoekers wilden het specifieke punt vinden waarop een AI een kans van 50% heeft om de klus correct te klaren.
De Grote Ontdekking: De Exponentiële Explosie
Het team verzamelde een enorme collectie van 170 verschillende taken, variërend van piepkleine controles van 1 seconde (zoals het opsporen van een specifieke bestandsnaam) tot enorme onderzoeksprojecten van 8 uur. Ze huurden deskundige menselijke experts in om te timen hoe lang zij nodig hadden om deze taken te voltooien. Daarna lieten ze 12 verschillende AI-modellen, van de oude GPT-2 (uitgebracht in 2019) tot de gloednieuwe o3 (uitgebracht in 2025), proberen deze taken op te lossen.
Hier is het verbazingwekkende deel: De "batterijduur" van de AI verdubbelt elke zeven maanden.
In 2019 kon de beste AI alleen betrouwbaar taken aan die een mens ongeveer 2 seconden kostten om te voltooien. Tegen 2025 konden de topmodellen (zoals o3) taken aan die een mens ongeveer 110 minuten (bijna twee uur) kosten, met een succespercentage van 50%.
De onderzoekers ontdekten dat deze groei niet zomaar een beetje sneller gaat; het is een exponentiële curve. Het is alsoals kijken naar een sneeuwbal die een heuvel afrolt, waarbij de bal bij elke boom die hij passeert twee keer zo groot wordt. Ze maten deze trend van 2019 tot 2025 en vonden dat de "verdubbelingstijd" ongeveer 207 dagen (ongeveer zeven maanden) bedraagt.
Waarom worden ze beter?
Het paper suggereert dat de AI niet alleen op een vage manier "slimmer" wordt; het wordt beter in specifieke, praktische vaardigheden. Wanneer de onderzoekers keken naar waarom de oudere modellen faalden en de nieuwere modellen slaagden, zagen ze dat de nieuwere modellen:
- Beter zijn in het gebruiken van tools: Ze weten hoe ze een rekenmachine of een code-editor moeten gebruiken zonder deze te breken.
- Beter zijn in het herstellen van fouten: Als een oude AI een fout maakte, bleef hij die fout vaak steeds opnieuw maken. De nieuwe modellen kunnen de fout herkennen, "oeps" zeggen en een ander pad proberen.
- Beter zijn in logisch redeneren: Ze kunnen een denkketen volgen zonder de draad kwijt te raken.
De "Rommelige" Nuance: Het echte leven is moeilijker
Echter, het paper is zeer voorzichtig om niet te beweren dat de robots de oorlog al gewonnen hebben. De onderzoekers stellen expliciet dat deze tests te "schoon" kunnen zijn.
Stel je voor dat de AI een videogame speelt waarbij de regels in een duidelijk handboek staan geschreven, de vijanden voorspelbaar zijn en er geen plotselinge stroomuitval is. De onderzoekers noemen echt werk "rommelig" (messy). In de echte wereld hebben taken vaak onduidelijke instructies, vereisen ze communicatie met andere mensen, of zijn er middelen die opraken.
Wanneer het team de AI testte op taken die "rommeliger" waren (minder gestructureerd, chaotischer), daalde de prestatie van de AI aanzienlijk. Het paper suggereert dat hoewel de AI geweldig wordt in de "schone" puzzels, het mogelijk nog steeds moeite heeft met de chaotische, onvoorspelbare aard van de dag van een echte software engineer. Ze vonden geen bewijs dat de verbetering van de AI op "rommelige" taken al afneemt, maar ze waarschuwen dat de kloof tussen de "schone test" en de "rommelige realiteit" een groot onbekend is.
Wat betekent dit voor de toekomst?
De onderzoekers deden wat wiskunde om te zien waar deze curve naartoe leidt. Als de trend van verdubbeling elke zeven maanden doorzet, voorspellen zij dat AI-systemen binnen 5 jaar (ergens tussen medio 2028 en medio 2031) in staat zullen zijn om autonoom softwaretaken te voltooien die momenteel een mens één maand (ongeveer 167 werkuren) kosten.
Ze benadrukken dat dit een projectie is, geen garantie. Het hangt ervan af of de AI blijft verbeteren met precies deze snelheid en of die "schone" testresultaten van toepassing zijn op de "rommelige" echte wereld. Als de trend standhoudt, zouden we binnenkort AI-agenten kunnen zien die in essentie kunnen werken als fulltime werknemers aan complexe projecten. Maar als de trend vertraagt of de "rommeligheid" van het echte leven te moeilijk blijkt, kan die tijdlijn veranderen.
De Kern van het Verhaal
Het paper beweert niet dat AI alles heeft opgelost. In plaats daarvan geeft het ons een nieuwe liniaal om vooruitgang te meten. Het laat zien dat de capaciteit van AI om langdurige, complexe taken aan te pakken gedurende de afgelopen zes jaar met een angstaanjagend tempo is gegroeid, waarbij de "werkdag" ongeveer elke zeven maanden verdubbelt. Hoewel er nog steeds grote hiaten zijn in hoe goed ze omgaan met de chaotische, echte wereld, suggereert de koers dat de dag dat een AI een maandlange werkshift zelfstandig kan draaien, dichterbij is dan we denken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.