Agents' Last Exam
Dit artikel introduceert Agents' Last Exam (ALE), een levende benchmark ontwikkeld met meer dan 250 experts uit de sector om AI-agenten te evalueren op langdurige, economisch waardevolle taken uit de echte wereld over 13 industriële clusters, met als doel de kloof te overbruggen tussen het huidige succes van benchmarks en betekenisvolle, voor het bbp relevante implementatie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je jarenlang een robotkok hebt getraind. Je hebt hem getest met quizzen over recepten, je hebt hem ingrediënten laten benoemen en zelfs eenvoudige instructies laten opvolgen zoals "snijd de ui". Bij deze tests haalt de robot perfecte scores. Het lijkt een culinair genie.
Maar dan vraag je de robot om daadwerkelijk een volledig, complex diner te bereiden tijdens een drukke spits in een druk restaurant. Plotseling laat de robot de saus aanbranden, vergeet hij de volgorde of raakt hij in de war door het fornuis. Het blijkt dat goed kunnen praten over koken niet hetzelfde is als goed zijn in het uitvoeren van het werk.
Dit is precies het probleem dat het artikel "Agents' Last Exam" (ALE) probeert op te lossen.
Het Probleem: De "Quiz"-valstrik
Al een tijdje testen AI-onderzoekers hun AI-agents (slimme computerprogramma's) op benchmarks die lijken op meerkeuzevragen. Deze tests zijn geweldig in het meten van wat een AI weet, maar ze meten niet wat een AI kan doen in de echte wereld.
De auteurs stellen dat het feit dat een AI een wiskundetoets of een programmeerquiz kan halen, er niet toe doet of de AI daadwerkelijk een bedrijf kan runnen, een brug kan ontwerpen of een ziekenhuisplanning kan beheren. De kloof tussen "de test halen" en "geld verdienen" is enorm.
De Oplossing: Het "Laatste Examen"
Om dit op te lossen, heeft het team ALE (Agents' Last Exam) gecreëerd. Zie dit niet als een quiz, maar als een echt, echt arbeidsgesprek voor AI.
In plaats van te vragen: "Wat is de hoofdstad van Frankrijk?" of "Schrijf een Python-loop", geeft ALE de AI een echt, chaotisch, meerdaags project dat een menselijke professional daadwerkelijk zou doen.
- De Taken: Het examen beslaat 55 verschillende beroepsvelden (zoals techniek, geneeskunde, financiën en game design).
- De Moeilijkheidsgraad: De taken zijn "long-horizon", wat betekent dat ze uren of dagen in beslag nemen om te voltooien. Ze vereisen dat de AI verschillende softwareprogramma's opent, op knoppen klikt, bestanden controleert en zijn eigen fouten herstelt, precies zoals een menselijke werknemer dat doet.
- De Bron: Dit zijn geen nep-taken die door onderzoekers zijn bedacht. Het zijn echte projecten die meer dan 250 experts uit de sector daadwerkelijk hebben uitgevoerd in hun werk. De experts hebben hun eerdere werk ingediend, en het team heeft dit omgezet in tests.
Hoe het Examen Werkt
Stel je voor dat de AI aan een computer zit in een virtueel kantoor.
- De Opdracht: De AI krijgt een echte taak, zoals "Ontwerp een mal voor een auto-onderdeel" of "Analyseer deze medische röntgenfoto's".
- De Tools: De AI moet echte software gebruiken (zoals 3D-modelleringsprogramma's, financiële spreadsheets of medische beeldvormingssoftware), net zoals een mens dat zou doen. De AI moet door menu's klikken, commando's typen en bestanden beheren.
- De Beoordeling: Dit is het slimme deel. Het examen vertrouwt niet op een menselijke docent die naar het resultaat kijkt en zegt: "Ziet er goed uit!" Dat is te traag en te subjectief. In plaats daarvan gebruikt het examen geautomatiseerde controlemechanismen.
- Als de taak was om een 3D-model te bouwen, controleert de computer of de afmetingen exact juist zijn.
- Als de taak was om een financieel rapport te schrijven, controleert de computer of de cijfers kloppen.
- Als de AI een "gate" faalt (zoals een fout maken die een machine zou laten breken), krijgt hij onmiddellijk een nul, ongeacht hoe mooi de rest van het werk eruit ziet.
De Resultaten: De AI zit Nog in School
Het artikel testte de slimste AI-agents ter wereld op dit examen. De resultaten waren sober:
- De "Makkelijke" Laag: Zelfs de beste AI-agents slaagden slechts voor ongeveer 30% van de taken die als "nabije toekomst" worden beschouwd (de makkelijkere taken).
- De "Moeilijke" Laag: Op de moeilijkste taken (de "Last Exam"-laag) was het slagingspercentage 0%. De AI kon ze helemaal niet uitvoeren.
- De Kloof: Een AI die 82% scoort op een standaard programmeertest (Terminal-Bench), haalt slechts ongeveer 25% op dit echte examen.
De auteurs noemen dit het "Last Exam" omdat het de laatste horde vertegenwoordigt. Als een AI dit kan halen, betekent dit dat hij klaar is om daadwerkelijk het werk te doen en een menselijke werknemer te vervangen. Op dit moment zegt het artikel dat de AI nog ver van het slagen af staat.
Waarom het Er Toe Doet
Het artikel gaat niet alleen over het maken van een moeilijkere test; het gaat over het veranderen van het doel.
- Huidig Doel: Maak een AI die 100% scoort op quizzen.
- Nieuw Doel: Maak een AI die 100% scoort op echte banen die economische waarde (BBP) genereren.
De auteurs geloven dat door ons te concentreren op deze echte, verifieerbare taken, we stoppen met het bouwen van AI die alleen goed is in praten en beginnen met het bouwen van AI die goed is in werken. Totdat de AI dit "Laatste Examen" kan halen, is hij niet klaar voor de echte beroepsbevolking.
Samenvattende Analogie
Beschouw de huidige AI-benchmarks als theorie-examens voor het rijbewijs. Je kunt alle verkeersregels uit je hoofd leren en een perfecte score halen. Maar ALE is het praktijkexamen waarbij je daadwerkelijk een auto moet besturen door druk verkeer, parallel moet parkeren en door een bouwzone moet navigeren zonder tegen iets aan te botsen.
Het artikel zegt: "Onze AI-chauffeurs zijn geweldig in het theorie-examen, maar ze crashen nog steeds tijdens het praktijkexamen. Laten we stoppen met het vieren van de the scores en ze leren hoe ze echt moeten rijden."
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.