← Nieuwste papers
🤖 AI

Agents' Last Exam

Dit artikel introduceert Agents' Last Exam (ALE), een levende benchmark ontwikkeld met meer dan 250 experts uit de sector om AI-agenten te evalueren op langdurige, economisch waardevolle taken uit de echte wereld over 13 industriële clusters, met als doel de kloof te overbruggen tussen het huidige succes van benchmarks en betekenisvolle, voor het bbp relevante implementatie.

Oorspronkelijke auteurs: Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu
Gepubliceerd 2026-06-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu, Xiaoyuan Liu, Zimeng Chen, Weiyan Shi, Amanda Dsouza, Vincent Sunn Chen, Patrick Bryant, Carl Boettiger, Yamini Rangan, Bradley Rothenberg, Kyle Steinfeld, Arvind Rao, Tapio Schneider, Georgios Yannakakis, Laure Zanna, Kaan Ozbay, Ida Sim, Tarek Zohdi, George Em Karniadakis, Jack Gallant, Teresa Head-gordon, Yushan Li, Wenxi Deng, Tao Sun, Huiqi Wang, Zhun Wang, Justin Xu, Chris Yuhao Liu, Yafei Cheng, Rongwang Hu, Aras Bacho, Shengcao Cao, Zengyi Qin, Yixiong Chen, Hengduan Fan, Hao Liu, Lin Zeng, Shashank Muralidhar Bharadwaj, Litian Gong, Yingxuan Yang, Maojia Song, Ruheng Wang, Zongzheng Zhang, Honglin Bao, Shuo Lu, Jianhong Tu, Zhonghua Wang, Zheng Zhang, Zijiao Chen, yanqiong Jiang, Zhendong Li, Bohan Lyu, Chang Ma, Peiran Xu, Benran Zhang, Shangding Gu, Haoyue Hua, Haoyang Li, Wanzhe Liao, Chengzhi Liu, Junbo Peng, Haoran Sun, Zechen Xu, Bo Chen, Jiayi Cheng, Yi Jiang, Keying Kuang, Yuan Li, Youbang Pan, Ziyan Rao, Alexander Schubert, Yifan Shen, Vincent Siu, Xiatao Sun, Kangqi Zhang, Xiaopan Zhang, Yuchen Zhu, Ishaan Singh Chandok, Lei Ding, Jingxuan Fan, Andrew Glover, Jiaming Hu, Yiran Hu, Wenbo Huang, Zixin Jiang, Haoran Jin, Lukas Kim, Ming Liu, Yang Liu, Alireza Rafiei, Xuhuan Shen, Kunyang Sun, Sophia Sun, Ting Sun, Eric Wang, Yixin Wang, Hanwen Xing, Sihan Xu, Yuzheng Xu, Zhongxing Xu, Zhiling Yan, Boqin Yuan, Ruiqi Zhang, Yifan Zhang, Zibo Zhao, Liana, Santanu Bosu Antu, Haoyue Bai, Carlo Bosio, Joseph Cavanagh, Patricia Cavazos-Rehg, Tianxing Chen, Xuewen Chen, Yipu Chen, Zhu Chenyu, Chen Dai, Stefano De Castro, Yunfu Deng, Kaustubh Dhole, Jiayuan Ding, Chenchen Du, Zhehang Du, Hao Fan, Run-ze Fan, Hengyu Fu, Shi Gu, Yifan Gu, Charlie Guo, Baihe Huang, Baixiang Huang, Rimika Jaiswal, Zhihan Jiang, Ran Jin, Erin Kasson, Xin Lan, Joseph Lee, Deren Lei, Chenyu Li, Daofeng Li, Haitao Li, Hongwei Li, Jingyan Li, Xiao Li, Yi Li, Yinsheng Li, Yuangang Li, Zhixu Li, Wenyu Liang, Longtai Liao, Kevin Qinghong Lin, AndyZeyi Liu, Che Liu, Jiaming Liu, Kaiyuan Liu, Xuan Liu, Pan Lu, Wenbo Lv, Yicheng Lv, Qiuyang Mang, Kyle Montgomery, Yuzhou Nie, Ruoxi Ning, Jorin Overwiening, Xu Pan, Layna Paraboschi, Core Francisco Park, Justin Purnomo, Swati Rajwal, Scott Rankin, Bixuan Ren, Yiren Rong, HaoYang Shang, Ventus Shaw, Fiona Shen, Jiawei Shen, Minqi Shi, Qiu Shi, Huaxiu Yao, Tianneng Shi, Jonah So, Vladislav Susoy, Hannah Szlyk, Haocheng Wang, Jialu Wang, Wei Wang, Xinyu Wang, Zehao Wang, Dowling Wong, Angela Wu, Dehao Wu, Fangyu Wu, Mengyuan "Millie" Wu, Yu Wu, Yuchen Wu, Yuhao Wu, Qingpo Wuwu, Weihang Xiao, Yongyi Xiong, Fan Xu, Ruiling Xu, Mingxuan Yan, Benjamin Yang, Jirong Yang, Sen Yang, Xiaoli Yang, Yushi Yang, Haoran Ye, Xiaohu Yu, Zhengming Yu, Chenlong Zhang, Chi Zhang, Hanning Zhang, Hanwen Zhang, Junge Zhang, Kunpeng Zhang, Song Zhang, Wenjin Zhang, Wenshuo Zhang, Ying Zhang, Yizhi Zhang, Brian Zhao, Qijian Zhao, Yimin Zhao, Yuhaohua Zheng, Liwei Zhou, Tianyue Zhou, Sichen Zhu, Siqi Zhu, Yan Zhu, Yishu Zhu, Jierui Zuo, Chonghao Cai, Helena Casademunt, Wenjia Chen, Benjamin Cheng, Nawen Deng, Rao Fu, Tianfu Fu, Yifan Han, Ren He, Zhenyu He, Qiao Jin, Lang Lang, Yuetai Li, Sylvia Liu, Lu Lu, Qing Lu, Subhabrata Mukherjee, Yunqi Ouyang, Yin Ren, Dawei Shi, Haoran Wu, Zhiyue Wu, Hannah Yao, Zhuoran Yi, Jenny Yu, Rhea Zhan, Hang Zhou, Blake Zhu, Junfan Zhu, Alan Yuille, Yang Liu, Russell Alan Poldrack, Jiachen Li, Zhenglu Li, Molei Tao, Jing Huang, Wenqi Shi, Costas Spanos, Lichao Sun, Chenguang Wang, Orson Xu, Zhen Dong, Hector Gomez, Aylin Caliskan, Ali Emami, Haimin Hu, Zhi Li, Lihui Liu, Murphy Niu, Yi Shao, Jianxin Sun, Mikko Tolonen, Ting Wang, Sanjiv Das, Yanjun Gao, Wenbo Guo, Erika J Schneider, Zhiyong Lu, Mark Mueller, Radha Poovendran, Somayeh Sojoudi, Dawn Song

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je jarenlang een robotkok hebt getraind. Je hebt hem getest met quizzen over recepten, je hebt hem ingrediënten laten benoemen en zelfs eenvoudige instructies laten opvolgen zoals "snijd de ui". Bij deze tests haalt de robot perfecte scores. Het lijkt een culinair genie.

Maar dan vraag je de robot om daadwerkelijk een volledig, complex diner te bereiden tijdens een drukke spits in een druk restaurant. Plotseling laat de robot de saus aanbranden, vergeet hij de volgorde of raakt hij in de war door het fornuis. Het blijkt dat goed kunnen praten over koken niet hetzelfde is als goed zijn in het uitvoeren van het werk.

Dit is precies het probleem dat het artikel "Agents' Last Exam" (ALE) probeert op te lossen.

Het Probleem: De "Quiz"-valstrik

Al een tijdje testen AI-onderzoekers hun AI-agents (slimme computerprogramma's) op benchmarks die lijken op meerkeuzevragen. Deze tests zijn geweldig in het meten van wat een AI weet, maar ze meten niet wat een AI kan doen in de echte wereld.

De auteurs stellen dat het feit dat een AI een wiskundetoets of een programmeerquiz kan halen, er niet toe doet of de AI daadwerkelijk een bedrijf kan runnen, een brug kan ontwerpen of een ziekenhuisplanning kan beheren. De kloof tussen "de test halen" en "geld verdienen" is enorm.

De Oplossing: Het "Laatste Examen"

Om dit op te lossen, heeft het team ALE (Agents' Last Exam) gecreëerd. Zie dit niet als een quiz, maar als een echt, echt arbeidsgesprek voor AI.

In plaats van te vragen: "Wat is de hoofdstad van Frankrijk?" of "Schrijf een Python-loop", geeft ALE de AI een echt, chaotisch, meerdaags project dat een menselijke professional daadwerkelijk zou doen.

  • De Taken: Het examen beslaat 55 verschillende beroepsvelden (zoals techniek, geneeskunde, financiën en game design).
  • De Moeilijkheidsgraad: De taken zijn "long-horizon", wat betekent dat ze uren of dagen in beslag nemen om te voltooien. Ze vereisen dat de AI verschillende softwareprogramma's opent, op knoppen klikt, bestanden controleert en zijn eigen fouten herstelt, precies zoals een menselijke werknemer dat doet.
  • De Bron: Dit zijn geen nep-taken die door onderzoekers zijn bedacht. Het zijn echte projecten die meer dan 250 experts uit de sector daadwerkelijk hebben uitgevoerd in hun werk. De experts hebben hun eerdere werk ingediend, en het team heeft dit omgezet in tests.

Hoe het Examen Werkt

Stel je voor dat de AI aan een computer zit in een virtueel kantoor.

  1. De Opdracht: De AI krijgt een echte taak, zoals "Ontwerp een mal voor een auto-onderdeel" of "Analyseer deze medische röntgenfoto's".
  2. De Tools: De AI moet echte software gebruiken (zoals 3D-modelleringsprogramma's, financiële spreadsheets of medische beeldvormingssoftware), net zoals een mens dat zou doen. De AI moet door menu's klikken, commando's typen en bestanden beheren.
  3. De Beoordeling: Dit is het slimme deel. Het examen vertrouwt niet op een menselijke docent die naar het resultaat kijkt en zegt: "Ziet er goed uit!" Dat is te traag en te subjectief. In plaats daarvan gebruikt het examen geautomatiseerde controlemechanismen.
    • Als de taak was om een 3D-model te bouwen, controleert de computer of de afmetingen exact juist zijn.
    • Als de taak was om een financieel rapport te schrijven, controleert de computer of de cijfers kloppen.
    • Als de AI een "gate" faalt (zoals een fout maken die een machine zou laten breken), krijgt hij onmiddellijk een nul, ongeacht hoe mooi de rest van het werk eruit ziet.

De Resultaten: De AI zit Nog in School

Het artikel testte de slimste AI-agents ter wereld op dit examen. De resultaten waren sober:

  • De "Makkelijke" Laag: Zelfs de beste AI-agents slaagden slechts voor ongeveer 30% van de taken die als "nabije toekomst" worden beschouwd (de makkelijkere taken).
  • De "Moeilijke" Laag: Op de moeilijkste taken (de "Last Exam"-laag) was het slagingspercentage 0%. De AI kon ze helemaal niet uitvoeren.
  • De Kloof: Een AI die 82% scoort op een standaard programmeertest (Terminal-Bench), haalt slechts ongeveer 25% op dit echte examen.

De auteurs noemen dit het "Last Exam" omdat het de laatste horde vertegenwoordigt. Als een AI dit kan halen, betekent dit dat hij klaar is om daadwerkelijk het werk te doen en een menselijke werknemer te vervangen. Op dit moment zegt het artikel dat de AI nog ver van het slagen af staat.

Waarom het Er Toe Doet

Het artikel gaat niet alleen over het maken van een moeilijkere test; het gaat over het veranderen van het doel.

  • Huidig Doel: Maak een AI die 100% scoort op quizzen.
  • Nieuw Doel: Maak een AI die 100% scoort op echte banen die economische waarde (BBP) genereren.

De auteurs geloven dat door ons te concentreren op deze echte, verifieerbare taken, we stoppen met het bouwen van AI die alleen goed is in praten en beginnen met het bouwen van AI die goed is in werken. Totdat de AI dit "Laatste Examen" kan halen, is hij niet klaar voor de echte beroepsbevolking.

Samenvattende Analogie

Beschouw de huidige AI-benchmarks als theorie-examens voor het rijbewijs. Je kunt alle verkeersregels uit je hoofd leren en een perfecte score halen. Maar ALE is het praktijkexamen waarbij je daadwerkelijk een auto moet besturen door druk verkeer, parallel moet parkeren en door een bouwzone moet navigeren zonder tegen iets aan te botsen.

Het artikel zegt: "Onze AI-chauffeurs zijn geweldig in het theorie-examen, maar ze crashen nog steeds tijdens het praktijkexamen. Laten we stoppen met het vieren van de the scores en ze leren hoe ze echt moeten rijden."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →