Messier: A High-Resolution Corpus for Cross-Benchmark Agent Evaluation
Het artikel introduceert Messier, een verenigde hoog-resolutie corpus van bijna één miljoen gestandaardiseerde records verspreid over 30 benchmarks en diverse domeinen, wat uitgebreide cross-benchmark evaluatie van agenten mogelijk maakt, ongelijke vooruitgang tussen taaltypen onthult, en een fundamentele infrastructuur biedt voor het auditen en opschalen van AI-agent-capaciteiten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert uit te zoeken welk videogamepersonage absoluut de beste is in alles. Je hebt een personage dat geweldig is in springen, een ander die een wizz in het oplossen van wiskundige puzzels is, en een derde die een doolhof perfect kan navigeren. Maar hier komt de crux: elke game meet "vaardigheid" anders. De ene game geeft je een gouden ster voor het overspringen van een enkele kuil, terwijl de andere vereist dat je een complexe algebraïsche vergelijking oplost om een deur te openen, en een derde eist dat je elke enkele munt in een level verzamelt zonder één vijand aan te raken. Als je alleen naar de eindscore kijkt—een enkel getal zoals "95%"—zou je kunnen denken dat ze allemaal even goed zijn. Maar dat getal verbergt de rommelige details. Faalde het personage omdat het niet kon springen, of omdat het vastliep bij een deur? Kreeg het 95% omdat het alles perfect deed, of omdat het één klein dingetje fout deed en de game de hele run als een nul telde?
Dit is exact het probleem waar wetenschappers die AI-agenten bestuderen tegenaan lopen. Dit zijn niet alleen chatbots; het zijn digitale werkers die tools kunnen gebruiken, code kunnen schrijven, het web kunnen browsen en beslissingen kunnen nemen in realtime-omgevingen. Op dit moment zijn er honderden verschillende tests (benchmarks), maar ze spreken allemaal verschillende talen. Sommige tests zijn streng: als je één stap in een recept van 10 stappen mist, krijg je een nul. Anderen zijn milder. Daarom is het ontzettend moeilijk om een agent die goed is in coderen te vergelijken met een agent die goed is in juridisch onderzoek. Het is also[t] een marathonloper te vergelijken met een schaakgrootmeester met behulp van slechts één enkele "atletischiteitsscore". Om te begrijpen hoe AI daadwerkelijk verbetert, moeten we onder de motorkap van deze scores kijken en precies zien waar de agents succesvol zijn en waar ze struikelen.
Maak kennis met MESSIER, een enorm nieuw project dat fungeert als een gigantische, universele vertaler voor AI-testen. De onderzoekers achter MESSIER hebben niet alleen een nieuwe test gebouwd; ze hebben een enorme bibliotheek gebouwd die de resultaten van 30 verschillende bestaande tests verzamelt, die 11.891 specifieke taken beslaat en 74.205 verschillende manieren om te controleren of een agent geslaagd is. Ze verzamelden gegevens van 714 verschillende AI-agents en voerden zelfs nieuwe, verse tests uit op zes moeilijke gebieden waar data ontbrak, zoals juridische beoordelingen en quantum circuit design. In totaal hebben ze bijna één miljoen proefverslagen georganiseerd in één net, gestandaardiseerd formaat. Denk aan het nemen van een chaotische stapel bonnetjes van 30 verschillende winkels, elk geschreven in een andere valuta en met andere rekenregels, en het omzetten van al die bonnen naar één helder spreadsheet waarmee je precies kunt zien wat er is gekocht, hoeveel het kostte en welke winkel de beste deals had.
Het meest opwindende wat MESSIER heeft gevonden, is dat de manier waarop we punten tellen het verhaal verandert. Het artikel laat zien dat veel tests een "strikte" regel hanteren: als een agent zelfs maar één klein onderdeel van een taak niet haalt, wordt het hele ding als een mislukking gemarkeerd. De onderzoekers lieten zien dat als ze deze regel versoepelden en keken naar hoeveel delen de agent wel goed kreeg, het beeld van vooruitgang er heel anders uitziet. Bijvoorbeeld, op een juridische benchmark zei de strikte "alles-of-niets"-score dat agents slechts 0,2% van de tijd slaagden. Maar toen ze naar de details keken, ontdekten ze dat agents gemiddeld 28,8% van de criteria voldeden. De strikte regel verborg een grote mate van gedeelde voortgang. Dit suggereert dat hoewel AI beter wordt, de manier waarop we het meten misschien te hard is, waardoor het lijkt alsof agents vaker falen dan ze in werkelijkheid doen.
De studie bracht ook in kaart waar AI echt "wint" en waar het nog steeds moeite heeft. Ze vonden dat AI bijna perfect is in "function calling" (het gebruik van tools), met een succespercentage van 0,97. Het is ook erg goed geworden in programmeren en verbetert snel over de afgelopen twee jaar. Echter, AI heeft nog steeds moeite met "enterprise workflows"—complexe, meerstaps kantoorbanen zoals het beheren van een bedrijfsproces. In deze gebieden ligt het succespercentage slechts op 0,57, wat betekent dat agents vaker falen dan ze slagen. De onderzoekers bewezen ook dat je deze enorme bibliotheek kunt gebruiken om een nieuwe "vaardigheidsschaal" voor AI te creëren die zeer nauw aansluit bij andere belangrijke ranglijsten (met een correlatie van 0,81), zonder dat je miljoenen dollars hoeft uit te geven aan het draaien van nieuwe tests.
Uiteindelijk is MESSIER een instrument voor helderheid. Het suggereert dat door naar de kleine details van hoe een agent faalt te kijken, in plaats van alleen naar de eindscore, we een veel waarder beeld krijgen van wat AI daadwerkelijk kan. Het zegt niet dat AI alles heeft opgelost, maar het suggereert wel dat onze huidige meetlatten misschien te bot zijn. Door deze resultaten te standaardiseren, hopen de auteurs dat ze verspilling van geld aan het herhalen van dezelfde tests kunnen voorkomen en onderzoekers kunnen helpen begrijpen welke taken AI al kan uitvoeren en welke taken nog een menselijke hand nodig hebben. De data staat nu open voor iedereen om te gebruiken, waardoor een verwarrende bende van cijfers wordt omgezet in een heldere kaart van het AI-landschap.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.