Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results
Dit artikel introduceert "Every Eval Ever", een door de gemeenschap beheerd initiatief dat de versnippering van AI-evaluatieresultaten aanpakt door een uniforme JSON-schema vast te stellen, automatische converters van diverse bronnen te bieden en een door crowdsourcing beheerde repository op Hugging Face te hosten die momenteel gegevens aggregeert van meer dan 22.000 modellen en 2.000 benchmarks.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je de wereld van Kunstmatige Intelligentie (AI) voor als een enorme, chaotische sportcompetitie. Elke dag laten verschillende teams (onderzoekers en bedrijven) hun spelers (AI-modellen) door verschillende hindernisbanen (benchmarks) rennen om te zien wie de snelste of sterkste is.
Het probleem? Iedereen houdt de score op een andere manier bij.
Sommige teams schrijven hun resultaten in een schrift, anderen op een whiteboard, weer anderen in een spreadsheet, of ze tweeten gewoon één enkel getal. Eén team kan zeggen dat een speler een score van "85" haalde, maar ze vertellen je niet of ze een stopwatch of een zandloper hebben gebruikt, of dat de speler op een loopband of op een atletiekbaan rende. Vanwege deze chaos is het onmogelijk om Speler A van Team X eerlijk te vergelijken met Speler B van Team Y.
"Every Eval Ever" (EEE) is het project dat deze chaos probeert op te lossen. Zie het als de universele vertaler en de officiële scheidsrechter voor de hele AI-wereld.
Zo werkt het, eenvoudig uitgelegd:
1. Het Universele Scorebord (Het Schema)
Vóór EEE moest je optreden als een detective, op zoek naar papers, blogposts en code-logs om erachter te komen hoe een score werd berekend als je twee AI-modellen wilde vergelijken.
- De EEE-oplossing: Ze hebben een enkel, standaard "scorebord" gecreëerd (een specifiek formaat genaamd een JSON-schema).
- De analogie: Stel je voor dat elke sportcompetitie zou afspreken om exact hetzelfde scoreblad te gebruiken. In plaats van alleen "85 punten" te schrijven, moet het blad ook vermelden: "Wie heeft de test uitgevoerd? Welke regels zijn gevolgd? Wat was de temperatuur in de kamer? Werd er een stopwatch of een timer gebruikt?"
- Waarom het belangrijk is: Nu, wanneer je een score ziet, weet je precies wat het betekent en kun je het eerlijk vergelijken met een andere score, zelfs als die uit een andere bron komt.
2. De Magische Vertaler (De Converters)
Je zou kunnen denken: "Maar iedereen heeft al zijn eigen rommelige scoreborden. Hoe lossen we dat op?"
- De EEE-oplossing: Ze hebben "converters" gebouwd. Dit zijn als magische vertaaltools.
- De analogie: Stel je een vertaler voor die een handgeschreven brief in het Frans, een spreadsheet in het Duits en een spraakbericht in het Spaans kan nemen, en deze direct kan omzetten in een perfect, gestandaardiseerd Engels document.
- Hoe het werkt: Het project heeft tools gebouwd die automatisch resultaten uit populaire AI-testsoftware (zoals HELM of lm-eval) en leaderboards nemen en deze direct herformatteren naar hun nieuwe standaard scorebord.
3. De Gemeenschappelijke Bibliotheek (De Repository)
Zodra de scores zijn vertaald, waar gaan ze dan naartoe?
- De EEE-oplossing: Ze hebben een enorme, publieke bibliotheek gebouwd, gehost op een platform genaamd Hugging Face.
- De analogie: Denk aan een enorme openbare archiefkast waar iedereen zijn gestandaardiseerde scoreborden kan achterlaten. Het is niet alleen een lijst met winnaars; het is een diepe duik in de details.
- De schaal: Op dit moment bevat deze bibliotheek resultaten voor meer dan 22.000 verschillende AI-modellen die zijn getest op 2.200 verschillende uitdagingen. Het is de eerste keer dat zoveel data op deze manier op één plek is verzameld, zodat computers het daadwerkelijk kunnen lezen en vergelijken.
4. Waarom dit het spel verandert (De Casestudy's)
Het paper laat vier specifieke manieren zien waarop dit nieuwe systeem onderzoekers helpt zaken te zien die ze voorheen niet konden zien:
- Kosten vs. Nauwkeurigheid: In de wereld van "AI Agents" (robots die taken uitvoeren), toonde EEE aan dat sommige opstellingen duur zijn maar in werkelijkheid niet beter presteren. Het is alsoast beseffen dat een Ferrari je $500 per dag kost om te rijden, terwijl een Toyota je op dezelfde bestemming brengt voor $50.
- De "Perplexity" Valstrik: Onderzoekers kijken vaak naar een metriek genaamd "perplexity" om te zien hoe goed een model is in het voorspellen van tekst. EEE onthulde dat twee verschillende computerprogramma's "perplexity" op licht verschillende manieren berekenen, waardoor de cijfers vergelijkbaar lijken terwijl dat in werkelijkheid niet zo is. EEE signaleert deze verschillen zodat niemand erin wordt misleid.
- Het "Spook" in de Machine: Wanneer onderzoekers oude tests lokaal probeerden te herhalen, kwamen ze erachter dat de officiële resultaten soms gegevens misten (zoals lege antwoorden) die hun lokale kopieën wel hadden. EEE hielp deze "spookfouten" op te sporen die voor het blote oog verborgen bleven.
- Moeilijkheidsgraden: Door naar individuele vragen te kijken (en niet alleen naar de eindscore), stelde EEE onderzoekers in staat om een statistische methode (Item Response Theory) te gebruiken om precies te bepalen welke vragen te moeilijk of te makkelijk waren, wat hielp bij het ontwerpen van betere tests.
De Kernboodschap
"Every Eval Ever" is geen nieuw AI-model, en het voert zelf de tests niet uit. In plaats daarvan is het de infrastructuur die betekenis geeft aan de tests die al worden uitgevoerd.
Het verandert een stapel verwarrende, incompatibele aantekeningen in een heldere, georganiseerde en eerlijke database. Het stelt onderzoekers in staat om te stoppen met vragen: "Hebben ze dit op dezelfde manier gemeten?" en te beginnen met vragen: "Wat vertelt dit ons eigenlijk over de vooruitgang van AI?"
Het project wordt geleid door een coalitie van onderzoekers, bedrijven en universiteiten die geloven dat, als AI moet verbeteren, we allemaal dezelfde taal moeten spreken wanneer we praten over hoe goed het werkt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.