← Nieuwste papers
🤖 AI

The Necessity of a Unified Framework for LLM-Based Agent Evaluation

Dit artikel betoogt dat het huidige gebrek aan standaardisatie bij de evaluatie van op LLM's gebaseerde agenten, veroorzaakt door verstorende factoren zoals wisselende prompts en omgevingen, een verenigd kader vereist om een eerlijke, reproduceerbare en strenge beoordeling van modelprestaties te waarborgen.

Oorspronkelijke auteurs: Pengyu Zhu, Li Sun, Philip S. Yu, Sen Su

Gepubliceerd 2026-05-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Pengyu Zhu, Li Sun, Philip S. Yu, Sen Su

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Blind Proeverij"

Stel je voor dat je wilt ontdekken welke chef-kok het beste is in het bereiden van een specifiek gerecht. Je organiseert een blind proefje. Er is echter een addertje onder het gras:

  • Chef A krijgt een high-end, professionele oven, premium ingrediënten en een sous-chef om het groente te snijden.
  • Chef B krijgt een roestige broodrooster, bevroren ingrediënten en geen hulp whatsoever.

Als Chef A een heerlijk maaltje maakt en Chef B de zijne verbrandt, zou je kunnen denken dat Chef A de betere kok is. Maar in werkelijkheid lag het verschil in het resultaat niet alleen aan de vaardigheden van de koks; het ging om de keukens waarin ze werkten.

Dit is precies het probleem dat het artikel identificeert bij Large Language Model (LLM) Agents.

Momenteel, wanneer onderzoekers AI-agenten testen (AI die gereedschappen kan gebruiken, plannen kan maken en beslissingen kan nemen), wikkelen ze elke AI in een andere "keuken" (een zogenaamde harness). De ene AI krijgt misschien een chique prompt, een slim geheugensysteem en een strikte gereedschapsinterface. De andere krijgt een simpele prompt en een rommelige interface. Wanneer de scores binnenkomen, weten we niet of de AI slimmer is, of dat het gewoon een betere "keuken" heeft gekregen.

De Oplossing van het Artikel: Een Gestandaardiseerd "Racecircuit"

De auteurs stellen dat we voor een eerlijke vergelijking van AI-modellen een Gecentraliseerd Kader nodig hebben. Denk hierbij aan het bouwen van één enkel, gestandaardiseerd Racecircuit waar alle auto's (AI-modellen) op moeten rijden.

  • De Auto (Het AI-model): Dit is wat we willen testen. Is het snel? Is het efficiënt?
  • Het Circuit (De Harness & Omgeving): Dit omvat het wegdek, het weer, het brandstoftype en de regels van de race.

Het artikel stelt: Houd het circuit voor iedereen exact hetzelfde.
Als we het circuit (de prompts, de geheugengereedschappen, de manier waarop de AI met internet communiceert) voor elke individuele test veranderen, kunnen we niet zeggen of een snellere tijd komt omdat de auto beter is of omdat het wegdek gladder was.

Wat Er Gerepareerd Moet Worden (De "Circuit"-onderdelen)

Het artikel breekt de "keuken" of het "circuit" op in vijf specifieke onderdelen die gestandaardiseerd moeten worden zodat ze de resultaten niet verstoren:

  1. De Verkeersregels (Inferentie): Soms wordt één AI geblokkeerd door een veiligheidsfilter terwijl een andere dat niet is, puur omdat ze verschillende internetproviders gebruiken. De test moet ervoor zorgen dat de regels voor iedereen hetzelfde zijn.
  2. De Handleiding (Prompting): Sommige AI-tests geven het model een instructie van 200 woorden, terwijl anderen een handleiding van 2.000 woorden geven die de AI in feite precies vertelt hoe hij moet denken. Het artikel stelt dat de taak anders kan zijn, maar de manier waarop de instructies worden gegeven, moet hetzelfde blijven.
  3. Het Notitieboekje (Geheugen): Sommige AI-agenten krijgen een perfect georganiseerd notitieboekje om eerdere gebeurtenissen te onthouden. Anderen krijgen een rommelige stapel papier waar oude informatie willekeurig wordt weggegooid. De test moet ervoor zorgen dat elke AI hetzelfde type notitieboekje krijgt.
  4. De Gereedschapsriem (Aanroepen van Gereedschappen): Sommige AI-modellen worden aangeleerd om gereedschappen in een zeer strikt formaat te gebruiken; anderen mogen slordig zijn. Als één AI faalt omdat hij een komma mist in een gereedschapsoproep, maar een andere slaagt omdat de test soepel was, is dat geen eerlijke vergelijking.
  5. De Wereld (Omgeving): Dit is een groot punt. Als een AI wordt getest op een "live" website, kan die website morgen veranderen. Als de AI faalt omdat de website is veranderd, is dat niet de schuld van de AI. Het artikel stelt dat we "bevroren" momentopnames van de wereld moeten gebruiken zodat de omgeving tijdens de test niet verandert.

Waarvoor Dit Kader NIET Is

De auteurs zijn zeer voorzichtig om te zeggen waarvoor dit kader niet bedoeld is:

  • Het probeert niet innovatie in AI-producten uit de echte wereld te stoppen. Bedrijven zoals Anthropic of OpenAI moeten nog steeds vrij zijn om de meest verbazingwekkende, complexe en innovatieve "keukens" voor hun producten te bouwen.
  • Het probeert niet alle AI hetzelfde te laten lijken.
  • Het is alleen voor de wetenschappelijke test (het "examen").

Denk hierbij aan Formule 1-racing:

  • De Motor (Het AI-model): Dit is wat de fabrikanten willen verbeteren.
  • De Reglementen (Het Gecentraliseerde Kader): De FIA (racingbond) stelt strenge regels op voor bandenmaat, brandstof en chassisafmetingen.
  • Waarom? Zodat wanneer één auto sneller is dan een andere, we weten dat het komt door de motor, en niet omdat het ene team betere banden gebruikte of een ander brandstof.

Het Voorgestelde Plan

Het artikel stelt een driedelig systeem voor om dit op te lossen:

  1. Een Gecontroleerd Substraat: Een standaard "drager" die de prompts, het geheugen en de gereedschappen constant houdt voor elke test.
  2. Een Gestandaardiseerde Scoremethode: In plaats van alleen "Geslaagd/Niet Geslaagd" te zeggen, moeten we meten hoe de AI het deed (nam het te veel stappen? gebruikte het te veel geheugen?).
  3. Versiebeheer: Omdat technologie snel gaat, moet dit "reglement" versies hebben (zoals v1.0, v2.0). Als de regels veranderen, vergelijken we geen scores van de oude versie met de nieuwe versie, net zoals we de rondetijd van een auto uit 2020 niet vergelijken met die uit 2024 zonder rekening te houden met de nieuwe regels.

Samenvatting

Het artikel beweert dat we momenteel appels met peren vergelijken, omdat elke AI-test een andere opstelling gebruikt. Om echt te weten welke AI de "slimste" is, moeten we ze allemaal in exact dezelfde kamer zetten, ze exact dezelfde gereedschappen geven en kijken hoe ze dezelfde problemen oplossen. Alleen dan kunnen we zeggen: "Deze AI is beter", in plaats van: "Deze AI kreeg een betere opstelling."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →