← Nieuwste papers
💻 computer science

AgentPulse: A Continuous Multi-Signal Framework for Evaluating AI Agents in Deployment

AgentPulse introduceert een continu, multi-signaal evaluatiekader dat statische benchmarks aanvult door real-time data uit adoptie-, gemeenschaps- en ecosysteembronnen te aggregeren om een holistische beoordeling te bieden van de prestaties en impact van AI-agenten in daadwerkelijke implementatiescenario's.

Oorspronkelijke auteurs: Yuxuan Gao, Megan Wang, Yi Ling Yu

Gepubliceerd 2026-04-28
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuxuan Gao, Megan Wang, Yi Ling Yu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een nieuwe auto te kopen.

Op dit moment is de manier waarop we AI-"agenten" (slimme software die taken kan uitvoeren zoals het schrijven van code of het browsen op het web) evalueren, vergelijkbaar met het bekijken van een statische foto van de motor van een auto die in een laboratorium is gemaakt. We voeren een test uit om te zien hoe snel het op een circuit accelereert (een "benchmark"). Als het de race wint, zeggen we dat het een geweldige auto is.

Maar er is een probleem: een auto die een labrace wint, kan onmogelijk te besturen zijn in de regen, na een week kapot gaan, of zo duur zijn dat niemand het zich kan veroorloven. De labfoto vertelt je niet of mensen de auto daadwerkelijk kopen, of monteurs erop vertrouwen, of of bestuurders van de rit houden.

AgentPulse is een nieuw raamwerk dat probeert dit op te lossen. In plaats van alleen een foto van de motor te maken, installeert het een continu dashboard dat de auto volgt terwijl deze daadwerkelijk op echte wegen wordt gereden.

Hier is hoe het werkt, opgesplitst in eenvoudige onderdelen:

1. De vier wijzers op het dashboard

In plaats van één enkele score, kijkt AgentPulse naar vier verschillende "wijzers" om een volledig beeld te krijgen van een AI-agent:

  • Wijzer 1: De labtestscore (Benchmark-prestaties)
    Dit is de oude manier. Het meet hoe goed de agent specifieke puzzels oplost (zoals het repareren van een codefout). Het is belangrijk, maar het is slechts één deel van het verhaal.
  • Wijzer 2: De populariteitsmeter (Adoptiesignalen)
    Dit vraagt: "Gebruikt iemand dit daadwerkelijk?" Het telt hoeveel mensen de software hebben gedownload, hoeveel sterren het heeft op code-delingssites (zoals GitHub) en hoeveel mensen het in hun codetools hebben geïnstalleerd. Als een agent slim is maar niemand het gebruikt, blijft deze wijzer laag.
  • Wijzer 3: De kletskast (Community-sentiment)
    Dit luistert naar wat mensen zeggen op sociale media, forums en coderingsforums. Zijn ontwikkelaars blij? Zijn ze gefrustreerd? Is het hulpmiddel betrouwbaar, of crasht het? Het gebruikt AI om duizenden berichten te lezen en de algemene stemming te achterhalen.
  • Wijzer 4: De gezondheidstest (Gezondheid van het ecosysteem)
    Dit kijkt naar het team achter de software. Updaten ze het nog steeds? Zijn er veel mensen die helpen bij het oplossen van bugs? Is de documentatie goed? Het is alsof je controleert of de autofabrikant nog steeds in het leven is en of de onderdelen makkelijk te vinden zijn.

2. De "magische" ontdekking

De onderzoekers deden iets slim om te bewijzen dat hun dashboard werkt. Ze bouwden een "mini-score" met alleen de labtestscore en de kletskast (de populariteitsmeter en de gezondheidstest volledig negerend).

Vervolgens vroegen ze: "Kan deze mini-score voorspellen hoe populair de auto daadwerkelijk is?"

Het antwoord was ja. Zelfs zonder naar de populariteitscijfers te kijken, voorspelde de combinatie van "hoe slim het is" en "wat mensen zeggen" succesvol hoeveel mensen het zouden downloaden en hoeveel vragen ze erover zouden stellen. Dit bewijst dat hun dashboard niet zomaar een circulaire logica-lus is; het vangt echt waarde uit de echte wereld op die de oude "labtest"-foto's missen.

3. De verrassende draai: Slim versus Populair

Toen ze de oude "labtest"-ranglijst vergeleken met hun nieuwe "dashboard"-ranglijst, vonden ze enkele interessante mismatches:

  • Het "gesloten-bron"-mysterie: Sommige zeer slimme agenten (zoals "Devin" of "OpenAI Codex") scoorden enorm hoog op de labtest, maar scoorden lager op het dashboard. Waarom? Omdat ze "gesloten-bron" zijn (je kunt hun code niet zien of ze niet makkelijk downloaden). Het dashboard kon ze niet zien worden gebruikt, dus gaf het hen een lagere score. Het artikel geeft toe dat dit niet komt omdat die agenten slecht zijn, maar omdat het dashboard ze niet kan "zien".
  • De "community-helden": Sommige agenten (zoals "Cline") wonnen de labtest niet met een grote marge, maar ze waren ongelooflijk populair en geliefd bij de community. Het dashboard gaf hen een veel hogere rangschikking dan de labtest deed, en identificeerde ze correct als hulpmiddelen die mensen daadwerkelijk vertrouwen en gebruiken.

4. Wat dit is (en wat het niet is)

De auteurs zijn zeer duidelijk over wat ze hebben gebouwd:

  • Het is NIET een definitieve "Beste Agent"-lijst. Ze claimen niet dat ze het ene ware antwoord hebben.
  • Het IS een nieuwe manier van meten. Het is een hulpmiddel dat ons helpt het verschil te zien tussen een agent die theoretisch slim is en een agent die praktisch nuttig is.

De kernboodschap

Zie AgentPulse als een continu gezondheidsmonitor voor AI-agenten. Terwijl de oude benchmarks leken op één enkele bloedtest die eenmaal per jaar werd afgenomen, is AgentPulse een smartwatch die hartslag, stappen en slaap elke seconde bijhoudt. Het vertelt ons niet alleen of de AI de taak kan uitvoeren, maar of het de taak uitvoert op een manier die ontwikkelaars daadwerkelijk vertrouwen, gebruiken en waarderen.

De onderzoekers hebben al hun data en tools gratis beschikbaar gesteld, zodat iedereen het dashboard zelf kan controleren en kan zien hoe de "auto's" het echt doen op de weg.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →