← Nieuwste papers
💻 computer science

WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation

Dit artikel introduceert WebRetriever, een grootschalige benchmark bestaande uit 1.550 taken verspreid over 800 diverse websites, samen met een nieuw NavEval-framework en drie complementaire evaluatieprotocollen, om de beperkingen van bestaande benchmarks aan te pakken door een uitgebreidere en fijnmazigere beoordeling van de prestaties van webagents in realistische scenario's te bieden.

Oorspronkelijke auteurs: Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

Gepubliceerd 2026-07-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Wei Dong, Tianyu Fu, Zhe Yu, Hanning Wang, Anyang Su, Zhizhou Fang, Yuyang Chen, Shuo Wang, Minghui Wu, Ping Jiang, Zhen Lei, Chenxu Zhao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Het "Rijbewijs"-probleem

Stel je voor dat je een robot leert om een auto te besturen. In het verleden testten onderzoekers deze robots op een kleine, lege parkeerplaats zonder verkeer, voetgangers of weersveranderingen. De robots haalden de test met vlag en wimpel. Maar wanneer je ze op een echte snelweg zet met wegwerkzaamheden, verwarrende borden en agressieve bestuurders, crashen ze onmiddellijk.

Dit paper betoogt dat huidige tests voor "Web Agents" (AI die voor jou het internet afzoekt) lijken op die lege parkeerplaats. Ze zijn te klein, te simpel en weerspiegelen niet de chaotische realiteit van het echte web. De auteurs hebben een nieuwe, enorme test gebouwd genaamd WebRetriever om te zien of deze AI-bestuurders daadwerkelijk de echte verkeersdrukte aankunnen.


1. De Nieuwe Testbaan: WebRetriever

De auteurs hebben een gigantische hindernisbaan gecreëerd voor AI-agents.

  • De Oude Manier: Eerdere tests hadden misschien 4 tot 100 websites. Het was alsof je een bestuurder test op één enkele straat.
  • De Nieuwe Manier (WebRetriever): Ze bouwden een baan met 800 verschillende websites en 1.550 specifieke taken.
    • De Variatie: Het is niet alleen winkelen. Het omvat professionele taken zoals het controleren van de aandelenmarkt, het lezen van juridische documenten en het navigeren door overheidsportalen.
    • De Analogie: Als oude tests een rijexamen waren in een rustige doodlopende straat, dan is WebRetriever een proefrit door een drukke stad tijdens de spits, inclusief complexe kruispunten, eenrichtingsverkeer en wegwerkzaamheden.

2. De Nieuwe Scheidsrechter: NavEval

Hoe beoordeel je een robotbestuurder? Je kunt niet een mens laten meekijken bij elke enkele testrit; dat is te duur en te traag.

  • De Oude Manier: Eerdere geautomatiseerde rechters waren als een scheidsrechter die alleen naar de eindfoto van de auto keek. "Heeft de auto de finishlijn bereikt?" Zo ja, geslaagd. Maar dit negeerde het feit dat de bestuurder misschien drie rode lichten heeft genegeerd of een verkeerde afslag heeft genomen om er te komen.
  • De Nieuwe Manier (NavEval): De auteurs hebben een slimere rechter gebouwd genaamd NavEval. In plaats van alleen naar de eindfoto te kijken, werkt NavEval als een zwarte doos in een vliegtuig.
    • Het luistert naar de motor (netwerkverzoeken).
    • Het kijkt naar de bewegingen van het stuur (klikken en acties).
    • Het controleert de GPS-geschiedenis (bezochte URL's).
    • Het Resultaat: Deze rechter is zo nauwkeurig dat hij in 90% van de gevallen het eens is met menselijke experts. Het kan zien of de robot "vals heeft gespeeld" of dat hij het puzzel echt heeft opgelost.

3. De Drie Moeilijkheidsgraden

Het paper introduceert drie verschillende manieren om de agents te testen, zoals een videogame met toenemende moeilijkheidsniveaus:

  • Niveau 1: De "Vind de Deur"-test (Protocol I)

    • De Taak: "Ga naar de pagina over 'Informed Consent'."
    • Het Doel: Kan de agent de website navigeren om de juiste pagina te vinden zonder hulp?
    • De Realiteit: Zelfs met dit simpele doel faalden de meeste AI-agents. Ze raakten verdwaald in de doolhof van links.
  • Niveau 2: De "Met een Kaart"-test (Protocol II)

    • De Taak: "Ga naar de pagina over 'Informed Consent'."
    • De Twist: Dit keer geven we de agent een stap-voor-stap instructiehandleiding (zoals een GPS met spraaknavigatie).
    • Het Resultaat: De agents werden beter, maar niet perfect. Ze hadden nog steeds moeite om de instructies perfect op te volgen, wat aantoont dat ze meer training nodig hebben om complexe instructies te begrijpen.
  • Niveau 3: De "Volledige Missie"-test (Protocol III)

    • De Taak: "Ga naar de pagina, lees het document en vertel me precies wat de derde paragraaf zegt."
    • De Twist: Het is niet genoeg om alleen de pagina te bereiken. De agent moet lezen, begrijpen en specifieke informatie extraheren.
    • De Realiteit: Dit is waar de agents echt moeite mee hadden. Velen konden de pagina wel vinden, maar konden de kleine lettertjes niet lezen. Het is als een bestuurder die wel een auto kan parkeren, maar de parkeerbon niet kan lezen.

4. De Schokkende Resultaten

Toen de auteurs hun tests uitvoerden, waren de resultaten nederig voor de AI-industrie:

  • De Parkeerplaats vs. De Snelweg: Agents die 90% scoorden op oude, gemakkelijke tests, scoorden minder dan 20% op deze nieuwe, realistische test.
  • De "Aankomst"-valstrik: Alleen omdat een agent de juiste webpagina bereikt, betekent niet dat hij de taak heeft voltooid. In de moeilijkste test waren de agents slechts in ongeveer 12% van de gevallen succesvol in het voltooien van de volledige taak (de pagina vinden + het juiste antwoord krijgen).

Samenvatting

Het paper beweert dat we de capaciteiten van AI-webagents hebben overschat omdat we ze in een "steriele" omgeving hebben getest. WebRetriever is een nieuwe, enorme en realistische testomgeving die laat zien dat deze agents in de echte wereld nog steeds behoorlijk onhandig zijn. Ze kunnen soms de juiste deur vinden, maar ze raken vaak verdwaald en ze zijn slecht in het lezen van de kleine lettertjes zodra ze daar zijn.

De auteurs hebben ook een nieuwe, zeer nauwkeurige "scheidsrechter" geleverd (NavEval), zodat we deze agents in de toekomst automatisch kunnen testen en precies weten hoe goed ze presteren zonder dat er een mens hoeft toe te kijken bij elke beweging.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →