← Nieuwste papers
💻 computer science

AgentWebBench: Benchmarking Multi-Agent Coordination in Agentic Web

Deze paper introduceert AgentWebBench, een benchmark die de prestaties van multi-agent coördinatie in het Agentic Web evalueert en aantoont dat deze aanpak, hoewel over het algemeen achterblijvend bij gecentraliseerde zoekopdrachten, met schaalvergroting en zorgvuldige planning zelfs superieure resultaten kan behalen voor specifieke taken zoals vraagbeantwoording.

Oorspronkelijke auteurs: Shanshan Zhong, Kate Shen, Chenyan Xiong

Gepubliceerd 2026-04-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shanshan Zhong, Kate Shen, Chenyan Xiong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat het internet niet langer een enorme bibliotheek is waar je zelf doorheen loopt, maar een levendige stad vol autonome boodschappers.

Dit is wat de auteurs van dit paper, AgentWebBench, ons laten zien. Ze introduceren een nieuwe manier om te kijken naar hoe computers (AI-agenten) informatie op het internet vinden en gebruiken.

Hier is de uitleg in simpele taal, met een paar leuke vergelijkingen:

1. De Verandering: Van Bibliotheek naar Stad met Boodschappers

Vroeger was het internet een grote bibliotheek. Als je een vraag had, liep je zelf naar de planken (Google) en zocht je het boekje op.

Nu verandert dit. Het internet wordt een stad waar elke website zijn eigen boodschapper heeft.

  • Jij (de gebruiker) hebt een Hoofd-Boodschapper (de User Agent).
  • Elke website (zoals Wikipedia, Amazon of een nieuwsblad) heeft zijn eigen Website-Boodschapper (de Content Agent).

Je Hoofd-Boodschapper mag niet zomaar de boeken van de website pakken. Hij moet eerst op de deur van die website kloppen, zijn vraag stellen aan de Website-Boodschapper, en hopen dat die hem het juiste antwoord teruggeeft.

2. Wat is AgentWebBench? (De Proefkeuken)

De auteurs hebben een enorme proefkeuken gebouwd om te testen hoe goed deze samenwerking werkt.

  • Ze hebben 100 verschillende "huizen" (websites) nagebootst, met in totaal bijna 18 miljoen documenten.
  • Ze hebben 7 verschillende soorten Hoofd-Boodschappers (de slimste AI-modellen van dit moment) getest.
  • Ze hebben 4 soorten taken gegeven, zoals:
    • Zoeken: "Vind de beste pizza's in Amsterdam."
    • Recommenderen: "Ik heb net naar een horrorfilm gekeken, wat wil ik nu zien?"
    • Vragen beantwoorden: "Wie was de eerste koning van Frankrijk?"
    • Diep onderzoek: "Schrijf een uitgebreid rapport over de geschiedenis van de koffie."

3. De Drie Manieren om Samen te Werken

Ze hebben getest hoe de Hoofd-Boodschapper de Website-Boodschappers kan aansturen. Er waren drie strategieën:

  1. De "Lijstjes"-Manier (ToolE): De Hoofd-Boodschapper kijkt naar een lijst met beschrijvingen en kiest de websites die het meest op de vraag lijken. Hij vraagt het niet zelf, maar gebruikt een automatische tool.
    • Vergelijking: Alsof je een menukaart bekijkt en de eerste drie restaurants kiest die op je favoriete eten lijken, zonder met de kok te praten.
  2. De "Denkende" Manier (ToolP): De Hoofd-Boodschapper denkt eerst na over welke websites hij moet kiezen, maar gebruikt nog steeds de automatische tools om de informatie op te halen.
    • Vergelijking: Je denkt na: "Voor pizza moet ik naar een Italiaanse site, niet naar een sportsite," en belt dan de kok.
  3. De "Teamwerk"-Manier (Multi-Agent): Dit is de echte samenwerking. De Hoofd-Boodschapper praat direct met de Website-Boodschappers. Ze kunnen heen en weer bellen, vragen stellen, en het antwoord verfijnen.
    • Vergelijking: Je Hoofd-Boodschapper belt de kok op de telefoon: "Ik wil een pizza, maar zonder champignons. Kun je dat controleren?" De kok kijkt in zijn eigen keuken en zegt: "Ja, hier is je pizza."

4. Wat Vonden Ze? (De Resultaten)

  • Samenwerken is lastig: Het is moeilijker om informatie te vinden via deze boodschappers dan door zelf alles te zoeken. De Hoofd-Boodschapper kan niet zien wat er in de keuken gebeurt; hij moet vertrouwen op wat de Website-Boodschapper terugstuurt.
  • Hoe slimmer, hoe beter: Als je een heel slimme Hoofd-Boodschapper gebruikt (een groot AI-model), wordt de samenwerking veel beter. Bij vragen beantwoorden kunnen ze zelfs beter zijn dan het oude systeem!
  • Het "Echo-kamer"-effect: Een belangrijke ontdekking is dat de Hoofd-Boodschappers vaak naar dezelfde paar bekende websites rennen (zoals Wikipedia of grote nieuwsbladen). Ze negeren de kleinere, unieke websites.
    • Vergelijking: Als iedereen in de stad alleen maar naar de drie bekendste supermarkten gaat, krijgen de kleine boerenmarkten geen klanten meer. Het internet wordt minder divers.
  • Denken helpt: Als de Hoofd-Boodschapper even stopt om na te denken ("Thinking Mode") voordat hij handelt, maakt hij minder fouten en is de samenwerking betrouwbaarder.

5. Waar gaat het vaak mis?

De auteurs keken naar de fouten:

  • Soms is de Hoofd-Boodschapper dom: Hij vraagt de verkeerde persoon (bijvoorbeeld een sportwebsite vragen over koken).
  • Soms is de Website-Boodschapper onhandig: Hij heeft het antwoord wel in huis, maar geeft het verkeerde stukje papier terug.
  • Bij complexe vragen moet de Hoofd-Boodschapper heel goed kunnen samenvatten. Soms krijgt hij het juiste antwoord, maar begrijpt hij het niet goed en geeft hij het verkeerde antwoord terug.

Conclusie

Dit paper is een testbaan voor de toekomst van het internet. Het laat zien dat we niet alleen slimmere AI nodig hebben, maar ook betere manieren om deze AI-agenten met elkaar te laten praten.

Als we dit goed doen, wordt het internet een plek waar je gewoon een vraag stelt aan je persoonlijke assistent, en die regelt het allemaal met de juiste websites. Maar als we het niet goed doen, belanden we in een wereld waar alleen de grootste websites nog gezien worden, en de kleine spelers verdwijnen in de anonimiteit.

Kortom: Het is een eerste stap om te leren hoe we een stad van slimme boodschappers kunnen bouwen die samenwerken in plaats van alleen maar te roepen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →