← Nieuwste papers
💬 NLP

LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?

Dit paper introduceert LiveMCPBench, een nieuw benchmarkkader dat de kloof tussen theoretische en praktische MCP-toepassing dicht door de prestaties van grote taalmodellen te evalueren bij het navigeren door een schaalbare omgeving met duizenden tools, waarbij blijkt dat zoekfouten de belangrijkste oorzaak van falen zijn.

Oorspronkelijke auteurs: Guozhao Mo, Wenliang Zhong, Jiawei Chen, Qianhao Yuan, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun

Gepubliceerd 2026-02-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Guozhao Mo, Wenliang Zhong, Jiawei Chen, Qianhao Yuan, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🌊 De Oceaan van Tools: Kunnen Robots de Weg Vinden?

Stel je voor dat kunstmatige intelligentie (zoals de slimme chatbots die we vandaag gebruiken) een chef-kok is. Tot nu toe had deze chef-kok alleen maar een klein keukentje met drie messen en één pan. Hij kon wel koken, maar alleen simpele gerechten.

Nu is er echter een revolutie: MCP (Model Context Protocol). Dit is als een gigantisch, eindeloos supermarktcomplex met 10.000 verschillende afdelingen. Je hebt hier niet alleen messen, maar ook robots die auto's repareren, drones die post bezorgen, en apparaten die het weer in Tokio voorspellen.

Maar hier zit het probleem:
Deze chef-kok (de AI) staat nu voor die enorme supermarkt en weet niet waar hij moet beginnen. Hij raakt verdwaald in de gangpaden, pakt de verkeerde ingrediënten of vergeet zelfs dat hij een robotarm nodig heeft om de zware dozen te tillen.

Dit paper, LiveMCPBench, is een grote test om te zien of deze AI-chefs echt kunnen koken in zo'n enorme, chaotische supermarkt.

🧪 De Test: LiveMCPBench

De onderzoekers hebben een nieuwe "proefkeuken" gebouwd om dit te testen. Ze noemen het LiveMCPBench. Hier is hoe het werkt, vertaald naar alledaagse taal:

1. De Opdrachten (De Recepten)

In plaats van simpele vragen als "Wat is 2+2?", hebben ze 95 echte dagelijkse taken bedacht.

  • Voorbeeld: "Koop een treinbiljet van Beijing naar Shanghai voor volgende maand, check de weersvoorspelling voor die dag, en maak een PDF-rapportje met de kosten."
  • Dit is als een recept dat vraagt om ingrediënten uit drie verschillende supermarkten, terwijl je ook nog het weer moet checken.

2. De Toolset (De Supermarkt)

Ze hebben een LiveMCPTool verzameling gemaakt.

  • Stel je voor dat ze 70 verschillende "afdelingen" (servers) hebben geselecteerd met in totaal 527 verschillende tools.
  • Het mooie is: alles zit in één doosje (een Docker-container). De chef hoeft niet zelf te zoeken naar sleutels of wachtwoorden voor elke winkel. Het is "plug-and-play", alsof je een kant-en-klare maaltijd uit de koelkast haalt.

3. De Jury (De Proefpersoon)

Hoe weet je of de AI het goed heeft gedaan?

  • In het verleden keken mensen naar de stappen die de AI nam. Maar in een dynamische wereld (waar het weer verandert of nieuws updates krijgt) is dat lastig.
  • Ze gebruiken nu een "AI als Jury" (LLM-as-a-Judge). Stel je een strenge proefpersoon voor die niet kijkt hoe je het gedaan hebt, maar of het eindresultaat klopt.
  • Vergelijking: Het maakt niet uit of je de taart met een robotarm of met je handen hebt gebakken, zolang de taart maar lekker smaakt en de vulling erin zit.

📊 Wat Vonden Ze? (De Resultaten)

Ze hebben 12 van de slimste AI-modellen (zoals Claude, GPT-4, en Qwen) tegen elkaar op laten lopen in deze test.

  1. Het Grote Verschil:

    • De beste AI (Claude-Sonnet-4) slaagde in 79% van de taken.
    • De meeste andere modellen haalden maar 30% tot 50%.
    • Vergelijking: Het is als een olympische wedstrijd waar de winnaar een gouden medaille pakt, maar de rest van het team nog worstelt om de finishlijn te halen.
  2. Het Grootste Probleem: Het Zoeken (Retrieval)

    • De onderzoekers ontdekten dat bijna 50% van de fouten kwam doordat de AI de verkeerde tool vond.
    • Vergelijking: De chef-kok wilde een snijmes, maar pakte per ongeluk een theelepel uit de lade. Hij kon de taart niet snijden, niet omdat hij slecht kon koken, maar omdat hij het verkeerde gereedschap had.
    • Dit is de grote bottleneck: de AI is goed in denken, maar slecht in het vinden van het juiste gereedschap in die enorme oceaan.
  3. Samenwerking is Sleutel:

    • De modellen die het beste deden, waren niet degenen die het snelst werkten, maar degenen die durven te experimenteren. Ze probeerden verschillende tools, combineerden ze en gaven niet snel op.
    • Vergelijking: Een goede kok probeert eerst de oven, als dat niet werkt de magnetron, en combineert ze misschien zelfs. De slechte kok blijft steken bij één idee.

💡 Waarom is dit belangrijk?

Vroeger testten we AI's met simpele, statische vragen. Dit paper laat zien dat de echte wereld veel chaotischer is.

  • De conclusie: We moeten AI's niet alleen slimmer maken in "denken", maar vooral beter in zoeken en combineren.
  • Als we dat oplossen, kunnen AI's echt helpen bij complexe taken: van het regelen van je vakantie tot het analyseren van je financiële situatie, zonder dat jij de hele dag in de computer hoeft te klikken.

🚀 Samenvatting in één zin

De onderzoekers hebben een enorme testbaan gebouwd met echte taken en duizenden tools om te zien dat AI's momenteel nog verdwalen in de supermarkt, vooral omdat ze moeite hebben om het juiste gereedschap te vinden, maar dat de slimste modellen al wel een flinke voorsprong hebben door te durven experimenteren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →