← Nieuwste papers
💬 NLP

LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries

Dit artikel introduceert LiveMCP-101, een benchmark van 101 real-world queries ontworpen om MCP-gemoduleerde agenten te testen via een parallel evaluatiekader, waarbij blijkt dat zelfs geavanceerde LLM's moeite hebben met complexe multi-stap tool-orkestratie en waarbij zeven specifieke faalmodi worden geïdentificeerd om toekomstige verbeteringen te sturen.

Oorspronkelijke auteurs: Ming Yin, Dinghan Shen, Silei Xu, Sixun Dong, Mian Zhang, Yebowen Hu, Shujian Liu, Jianbing Han, Simin Ma, Song Wang, Sathish Reddy Indurthi, Xun Wang, Yiran Chen, Kaiqiang Song

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ming Yin, Dinghan Shen, Silei Xu, Sixun Dong, Mian Zhang, Yebowen Hu, Shujian Liu, Jianbing Han, Simin Ma, Song Wang, Sathish Reddy Indurthi, Xun Wang, Yiran Chen, Kaiqiang Song

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: De "Live" Proefrit

Stel je voor dat je een nieuwe zelfrijdende auto test. De meeste eerdere tests werden gedaan in een videospelletje of op een afgesloten parkeerterrein waar de verkeerslichten nooit veranderen en de weg altijd leeg is. De auto kon de route uit het hoofd leren en zag er perfect uit.

Maar in de echte wereld veranderen verkeerslichten, stappen voetgangers onverwachts op en veranderen de wegomstandigheden per seconde.

Dit paper introduceert LiveMCP-101, wat vergelijkbaar is met een live verkeerstest in de echte wereld voor AI-agenten. In plaats van een AI te vragen een wiskundeprobleem uit een schoolboek op te lossen, vragen de onderzoekers het om een "zwitsers zakmes" van digitale hulpmiddelen te gebruiken (zoals vluchtprijzen controleren, zoeken op GitHub naar code, of het weer opzoeken) om complexe, meerstapsproblemen op te lossen die veranderen terwijl de AI eraan werkt.

Het Probleem: De "Statische Kaart" versus de "Live GPS"

  • Oude Manier (Statische Hulpmiddelen): Stel je voor dat een AI-agent een afgedrukte kaart van een stad krijgt. Het weet precies waar de koffiebar is omdat de kaart dat zegt. Maar als de koffiebar gisteren verhuisde, is de AI verdwaald. Zo werken de meeste huidige AI-hulpmiddelen; ze vertrouwen op vaste instructies.
  • De Nieuwe Manier (MCP): Het paper gebruikt iets genaamd het Model Context Protocol (MCP). Denk hierbij aan een Live GPS. De AI heeft geen vooraf afgedrukte kaart; het moet de GPS vragen: "Welke hulpmiddelen zijn op dit moment beschikbaar?" en vervolgens uitzoeken hoe ze te gebruiken. Het probleem is dat de "Live GPS"-data elke seconde verandert. Een vluchtprijs kan stijgen, of een nieuwskop kan veranderen, terwijl de AI nadenkt.

De Oplossing: De "Parallelle Race"

Hoe beoordeel je een AI op een test waarbij de antwoorden veranderen terwijl het de test maakt?

De onderzoekers bouwden een Parallelle Race-systeem:

  1. De Referentieloper: Een super slimme, door mensen geleide robot voert exact dezelfde taak uit op exact hetzelfde moment als de geteste AI. Het volgt een strikt, vooraf goedgekeurd plan om het "juiste" antwoord te krijgen voor dat specifieke moment.
  2. De Testloper: De geteste AI probeert het plan zelfstandig uit te werken.
  3. De Scheidsrechter: Aan de finishlijn vergelijkt een scheidsrechter (een andere AI) het resultaat van de Testloper met dat van de Referentieloper.

Dit zorgt ervoor dat de AI niet gestraft wordt omdat het weer verandert of een aandelenprijs beweegt; het wordt alleen gestraft als het niet in staat was de veranderingen correct te navigeren.

De Resultaten: Zelfs de "Slimste" Kinderen Struikelen

De onderzoekers testten 18 verschillende AI-modellen (inclusief de aller slimste zoals GPT-5 en Claude).

  • De Score: Zelfs de beste AI-modellen haalden slechts ongeveer 58% van de taken goed.
  • De Analogie: Stel je voor dat je een groep promovendi een complexe schattenjacht geeft waarbij ze 5 verschillende mensen moeten bellen, 3 verschillende websites moeten controleren en een rapport moeten schrijven, allemaal terwijl de aanwijzingen veranderen. Zelfs de slimste studenten faalden meer dan 40% van de tijd.

De "Zeven Dodelijke Zonden" (Foutpatronen)

Het paper analyseerde waarom de AI faalde en vond zeven veelgemaakte fouten, gegroepeerd in drie hoofdcategorieën:

1. Planningsfouten (De "Verdwaalde Bestuurder")

  • De Kaart Ignoreren: De AI mist een deel van de instructies volledig (bijvoorbeeld: "Vind de tweede meest populaire video" maar het vindt de eerste).
  • Overmoedigheid: De AI denkt het antwoord te weten uit zijn eigen geheugen en weigert de hulpmiddelen te gebruiken, wat leidt tot hallucinaties (dingen verzinnen).
  • Praten zonder Wandelen: De AI schrijft een perfect plan in zijn "gedachten" maar klikt de knoppen nooit daadwerkelijk aan om het uit te voeren.
  • Verkeerd Hulpmiddel: De AI kiest het juiste hulpmiddel maar gebruikt het verkeerde (bijvoorbeeld: een "Zoeken"-hulpmiddel gebruiken wanneer het een "Rekenmachine" nodig heeft).

2. Parameterfouten (Het "Typfout"-Probleem)

  • Syntaxisfouten: De AI spreekt de taal van het hulpmiddel slecht. Het zegt "1" (een woord) terwijl het hulpmiddel 1 (een getal) nodig heeft. Het hulpmiddel weigert het verzoek direct.
  • Semantische Fouten: De AI spreekt de taal correct maar begrijpt de betekenis verkeerd. Het vraagt om "weer in New York" terwijl de gebruiker eigenlijk "weer in New York City" bedoelde, of het vraagt om een datum die niet bestaat.

3. Outputverwerking (Het "Laatste Mijl"-Probleem)

  • Parse-fouten: Het hulpmiddel geeft de AI de juiste data (zoals een JSON-bestand met getallen), maar de AI slaagt er niet in om het correct te lezen. Het kan de gemiddelde waarde verkeerd berekenen of een belangrijk getal missen, waardoor het uiteindelijke rapport bedorven wordt.

De Conclusie

Het paper concludeert dat AI, hoewel het beter wordt in praten met hulpmiddelen, nog steeds niet betrouwbaar genoeg is voor complexe, real-world banen waar dingen in real-time veranderen.

  • Closed-source modellen (zoals GPT-5) zijn beter in plannen maar hebben nog steeds moeite met de "laatste mijl" van het correct lezen van data.
  • Open-source modellen komen vaak vast te zitten in lussen, waardoor tijd en tokens worden verspild zonder vooruitgang te boeken.

Kortom: We hebben een zeer strenge, real-world sportschool (LiveMCP-101) gebouwd om AI te testen. De resultaten tonen aan dat zelfs onze sterkste AI-atleten momenteel over hun eigen veters struikelen wanneer ze worden gevraagd een marathon te rennen met een live, veranderende kaart. Er is nog een lange weg te gaan voordat we ze kunnen vertrouwen om autonoom in de echte wereld te werken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →