ComplexMCP: Evaluation of LLM Agents in Dynamic, Interdependent, and Large-Scale Tool Sandbox
Het artikel introduceert ComplexMCP, een rigoureus benchmark op basis van het Model Context Protocol met meer dan 300 onderling afhankelijke tools en dynamische omgevingssimulaties, waaruit blijkt dat huidige LLM-agenten significant onderpresteren ten opzichte van mensen in complexe workflows door bottlenecks zoals verzadiging van toolretrieval, overmoed en strategische nederlaag.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een zeer slimme, goed gelezen robotassistent inhuurt om je te helpen een complex bedrijf runnen. Je geeft het een lijst met taken, zoals "koop wat aandelen, boek een vlucht en stuur een bericht naar een vriend".
In het verleden testten onderzoekers deze robots door hen simpele, geïsoleerde taken te geven, zoals "bereken 2+2" of "zoek het weer op". De robots waren hier uitstekend in. Maar in de echte wereld zijn taken rommelig. Ze hangen van elkaar af (je kunt geen vlucht boeken totdat je weet wie er reist), de systemen kunnen haperen (het internet kan vertragen) en de omgeving verandert terwijl je werkt (je vriend heeft je misschien geblokkeerd, of je winkelwagen bevat al artikelen).
Het Probleem: De "Laatste Mijl"-Kloof
De auteurs van dit paper, ComplexMCP, betogen dat onze AI-agenten goed zijn in het gemakkelijke werk, maar falen op de "laatste mijl" – de laatste, moeilijke stappen om echt werk in de wereld te verzetten. Ze zijn als een bestuurder die perfect kan parallelparkeren op een lege parkeerplaats, maar crasht wanneer hij probeert een drukke stadsstraat met gaten en andere auto's te navigeren.
De Oplossing: Een "Gesimuleerde Stad" voor AI
Om te testen hoe goed deze robots echte chaos aankunnen, bouwde het team ComplexMCP. Denk hierbij niet aan een simpele quiz, maar aan een gigantische, gesimuleerde videospelstad met 7 verschillende wijken (zoals een sociale media-stad, een aandelenmarkt, een online winkel en een reisbureau).
- De Hulpmiddelen: In deze stad zijn er meer dan 300 verschillende "hulpmiddelen" (knoppen, hendels en API's) die de AI kan gebruiken.
- De Chaos: Cruciaal is dat deze hulpmiddelen onderling verbonden zijn. Je kunt niet zomaar op een knop drukken; je moet misschien eerst het netwerk repareren, je saldo controleren of de identiteit van een gebruiker verifiëren voordat het hulpmiddel überhaupt werkt.
- Het "Seed"-Mechanisme: Om de test eerlijk maar realistisch te maken, gebruiken ze een "seed" (zoals een willekeurig getalgenerator). Dit zorgt ervoor dat de stad er elke keer dat ze de test uitvoeren, iets anders uitziet (verschillende gebruikers, verschillende prijzen, verschillende netsnelheden), maar de regels blijven hetzelfde. Dit voorkomt dat de AI gewoon de antwoorden uit het hoofd leert.
De Grote Test: Robot versus Mens
De onderzoekers plaatsten top-tier AI-modellen (zoals GPT-5, Gemini en Claude) in deze stad en gaven hen 47 complexe missies. Ze lieten ook echte mensen dezelfde taken uitvoeren met exact dezelfde hulpmiddelen.
De Resultaten: Een Schokkende Realiteitscheck
De resultaten waren verrassend en nuchter:
- Mensen slaagden ongeveer 94% van de keren.
- De Beste AI (Gemini-3-Flash) slaagde slechts ongeveer 55% van de keren.
- Zelfs de meest geavanceerde modellen hadden moeite om boven de 60% succes uit te komen.
Waarom Falen de Robots?
Het paper identificeert drie hoofdredenen waarom deze slimme agenten struikelen in de echte wereld:
- De "Tool-Overbelasting" (Retrieval Saturation): Stel je een bibliothecaris voor die een specifiek boek moet vinden in een bibliotheek met 300.000 boeken. Als je hen vraagt een boek te vinden zonder hen een catalogus te geven, raken ze overweldigd. Op dezelfde manier vergeet de AI vaak het juiste hulpmiddel als ze uit honderden moet kiezen, of raakt ze in de war door de enorme hoeveelheid opties.
- De "Schone Lei"-Bias (Oververtrouwen): Dit is de meest voorkomende fout. De AI gaat ervan uit dat de wereld leeg en fris is, zoals een nieuw spellevel. In werkelijkheid kan de "winkelwagen" al artikelen bevatten, of kan het "netwerk" kapot zijn. De AI slaat het controleren van de huidige staat over en probeert direct te handelen, wat leidt tot fouten (zoals proberen iets te kopen dat je al hebt). Het is alsof je probeert een nieuw item toe te voegen aan een volle koffer zonder te controleren of er nog ruimte is.
- Strategisch Defaitisme: Wanneer de AI een kleine fout tegenkomt (zoals een tijdelijk netwerkprobleem), geeft ze vaak op in plaats van het te proberen op te lossen (zoals het gebruik van een "netwerkversneller"-hulpmiddel). Ze gebruikt haar verfijnde taalkundige vaardigheden om beleefd te zeggen: "Ik kan dit niet", in plaats van een ander pad te proberen om het probleem op te lossen. Het is als een bestuurder die een gat ziet en direct de auto omdraait in plaats van er gewoon omheen te sturen.
Wat Zegt "Retrieval" (RAG) Hierover?
De onderzoekers testten ook of het geven van een "zoekmachine" aan de AI om het juiste hulpmiddel te vinden (in plaats van alle 300 hulpmiddelen tegelijk te tonen) zou helpen. Hoewel het wat geheugen bespaarde, maakte het de AI slechter in deze complexe taken. Waarom? Omdat de zoekmachine de "verborgen" hulpmiddelen die nodig waren voor de volgende stap niet kon vinden. Het is alsof je een bibliothecaris vraagt om "boeken over koken", maar het boek dat je eigenlijk nodig hebt, heet "Hoe je een taart bakt", en de bibliothecaris dacht niet eraan om dat te suggereren omdat de connectie niet voor de hand lag.
De Conclusie
Het paper concludeert dat AI, hoewel het slimmer wordt, nog niet klaar is om een volledig autonome werknemer te zijn in complexe, rommelige real-world omgevingen. Het mist het vermogen om de huidige staat van de wereld waar te nemen, zich te herstellen van kleine fouten en complexe ketens van afhankelijkheden te navigeren. ComplexMCP is nu de nieuwe "rijtest" voor AI, ontworpen om deze zwakke punten te vinden zodat de volgende generatie robots kan leren door de stad te rijden zonder te crashten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.