← Nieuwste papers
🤖 AI

MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers

Dit artikel introduceert MCPEvol-Bench, een nieuwe benchmark die de adaptiviteit van LLM-agenten aan dynamische toolset-evoluties in MCP-servers evalueert door realistische interface-wijzigingen te simuleren, wat onthult dat zelfs state-of-the-art modellen moeite hebben met dergelijke aanpassingen en aanzienlijke prestatieverminderingen ondergaan.

Oorspronkelijke auteurs: Huanxi Liu, Kun Hu, Jiaqi Liao, Qiang Wang, Pengfei Qian, YuanZhao Zhai, Dawei Feng, Bo Ding, Huaimin Wang

Gepubliceerd 2026-07-17
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Huanxi Liu, Kun Hu, Jiaqi Liao, Qiang Wang, Pengfei Qian, YuanZhao Zhai, Dawei Feng, Bo Ding, Huaimin Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robotassistent bouwt. Je leert hem om gereedschappen te gebruiken—zoals een rekenmachine, een kalender of een zoekmachine—om problemen voor je op te lossen. In de wereld van kunstmatige intelligentie zijn deze gereedschappen vaak verbonden via een standaard systeem genaamd het Model Context Protocol (MCP), dat fungeert als een universele plug-and-play-adapter, waardoor je robot elk gereedschap dat hij nodig heeft uit een enorme digitale gereedschapskist kan pakken. Een lange tijd testten wetenschappers deze robots door ze een statische set gereedschappen te geven en te kijken of ze een puzzel konden oplossen. Het was als het testen van een bestuurder op een circuit waar de verkeersborden nooit verschoven en de verkeerslichten nooit veranderden. Maar in de echte wereld zijn gereedschappen rommelig en levend; ze worden constant bijgewerkt, hernoemd of vervangen. De grote vraag is: als de gereedschapskist verandert terwijl de robot aan het werk is, raakt hij dan in de war en crasht hij, of past hij zich aan en gaat hij door?

Dit is precies wat de onderzoekers achter MCPEvol-Bench wilden uitzoeken. Ze realiseerden zich dat eerdere tests te makkelijk waren omdat ze geen rekening hielden met het feit dat gereedschappen evolueren. Om dit op te lossen, bouwden ze een nieuwe, dynamische testomgeving genaamd MCPEvol-Bench. In plaats van een statisch circuit, creëerden ze een "levende" omgeving waarin de gereedschappen die de robots gebruiken midden in de taak veranderen. Ze bestudeerden 123 echte toolservers en ontdekten dat in de echte wereld ongeveer 20% van de externe servers offline gaat, en dat meer dan de helft van de gereedschappen binnenin hen in de loop van de tijd wordt verwijderd of vervangen. Om deze chaos na te bootsen, bedachten ze 11 "mutatie-operators"—denk aan ze als digitale mutatievirussen—die de gereedschappen automatisch aanpassen. Ze kunnen een nieuwe knop toevoegen, een parameter hernoemen of een functie volledig verwijderen, precies zoals een echte softwareontwikkelaar zou doen tijdens een update.

De resultaten waren een beetje een waarschuwing. De onderzoekers testten 12 van de meest geavanceerde AI-modellen die beschikbaar zijn, inclusief zwaargewichten zoals GPT-5.4 en Claude-Sonnet-4-6. In het begin, toen de gereedschappen stabiel waren, presteerden deze modellen goed. Maar zodra de gereedschappen begonnen te evolueren, struikelden de robots. Zelfs de slimste modellen zagen hun succespercentages aanzienlijk dalen—met ongeveer 13,7% tot 14,4%—wanneer de gereedschappen veranderden. De studie toonde aan dat de robots niet noodzakelijkerwijs vergaten hoe ze de gereedschappen moesten gebruiken; in plaats daarvan raakten ze verdwaald in de planning en de redenering-fasen. Het is als een chef die weet hoe hij perfect uien moet snijden, maar plotseling merkt dat het mes is vervangen door een lepel; hij weet niet hoe hij zijn recept moet aanpassen, dus eindigt hij met een rommeltje. De onderzoekers ontdekten dat het toevoegen van nieuwe gereedschappen of het veranderen van beschrijvingen de agenten het meest in de war bracht, terwijl het verwijderen van overbodige gereedschappen hen juist hielp. Ze ontdekten ook dat het toevoegen van "cognitieve" functies zoals geheugen en reflectie aan de agenten hen hielp om beter aan te passen, wat suggereert dat de toekomst van AI niet alleen gaat over slimmer zijn, maar over flexibeler zijn wanneer de wereld om hen heen verandert.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →