← Nieuwste papers
🤖 AI

MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers

Het artikel introduceert MCP-Atlas, een benchmark op grote schaal die bestaat uit 1.000 taken verspreid over 36 echte MCP-servers en 220 hulpmiddelen, en is ontworpen om de competentie van grote taalmodellen bij het gebruik van hulpmiddelen in realistische, meerstapswerkstromen rigoureus te evalueren aan de hand van een scoremodel gebaseerd op claims.

Oorspronkelijke auteurs: Chaithanya Bandi, Ben Hertzberg, Geobio Boo, Tejas Polakam, Jeff Da, Sami Hassaan, Manasi Sharma, Andrew Park, Ernesto Hernandez, Dan Rambado, Ivan Salazar, Rafael Cruz, Chetan Rane, Ben Levin, Brad K
Gepubliceerd 2026-05-06
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Chaithanya Bandi, Ben Hertzberg, Geobio Boo, Tejas Polakam, Jeff Da, Sami Hassaan, Manasi Sharma, Andrew Park, Ernesto Hernandez, Dan Rambado, Ivan Salazar, Rafael Cruz, Chetan Rane, Ben Levin, Brad Kenstler, Bing Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, goed gelezen persoonlijke assistent (een AI) hebt ingehuurd om je te helpen met een complex project. Je geeft hen geen lijst met specifieke hulpmiddelen die ze moeten gebruiken; in plaats daarvan zeg je gewoon: "Ik moet dit onderwerp onderzoeken, onze interne database controleren en een specifieke datum vinden."

Het probleem is dat je assistent een gigantische gereedschapskist in de kelder heeft met 220 verschillende hulpmiddelen, maar je laat ze slechts een kleine selectie van 10 tot 25 hulpmiddelen tegelijk zien. Sommige van deze hulpmiddelen zijn precies wat ze nodig hebben, terwijl andere "afleiders" zijn—hulpmiddelen die erop lijken maar nutteloos zijn voor de klus.

MCP-Atlas is een gigantische, realistische test die is ontworpen om te zien hoe goed deze AI-assistenten zijn in het vinden van de juiste hulpmiddelen, ze correct te gebruiken en de stukken samen te voegen om een probleem op te lossen, allemaal zonder dat je hen precies vertelt welke hulpmiddelen ze moeten kiezen.

Hier is een uiteenzetting van het artikel met eenvoudige analogieën:

1. Het Probleem: De "Valse" Tests

Vroeger waren tests voor AI-hulpmiddelgebruik als een kookles waarbij de leraar de student een receptkaart gaf met de tekst: "Gebruik het rode mes om de ui te snijden."

  • Het Probleem: Dit test niet of de student echt weet welk mes hij moet pakken of of hij een rommelige keuken kan hanteren. Het echte leven is rommeliger. Je zegt gewoon: "Maak een salade," en de student moet zelf het mes, het snijbord en de kom vinden.
  • De Oude Manier: Veel tests gebruikten nep-hulpmiddelen of eenvoudige taken die de complexiteit van werk in de echte wereld niet weerspiegelden.

2. De Oplossing: MCP-Atlas (De "Echte Keuken" Test)

De onderzoekers bouwden MCP-Atlas, een enorme proefkeuken met:

  • 36 Echte Servers: Dit zijn als 36 verschillende winkels uit de echte wereld (een bank, een bibliotheek, een weerstation, een code-repository). Het zijn geen nep-simulaties; het zijn de echte dingen.
  • 220 Hulpmiddelen: De daadwerkelijke hulpmiddelen die in die winkels beschikbaar zijn.
  • 1.000 Taken: 1.000 verschillende uitdagingen, zoals "Vind een paper over advertenties, controleer vervolgens onze interne verkoopdata voor een specifieke campagne en vertel me de datum waarop deze begon."
  • De Twist: De AI krijgt nooit de namen van de hulpmiddelen te horen. Het moet zelf uitzoeken: "Oh, ik moet de Bibliotheek vragen om de paper en de Bank om de verkoopdata."

3. Hoe Ze de AI Beoordelen: De "Fact Check" Rubric

In plaats van een mens te vragen om te raden of het antwoord van de AI "goed klinkt", gebruiken de onderzoekers een Claim-gebaseerde Rubric.

  • De Analogie: Stel je voor dat de taak is om een sandwich te maken. De "goede" sandwich moet bevatten: 1) Brood, 2) Ham, 3) Kaas en 4) Mosterd.
  • De Beoordeling: Als de AI je een sandwich brengt met Brood, Ham en Kaas, maar de mosterd vergeet, krijgt het geen onvoldoende. Het krijgt gedeeltelijke punten (misschien 75%).
  • Waarom dit belangrijk is: Het voorkomt dat de AI punten krijgt alleen omdat het een lang, fancy alinea schrijft. Het krijgt alleen punten voor de feitelijke feiten die het met de hulpmiddelen heeft gevonden.

4. De Resultaten: De AI Wordt Beter, Maar Struikelt Nog Steeds

Ze testten de slimste beschikbare AI-modellen (de "frontier" modellen).

  • De Score: De beste AI (Claude Opus 4.5) haalde ongeveer 62% van de taken "perfect" (of dicht genoeg bij een voldoende). De volgende besten zaten in het 50%-bereik, en sommige oudere modellen scoorden zeer laag (onder de 10%).
  • De Hoofdfout: De belangrijkste reden waarom AI faalde, was niet dat het niet kon denken of lezen. Het was dat het niet de juiste tool kon vinden of niet wist dat het überhaupt een tool moest gebruiken.
    • Analogie: De AI wist hoe je een sandwich maakt, maar vergat de koelkast te openen om de ham te halen, of pakte het verkeerde potje augurken aan omdat het dacht dat het mosterd was.
  • Het "Te Vroeg Stoppen" Probleem: Veel AI's zouden de taak beginnen, één stap doen en dan zeggen: "Ik kan de rest niet doen," terwijl ze wel de hulpmiddelen hadden om de klus te klaren. Ze gaven te snel op.

5. Verschillende Soorten Taken

De test bestreek verschillende "wijken" van werk:

  • Basis (Weer, Kaarten): De AI deed het hier redelijk.
  • Analyse (Data, Grafieken): De AI deed het hier verrassend goed.
  • Financiën & Programmeren: De AI had hier de meeste moeite mee. Deze gebieden vereisen zeer precieze instructies (zoals een specifiek datumformaat of een specifieke codesyntaxis), en de AI maakte vaak fouten in de details.

6. Wat Dit Betekent voor de Toekomst

Het artikel concludeert dat, hoewel AI slimmer wordt, er nog steeds een enorme kloof bestaat tussen "weten hoe je een tool gebruikt" en "weten wanneer je een tool moet gebruiken".

  • De Kernboodschap: Huidige AI-modellen zijn geweldig in het volgen van instructies zodra ze de juiste tool in handen hebben. Maar ze zijn nog steeds slecht in het kijken naar een rommelige gereedschapskist, de nep-tools te negeren en de juiste te kiezen om een meerstapsprobleem op te lossen.

Kortom: MCP-Atlas is een strenge, realistische rijtest voor AI. Het laat zien dat hoewel de auto's (AI-modellen) sneller worden, veel van hen nog steeds moeite hebben om het verkeer (het vinden van de juiste hulpmiddelen) te navigeren zonder te crashen of op te geven. De onderzoekers hebben hun testvragen en regels vrijgegeven zodat andere wetenschappers in de toekomst betere "bestuurders" kunnen bouwen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →