A Large-Scale Dataset of MCP Implementations on GitHub
Dit artikel introduceert de eerste grootschalige, op bewijsvoering gebaseerde dataset van 2.297 gevalideerde Model Context Protocol (MCP) implementaties van GitHub, gecreëerd via een rigoureuze hybride verificatiepijplijn om een fundamentele benchmark vast te stellen voor het analyseren van real-world MCP-ecosystemen, ontwikkelings trends en architecturale patronen.
Oorspronkelijk artikel vrijgegeven aan het publieke domein onder CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je de wereld van AI voor als een enorme, praatgrage robot die in een computer leeft. Lange tijd kon deze robot alleen praten over wat hij leerde uit zijn trainingsdata, zoals een student die alleen weet wat er in zijn tekstboek staat. Maar onlangs arriveerde er een nieuw regelboek genaamd het Model Context Protocol (MCP). Zie MCP als een universele vertaler en een set standaard stopcontacten waarmee de robot zich kan aansluiten op echte wereld-tools—zoals weer-apps, zoekmachines of code-editors—zodat hij daadwerkelijk dingen kan doen in plaats van er alleen maar over te praten.
Maar hier is het probleem: niemand wist precies hoeveel mensen er daadwerkelijk deze "stopcontacten" aan het bouwen waren of hoe ze er onder de motorkap uitzagen. Er waren geruchten en lijstjes, maar geen solide kaart van de echte code.
Dat is waar dit paper over gaat. De auteurs gedroegen zich als digitale schatzoekers, duikend in GitHub (een gigantische bibliotheek waar ontwikkelaars hun code opslaan) om de eerste massale, geverifieerde kaart van deze MCP-projecten te bouwen.
De Grote Graafopgraving
Het team heeft niet zomaar geraden; ze bouwden een super-slimme robot-pipeline om naar aanwijzingen te zoeken. Ze begonnen met 3.238 potentiële projecten die "MCP" vermelden. Maar niet elk project dat zegt "Ik ben een MCP-project" is dat ook echt. Sommigen waren slechts lege hulsjes, anderen waren slechts tutorials, en sommige gebruikten de naam "MCP" voor iets totaal anders (zoals een Minecraft-game mod, en niet een AI-tool).
Om tot de waarheid te komen, voerden ze een meerfasige controle uit:
- De CV-check: Had het project recente updates? Als het negen maanden niet was bewogen, vloog het eruit.
- De Code-scan: Ze zochten naar specifieke "vingerafdruk"-bestanden (zoals
package.jsonofpyproject.toml) die bewijzen dat het project daadwerkelijk probeert verbinding te maken met het MCP-systeem. - De Structuur-check: Ze zochten naar specifieke mappen en entry points die laten zien dat de code klaar is om te draaien, en niet alleen als concept daar ligt.
Na al deze filtering vonden ze 2.297 projecten die de echte zaak waren. Ze waren zo voorzichtig dat toen ze een willekeurige steekproef handmatig dubbelcheckten, ze ontdekten dat het proces 83% accuraat was. Ze ontdekten zelfs 90 projecten die leken op echte tools, maar eigenlijk gewoon "show-and-tell" templates waren zonder werkende onderdelen, en die haalden ze uit de definitieve lijst.
Wat doen deze projecten?
Zodra ze hun lijst van 2.297 geverifieerde projecten hadden, sorteerden ze deze in drie hoofdrollen, zoals personages in een toneelstuk:
- De Clients: Dit zijn de "verzoekers". Zij zijn als de handen van de robot, die uitreiken om tools te vragen. (Denk aan een chat-interface die om het weer vraagt).
- De Servers: Dit zijn de "aanbieders". Zij houden de tools vast en geven ze over wanneer erom gevraagd wordt.
- De Gateways: Dit zijn de "tussenpersonen" of vertalers. Zij helpen verschillende systemen met elkaar te communiceren, waardoor de kloof tussen de AI en externe diensten wordt overbrugd.
De data suggereert dat Python en TypeScript de superster-talen zijn voor het bouwen van deze tools. Zij domineren de scène voor zowel de verzoekers (Clients) als de aanbieders (Servers). Interessant genoeg houden de "tussenpersonen" (Gateways) ook van Go, een taal die bekend staat om snelheid en betrouwbaarheid.
Hoe worden ze gebouwd?
Het paper suggereert dat de meeste van deze projecten geen enorme, bedrijfsmatige monolieten zijn. In plaats daarvan lijken ze op kleine, wendbare teams. Een typisch project heeft ongeveer 4 unieke bijdragers en 70 commits (updates). Ontwikkelaars lijken de voorkeur te geven aan het maken van kleine, frequente aanpassingen in plaats van enorme, angstaanjagende updates in één keer.
Wat dit betekent
Dit paper beweert niet dat het elk mysterie over AI-tools heeft opgelost. In plaats daarvan biedt het een solide, op bewijs gebaseerd fundament. Het suggereert dat hoewel het ecosysteem snel groeit, het momenteel wordt gedomineerd door een paar belangrijke talen en een specifiek patroon van kleine, iteratieve ontwikkeling volgt. Door onderzoekers een schone, geverifieerde lijst van 2.297 echte projecten te geven, legt dit werk de basis voor toekomstige studies om te begrijpen hoe deze AI-verbindingen zich echt ontwikkelen, in plaats van simpelweg te gissen op basis van marketinghype.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.