A Large-Scale Dataset of MCP Implementations on GitHub
Dieses Paper stellt den ersten groß angelegten, evidenzbasierten Datensatz aus 2.297 validierten Model Context Protocol (MCP)-Implementierungen von GitHub vor, der durch eine rigorose hybride Verifizierungspipeline erstellt wurde, um einen grundlegenden Benchmark für die Analyse realer MCP-Ökosysteme, Entwicklungstrends und Architekturmuster zu etablieren.
Originalarbeit unter CC0 1.0 der Gemeinfreiheit gewidmet (http://creativecommons.org/publicdomain/zero/1.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich die Welt der KI als einen riesigen, gesprächigen Roboter vor, der in einem Computer lebt. Lange Zeit konnte dieser Roboter nur über das sprechen, was er in seinen Trainingsdaten gelernt hat, wie ein Schüler, der nur das weiß, was in seinem Lehrbuch steht. Aber vor kurzem kam ein neues Regelwerk namens Model Context Protocol (MCP) hinzu. Denken Sie an MCP als einen universellen Übersetzer und einen Satz standardisierter Steckdosen, die es dem Roboter ermöglichen, sich an reale Werkzeuge anzuschließen – wie Wetter-Apps, Suchmaschinen oder Code-Editoren – damit er Dinge tatsächlich tun kann, anstatt nur über sie zu reden.
Aber hier liegt das Problem: Niemand wusste genau, wie viele Menschen tatsächlich diese „Steckdosen“ bauten oder wie sie unter der Haube aussah. Es gab Gerüchte und Listen, aber keine solide Landkarte des echten Codes.
Genau hier kommt dieses Paper ins Spiel. Die Autoren agierten wie digitale Schatzsucher, die in GitHub (einer riesigen Bibliothek, in der Entwickler ihren Code speichern) eintauchten, um die erste massive, verifizierte Landkarte dieser MCP-Projekte zu erstellen.
Die Große Grabung
Das Team hat nicht einfach nur geraten; sie bauten eine super-intelligente Roboter-Pipeline, um nach Hinweisen zu suchen. Sie begannen mit 3.238 potenziellen Projekten, die „MCP“ erwähnten. Aber nicht jedes Projekt, das sagt „Ich bin ein MCP-Projekt“, ist es auch wirklich. Einige waren nur leere Hüllen, andere waren nur Tutorials, und manche nutzten den Namen „MCP“ für etwas völlig anderes (wie eine Minecraft-Mod, nicht ein KI-Tool).
Um zur Wahrheit zu gelangen, führten sie eine mehrstufige Untersuchung durch:
- Der Lebenslauf-Check: Hatte das Projekt kürzliche Aktualisierungen? Wenn es sich seit neun Monaten nicht bewegt hatte, war es raus.
- Der Code-Scan: Sie suchten nach spezifischen „Fingerabdruck“-Dateien (wie
package.jsonoderpyproject.toml), die beweisen, dass das Projekt tatsächlich versucht, sich mit dem MCP-System zu verbinden. - Der Struktur-Check: Sie suchten nach spezifischen Ordnern und Einstiegspunkten, die zeigen, dass der Code bereit ist, ausgeführt zu werden, und nicht nur als Konzept existiert.
Nach all diesem Filtern fanden sie 2.297 Projekte, die es wirklich waren. Sie waren so sorgfältig, dass sie bei einer manuellen Überprüfung einer Stichprobe feststellten, dass der Prozess zu 83 % genau war. Sie entdeckten sogar 90 Projekte, die wie echte Werkzeuge aussah, aber eigentlich nur „Show-and-Tell“-Vorlagen ohne funktionierende Teile waren, und warfen diese aus der finalen Liste.
Was machen diese Projekte?
Sobald sie ihre Liste der 2.297 verifizierten Projekte hatten, sortierten sie diese in drei Hauptrollen, wie Charaktere in einem Theaterstück:
- Die Clients: Dies sind die „Anfragenden“. Sie sind wie die Hände des Roboters, die nach Werkzeugen greifen, um nach etwas zu fragen. (Denken Sie an eine Chat-Schnittstelle, die nach dem Wetter fragt).
- Die Server: Dies sind die „Anbieter“. Sie halten die Werkzeuge bereit und reichen sie weiter, wenn sie angefragt werden.
- Die Gateways: Dies sind die „Mittelsmänner“ oder Übersetzer. Sie helfen verschiedenen Systemen, miteinander zu kommunizieren, und schlagen Brücken zwischen der KI und externen Diensten.
Die Daten deuten darauf hin, dass Python und TypeScript die Superstar-Sprachen für den Bau dieser Werkzeuge sind. Sie dominieren die Szene sowohl bei den Anfragenden (Clients) als auch bei den Anbietern (Servern). Interessanterweise nutzen auch die „Mittelsmänner“ (Gateways) gerne Go, eine Sprache, die für Geschwindigkeit und Zuverlässigkeit bekannt ist.
Wie werden sie gebaut?
Das Paper legt nahe, dass die meisten dieser Projekte keine massiven, unternehmerischen Monolithen sind. Stattdessen sehen sie wie kleine, agile Teams aus. Das typische Projekt hat etwa 4 einzigartige Mitwirkende und 70 Commits (Aktualisierungen). Die Entwickler scheinen es vorzuziehen, kleine, häufige Anpassungen vorzunehmen, anstatt riesige, beängstigende Updates auf einmal durchzuführen.
Was das bedeutet
Dieses Paper behauptet nicht, jedes Geheimnis über KI-Werkzeuge gelöst zu haben. Stattdessen bietet es eine solide, evidenzbasierte Grundlage. Es legt nahe, dass das Ökosystem zwar schnell wächst, derzeit aber von einigen Schlüssel-Sprachen dominiert wird und einem spezifischen Muster der kleinen, iterativen Entwicklung folgt. Indem die Arbeit eine saubere, verifizierte Liste von 2.297 echten Projekten bereitstellt, schafft sie die Bühne für zukünftige Studien, um zu verstehen, wie sich diese KI-Verbindungen wirklich entwickeln, anstatt nur auf Basis von Marketing-Hype zu raten.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.