← Neueste Arbeiten
💬 NLP

LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?

Die Arbeit stellt LiveMCPBench vor, einen umfassenden Benchmark mit 70 MCP-Servern und 527 Tools, der zeigt, dass aktuelle LLM-Agenten bei der Bewältigung realer, mehrstufiger Aufgaben in großen Tool-Umgebungen vor allem durch Retrieval-Fehler und mangelnde Tool-Komposition scheitern, wobei nur Claude-Sonnet-4 eine signifikant höhere Erfolgsrate erreicht.

Ursprüngliche Autoren: Guozhao Mo, Wenliang Zhong, Jiawei Chen, Qianhao Yuan, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun

Veröffentlicht 2026-02-27
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Guozhao Mo, Wenliang Zhong, Jiawei Chen, Qianhao Yuan, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

🌊 Die große Herausforderung: Ein Ozean voller Werkzeuge

Stell dir vor, du hast einen extrem intelligenten Roboter-Assistenten (eine KI), der dir bei alltäglichen Aufgaben helfen soll. Früher hatte dieser Roboter nur einen kleinen Werkzeugkasten mit 5 oder 10 Werkzeugen. Er musste nur wissen, welches er wann benutzt.

Heute ist das anders. Durch ein neues System namens MCP (Model Context Protocol) hat der Roboter Zugang zu einem riesigen Ozean mit über 10.000 verschiedenen Werkzeugen und Servern. Das ist wie ein riesiger Supermarkt, in dem es nicht nur Nudeln und Milch gibt, sondern auch Flugtickets, Aktienkurse, Wettervorhersagen, lokale Bibliotheken und sogar Werkzeuge, um Dateien auf deinem Computer zu bearbeiten.

Das Problem:
Bisher haben Forscher die KI getestet, indem sie ihr nur ein Werkzeug in die Hand gedrückt haben und gesagt: „Mach das." Das ist so, als würde man einen Fischer testen, indem man ihm nur einen einzigen Angelhaken gibt und fragt, ob er Fische fangen kann. Das ist einfach. Aber in der echten Welt muss der Fischer erst herausfinden, welcher Angelhaken der richtige ist, und dann vielleicht noch ein Netz und eine Angelrute kombinieren, um den Fisch zu fangen.

Die alten Tests haben diese echte Schwierigkeit (das Suchen im großen Ozean und das Kombinieren von Werkzeugen) ignoriert.

🧪 Die Lösung: LiveMCPBench (Der neue Test)

Die Autoren dieses Papers haben sich gedacht: „Wir müssen den Roboter in den echten Ozean werfen!" Dafür haben sie LiveMCPBench entwickelt.

Stell dir das wie einen großen, lebendigen Parcours vor, den die KI bestehen muss.

  1. Die Aufgaben (95 tägliche Szenarien):
    Die KI bekommt keine abstrakten Mathe-Rätsel, sondern echte Alltagsaufgaben. Zum Beispiel:

    • „Suche mir Zugtickets von Berlin nach Shanghai für nächsten Montag."
    • „Analysiere meine Excel-Tabelle und erstelle daraus ein Diagramm."
    • „Finde die neuesten Nachrichten über KI und fasse sie zusammen."
      Diese Aufgaben sind dynamisch (das Wetter ändert sich, Aktienkurse schwanken), genau wie im echten Leben.
  2. Der Werkzeugkasten (LiveMCPTool):
    Damit der Test fair und reproduzierbar ist, haben die Forscher einen fertigen „Koffer" mit 70 Servern und 527 Werkzeugen zusammengestellt.

    • Vergleich: Früher mussten Forscher für jeden Test neue, kaputte oder veraltete Werkzeuge suchen (wie alte Werkzeuge auf einem Dachboden). Jetzt haben sie einen Plug-and-Play-Koffer, der sofort funktioniert. Kein Chaos, keine fehlenden Schlüssel.
  3. Der Schiedsrichter (LiveMCPEval):
    Wie weiß man, ob die KI die Aufgabe wirklich gelöst hat? Früher hat man oft nur geschaut, ob die KI die richtigen Wörter benutzt hat.
    Hier nutzen die Forscher eine KI als Richter (ein „LLM-as-a-Judge"). Dieser Richter prüft nicht nur die Antwort, sondern den gesamten Weg, den die KI gegangen ist. Hat sie wirklich die richtigen Werkzeuge gefunden? Hat sie die Daten korrekt kombiniert?

    • Wichtig: Der Richter ist clever genug zu verstehen, dass es mehrere Wege zum Ziel geben kann (wie bei einer Reise: man kann mit dem Zug oder dem Bus fahren, beides ist okay).

📊 Was haben sie herausgefunden? (Die Ergebnisse)

Sie haben 12 der fortschrittlichsten KIs (wie Claude, GPT-4, DeepSeek) auf diesem Parcours getestet. Das Ergebnis war eine große Überraschung:

  • Die Leistungslücke: Die beste KI (Claude-Sonnet-4) hat es geschafft, 79 % der Aufgaben zu lösen. Aber die meisten anderen KIs lagen nur bei 30–50 %. Das ist eine riesige Lücke!
  • Das Hauptproblem ist das Suchen: Die Analyse zeigte, dass fast die Hälfte aller Fehler daher rührt, dass die KI das falsche Werkzeug im Ozean gefunden hat. Sie wusste nicht, wo sie suchen musste.
  • Kombination ist König: Die KIs, die am besten abschnitten, waren nicht die, die einfach nur schnell waren. Sie waren die, die aktiv Werkzeuge kombinierten. Sie haben nicht nur ein Werkzeug benutzt, sondern drei oder vier hintereinander geschaltet, um das Ziel zu erreichen.

🚀 Was bedeutet das für die Zukunft?

Die Botschaft der Forscher ist klar:
Wir haben die KIs so weit gebracht, dass sie sprechen und denken können. Aber wenn es darum geht, in einer riesigen Welt voller Werkzeuge das Richtige zu finden und diese geschickt zu kombinieren, hinken wir noch hinterher.

Die Analogie zum Schluss:
Stell dir vor, du gibst einem genialen Koch (der KI) einen Schlüssel zu einem riesigen, unbekannten Supermarkt (den MCP-Tools).

  • Die alten Tests haben ihm nur einen einzigen, bekannten Kühlschrank gegeben.
  • Der neue Test (LiveMCPBench) stellt ihn vor den vollen Supermarkt.
  • Das Ergebnis? Der Koch kann toll kochen, aber er stolpert oft, weil er nicht weiß, wo die Tomaten stehen oder wie er den Mixer mit dem Ofen verbindet.

Die Zukunft der KI-Forschung liegt also nicht nur darin, den Koch klüger zu machen, sondern ihm eine bessere Landkarte für den Supermarkt zu geben und ihm beizubringen, wie man verschiedene Geräte gleichzeitig bedient.


Zusammenfassung in einem Satz:
LiveMCPBench ist ein neuer, realistischer Test, der zeigt, dass KIs zwar klug sind, aber oft scheitern, wenn sie in einer riesigen Welt voller Werkzeuge das Richtige finden und geschickt kombinieren müssen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →