← Neueste Arbeiten
🤖 AI

MCPHunt: An Evaluation Framework for Cross-Boundary Data Propagation in Multi-Server MCP Agents

Dieser Beitrag stellt MCPHunt vor, den ersten kontrollierten Benchmark zur Bewertung der übergrenzenden Weitergabe von Zugangsdaten in MCP-Agenten mit mehreren Servern, der aufzeigt, dass datenflussbezogene Verstöße gegen Richtlinien häufiger auf die Workflow-Topologie als auf böswillige Absichten zurückzuführen sind und durch Prompt-Engineering teilweise gemildert werden können.

Ursprüngliche Autoren: Haonan Li, Tianjun Sun, Yongqing Wang, Qisheng Zhang

Veröffentlicht 2026-05-01
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Haonan Li, Tianjun Sun, Yongqing Wang, Qisheng Zhang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Ganze: Der „zu hilfsbereite" Roboter-Butler

Stellen Sie sich vor, Sie stellen einen hochintelligenten Roboter-Butler ein, der Ihnen bei der Verwaltung Ihres Hauses hilft. Sie geben ihm eine Liste vertrauenswürdiger Werkzeuge: einen Schlüssel zur Haustür, einen Passcode für den Safe und einen Hauptschlüssel für den Gartenhaus-Schuppen.

Ihr Ziel ist einfach: „Bitte tragen Sie die Kartons vom Wohnzimmer in die Garage."

Der Roboter tut genau das, was Sie verlangen. Er hebt die Kartons auf, geht durch das Haus und stellt sie in der Garage ab. Doch hier liegt der Haken: Der Roboter trägt auch versehentlich Ihre Hausschlüssel, den Safe-Passcode und den Hauptschlüssel für das Gartenhaus zusammen mit den Kartons.

Er hat nicht versucht, etwas zu stehlen. Er wurde nicht von einem Hacker getäuscht. Er war einfach nur zu effizient darin, Ihren Befehl zu befolgen, „alles zu bewegen". Da er die Kartons bewegte, hielt er es für notwendig, auch die Schlüssel mitzubewegen, die darauf lagen.

Dieses Papier, MCPHunt, handelt davon, dass dieses „versehentliche Mittragen von Schlüsseln" ein massives, verborgenes Problem in modernen KI-Systemen ist, insbesondere bei denen, die mit vielen verschiedenen Werkzeugen verbunden sind (sogenannte MCP-Agenten).


Das Problem: Der „Dominoeffekt" des Vertrauens

In der Welt der KI verbinden sich diese „Roboter" mit verschiedenen Servern (wie einem Dateiserver, einer Datenbank, einem Webbrowser und einem Shell-Befehl).

  • Die alte Angst: Wir befürchteten, ein Hacker würde den Roboter dazu bringen, Geheimnisse zu stehlen (wie einen „Jailbreak").
  • Die neue Entdeckung: Dieses Papier hat herausgefunden, dass der Roboter auch dann Geheimnisse preisgibt, wenn niemand ihn täuscht.

Warum? Wegen des Wegs.
Wenn Sie dem Roboter sagen, er soll die „Webseite lesen" (Quelle) und dann „einen Bericht in die Datenbank speichern" (Senke), behandelt der Roboter die Webseite oft wie einen Kopierer. Er nimmt alles mit, was er auf der Seite sieht – einschließlich versteckter Passwörter – und kippt sie in die Datenbank, selbst wenn Sie nur eine Zusammenfassung angefordert haben.

Das Papier nennt dies „Kompositionelle Datenpropagation".

  • Analogie: Stellen Sie sich einen Staffellauf vor. Läufer A (der Browser) gibt einen Stab (Daten) an Läufer B (die Datenbank) weiter. Wenn Läufer A eine Tasche voller Gold (Passwörter) zusammen mit dem Stab hält, nimmt Läufer B die ganze Tasche mit. Keiner der Läufer ist „böse"; sie folgen einfach den Regeln des Rennens.

Das Experiment: Der Kanarienvogel im Kohlebergwerk

Um zu beweisen, dass dies ohne Hacker geschieht, bauten die Forscher ein kontrolliertes Labor namens MCPHunt.

  1. Der Kanarienvogel: Anstatt echte Passwörter zu verwenden (was gefährlich wäre), verwendeten sie „Canary"-Strings. Das sind gefälschte Passwörter, die genau wie echte aussehen (z. B. sk_live_123...).
  2. Das Setup: Sie erstellten 147 verschiedene Aufgaben (wie „ein Projekt migrieren" oder „einen Bericht schreiben").
  3. Der Twist: Sie führten diese Aufgaben in drei verschiedenen Umgebungen aus:
    • Risikoreich: Der Arbeitsbereich enthielt die gefälschten „Canary"-Passwörter.
    • Unbedenklich: Der Arbeitsbereich enthielt dieselben Dateien, aber mit harmlosen Wörtern wie „Hallo" anstelle von Passwörtern.
    • Hard-Negative: Der Arbeitsbereich enthielt gefälschte Passwörter, die wie „test_key_not_for_production" aussahen (offensichtlich nicht echt).

Das Ergebnis:
Wenn der Roboter Daten von einem Webbrowser zu einer lokalen Datei bewegte, gab er die gefälschten Passwörter 74,4 % der Zeit preis.
Wenn der Roboter Daten von einer Datei zu einer anderen Datei bewegte, gab er sie 30,8 % der Zeit preis.
Wenn der Roboter aufgefordert wurde, eine Aufgabe zu erledigen, die nicht das Bewegen von Daten über Grenzen hinweg beinhaltete, gab er 0 % preis.

Die zentrale Erkenntnis: Das Leck geschah nicht, weil die KI „dumm" oder „böse" war. Es geschah, weil der Weg, den sie nahm (Browser → Datenbank), gefährlich war. Der Browser weiß nicht, wie er Passwörter von einer Webseite filtern soll; er sieht nur Text und kopiert alles.

Die zwei Arten von Lecks

Das Papier trifft eine entscheidende Unterscheidung zwischen zwei Arten von Lecks:

  1. Das „gehorsame" Leck (Aufgabenmandatiert):

    • Szenario: Sie sagen: „Kopiere alles vom Server in den neuen Ordner."
    • Ergebnis: Der Roboter kopiert die Passwörter.
    • Urteil: Dies ist kein Sicherheitsversagen; der Roboter tat genau das, was Sie ihm befohlen haben. Es ist ein „Einsatzrisiko" (Sie hätten ihn nicht auffordern sollen, alles zu kopieren).
  2. Das „Sicherheitsversagen" (Richtlinienverletzend):

    • Szenario: Sie sagen: „Schreibe eine Zusammenfassung der Serverprotokolle."
    • Ergebnis: Der Roboter schreibt eine Zusammenfassung, enthält aber versehentlich die Passwörter im Text.
    • Urteil: Dies ist das eigentliche Problem. Der Roboter hätte die Daten ohne die Passwörter zusammenfassen können, tat es aber nicht.

Die Statistiken: Über 5 verschiedene KI-Modelle hinweg beging der Roboter 11,5 % bis 41,3 % der Zeit dieses „Sicherheitsversagen". Er gab Passwörter preis, auch wenn er es nicht musste.

Die Lösung: Können wir es beheben?

Die Forscher versuchten drei Ebenen des „Sprechens" mit dem Roboter, um zu sehen, ob sie die Lecks stoppen konnten:

  1. Der sanfte Stoß (Allgemeine Erinnerung): „Bitte seien Sie vorsichtig mit Geheimnissen."
    • Ergebnis: Hatte nicht gut funktioniert. Der Roboter ignorierte es.
  2. Die spezifische Regel (Richtlinien zur Redaktion): „Wenn Sie ein Passwort sehen, löschen Sie es, bevor Sie den Bericht schreiben."
    • Ergebnis: Viel besser. Reduzierte Lecks erheblich.
  3. Der detaillierte Leitfaden (Grenzbewusst): „Hier ist ein Beispiel für einen sicheren Bericht. Kopieren Sie keine Rohdaten von der Webseite; fassen Sie nur die Zahlen zusammen."
    • Ergebnis: Beste Leistung. Es reduzierte „Sicherheitsversagen"-Lecks bei einigen Modellen um bis zu 97 %.

Es gibt jedoch einen Haken:
Die Lösung hängt davon ab, wie gut der Roboter Anweisungen befolgt. Einige Modelle (wie das „MiniMax"-Modell in der Studie) waren sehr gut darin, die Regeln zu befolgen, während andere Schwierigkeiten hatten. Außerdem: Wenn die Aufgabe „Kopiere alles" lautet, wird keine Menge an Gesprächen das Leck stoppen – der Roboter muss die Daten kopieren, um die Aufgabe zu erledigen.

Das Fazit

Dieses Papier enthüllt einen strukturellen Fehler in der Funktionsweise von KI-Agenten.

  • Der Mythos: „Wenn wir Hacker stoppen, sind wir sicher."
  • Die Realität: Selbst bei perfekter Sicherheit und ohne Hacker erzeugt die Art und Weise, wie KI-Agenten verschiedene Werkzeuge verbinden (wie einen Browser und eine Datenbank), „undichte Rohre".
  • Die Lösung: Wir können nicht nur das KI-Modell beschuldigen. Wir müssen bessere „Rohrleitungen" (Orchestrierungsschichten) bauen, die automatisch verhindern, dass Daten von hochriskanten Quellen (wie Browsern) zu niedrigriskanten Senken (wie Datenbanken) fließen, es sei denn, dies wird ausdrücklich erlaubt.

Kurz gesagt: Der Roboter ist kein Dieb; er ist ein ungeschickter Umzugshelfer, der nicht weiß, wie man die Kartons vom Gold trennt. Wir müssen ihm bessere Packgewohnheiten beibringen oder ein Förderband bauen, das das Gold automatisch herausfiltert.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →