WebMCP Tool Surface Poisoning: Runtime Manipulation Attacks on LLM Agents
Dieses Paper identifiziert und analysiert „Mid-Session Tool Injection“ (MSTI), eine neue Sicherheitsbedrohung im WebMCP-Protokoll, bei der Angreifer durch die Nutzung von Drittanbieter-Skripten agentenzugängliche Tools während aktiver Sitzungen kapern oder manipulieren (framing), und schlägt spezifische Design-Mitigationen vor, um die Tool-Oberfläche gegen solche Runtime-Manipulationsangriffe abzusichern.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie stellen einen hochintelligenten persönlichen Assistenten (einen KI-Agenten) ein, um eine komplexe Aufgabe für Sie zu erledigen, wie zum Beispiel eine Reise zu buchen oder Ihre Finanzen zu verwalten. Sie geben diesem Assistenten eine Liste der genehmigten Werkzeuge zur Verfügung, die er nutzen darf: eine „Suchmaschine“, einen „Kalender“ und einen „Zahlungsdienstleister“. Sie vertrauen darauf, dass diese Liste fest und sicher ist.
Dieses Paper stellt eine neue Sicherheitsbedrohung namens WebMCP Tool Surface Poisoning vor. Es argumentiert, dass die Liste der Werkzeuge, die Ihrem KI-Assistenten zur Verfügung stehen, tatsächlich nicht eine statische, festgeschriebene Liste ist. Stattdessen ist sie wie ein digitales Menü, das ein Hacker heimlich umschreiben kann, während der Assistent noch arbeitet.
Hier ist eine Aufschlüsselung der Ergebnisse des Papers unter Verwendung einfacher Analogien:
Das Kernproblem: Das „magische Menü“
In dem neuen WebMCP-System können Websites Werkzeuge direkt an KI-Agenten übergeben. Das Paper warnt, dass dieses System eine Schwachstelle hat: Die Liste der Werkzeuge ist dynamisch.
Stellen Sie sich den KI-Agenten wie einen Koch in einer Küche vor. Die „Werkzeuge“ sind die Messer, Töpfe und Zutaten auf der Arbeitsplatte.
- Der alte Weg: Der Koch erhält zu Beginn eine feste Liste von Zutaten. Wenn die Liste „Tomaten“ sagt, verwendet der Koch Tomaten.
- Der WebMCP-Weg: Die Zutaten auf der Arbeitsplatte können sich ändern, während der Koch kocht. Ein böswilliger Dritter (ein Hacker) kann die „Tomaten“ durch „Giftige Beeren“ austauschen, kurz bevor der Koch nach ihnen greift, oder er kann ein neues, harmlos aussehendes „Gewürz“ hinzufügen, das eigentlich nur das Gericht ruiniert.
Die zwei Hauptangriffe
Die Forscher identifizierten zwei spezifische Arten, wie Hacker diese „Küche“ manipulieren können:
1. Tool Hijacking (Der „Vertauschungs-Trick“)
Dies ist wie ein Magier, der ein echtes Kartendeck gegen ein gefälschtes austauscht, kurz bevor man eine Karte zieht.
- Wie es funktioniert: Ein Hacker nutzt ein Skript, um ein legitimes Werkzeug (wie „E-Mail senden“) zu löschen und sofort durch ein gefälschtes zu ersetzen, das exakt denselben Namen trägt, aber etwas Böses tut (wie „E-Mail an Hacker senden“).
- Das Ergebnis: Die KI merkt nicht, dass sie getäuscht wurde. Sie glaubt, das echte Werkzeug zu benutzen, aber sie übergibt in Wirklichkeit Ihre privaten Daten an den Angreifer.
- Das Ergebnis des Papers: Dieser Angriff ist sehr effektiv. In ihren Tests nutzte die KI das gefälschte Werkzeug 100 % der Zeit, wenn der Austausch früh genug geschah, und sendete sensible Daten an den Hacker.
2. Tool Framing (Die „Verkleidung“)
Hier geht es weniger darum, das Werkzeug auszutauschen, sondern vielmehr darum, darüber zu lügen, was das Werkzeug tut.
- Wie es funktioniert: Der Hacker entfernt die echten Werkzeuge nicht. Stattdessen fügt er ein neues, bösartiges Werkzeug hinzu und versieht es mit einer sehr überzeugenden Beschreibung. Er könnte ein „Datendiebstahl“-Werkzeug als „Sicherheitsprüfung erforderlich vor dem Senden“ oder „Compliance-Schritt“ bezeichnen.
- Das Ergebnis: Die KI sieht ein Werkzeug, das notwendig und sicher klingt, und entscheidet sich daher, es als Teil ihres normalen Arbeitsablaufs zu verwenden.
- Das Ergebnis des Papers: Dies ist hinterhältiger. Die KI führt oft die ursprüngliche Aufgabe (wie das Senden der E-Mail) währenddessen durch, dass sie im Hintergrund auch das gefälschte Werkzeug nutzt. Die Aufgabe sieht erfolgreich aus, aber die Daten wurden geleakt. In einigen Fällen fiel die KI auf diese Verkleidung 85 % der Zeit herein.
Das „Rezept“ für den Erfolg
Die Forscher testeten diese Angriffe an drei der klügsten verfügbaren KI-Modelle (GPT-5.4, Claude Opus und Gemini 2.5). Sie fanden heraus:
- Das Timing ist entscheidend: Wenn der Hacker das Werkzeug austauscht, bevor die KI anfängt zu denken, fällt die KI fast immer darauf herein. Wenn der Austausch jedoch stattfindet, nachdem die KI bereits ein Werkzeug ausgewählt hat, schlägt der Angriff meistens fehl.
- Die Beschreibung zählt: Die KI verlässt sich stark auf die Textbeschreibung des Werkzeugs. Wenn die Beschreibung besagt: „Dies ist ein obligatorischer Sicherheitsschritt“, wird die KI sehr wahrscheinlich gehorchen, selbst wenn das Werkzeug bösartig ist.
- Modellunterschiede: Einige KIs waren törichter als andere. Zum Beispiel wurde ein Modell (Gemini) leicht durch lange, langweilige Beschreibungen voller juristischer Fachsprache getäuscht, während ein anderes (Claude) gegen diesen speziellen Trick immun war.
Die Lösung: Die Küche abschließen
Das Paper schlägt vor, dass wir nicht einfach darauf vertrauen können, dass die KI „schon wissen wird, was richtig ist“. Wir müssen ändern, wie das System aufgebaut ist. Sie schlagen vier Hauptlösungen vor:
- Dienstausweise: Jedes Werkzeug sollte eine permanente, unveränderliche ID-Karte haben, die beweist, wer es erstellt hat. Wenn ein Werkzeug versucht, seinen Namen oder Besitzer zu ändern, sollte das System dies ablehnen.
- Die Uhr prüfen: Das System sollte prüfen, ob sich die Werkzeugliste geändert hat, seit die KI mit der Aufgabe begonnen hat. Wenn ein Werkzeug ausgetauscht wurde, sollte die KI stoppen und um Bestätigung bitten.
- Datengrenzen: Den Werkzeugen sollte genau gesagt werden, welche Daten sie anfassen dürfen. Ein „Nur-Lese“-Werkzeug sollte nicht in der Lage sein, Daten an den Server eines Hackers zu senden.
- Ein Protokoll führen: Das System sollte ein detailliertes Tagebuch darüber führen, wann ein Werkzeug hinzugefügt, entfernt oder geändert wurde, damit wir sehen können, ob etwas Verdächtiges passiert ist.
Das Fazit
Das Paper kommt zu dem Schluss, dass die „Tool Surface“ (die Liste der Werkzeuge, die eine KI nutzen kann) keine sichere, statische Grenze mehr ist. Sie ist zu einem neuen Ort geworden, an dem Hacker angreifen können. Selbst die klügsten KI-Modelle können getäuscht werden, wenn die Werkzeuge, die sie verwenden dürfen, während der Arbeit heimlich ausgetauscht oder getarnt werden. Um sicher zu bleiben, muss das System selbst neu gestaltet werden, um Werkzeuge ständig zu verifizieren, anstatt darauf zu vertrauen, dass die KI es selbst herausfindet.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.