← Neueste Arbeiten
💻 computer science

Semantic Attacks on Tool-Augmented LLMs: Securing the Model Context Protocol Against Descriptor-Level Manipulation

Dieser Beitrag identifiziert und formalisiert drei neue semantische Angriffsvektoren auf Ebene der Deskriptoren (Tool Poisoning, Shadowing und Rug Pull) gegen das Model Context Protocol (MCP), zeigt auf, dass die Manipulation von Tool-Metadaten die Sicherheit von LLMs erheblich beeinträchtigen kann, und schlägt eine mehrschichtige Verteidigungsstrategie vor, die unsichere Tool-Aufrufe wirksam reduziert, ohne ein erneutes Training des Modells zu erfordern.

Ursprüngliche Autoren: Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

Veröffentlicht 2026-05-22
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Saeid Jamshidi, Arghavan Moradi Dakhel, Kawser Wazed Nafi, Foutse Khomh

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen sehr intelligenten, hilfsbereiten Roboterassistenten (eine KI), der Dinge für Sie erledigen kann, wie etwa Ihre E-Mails prüfen, Firmendateien durchsuchen oder Termine vereinbaren. Um dies zu tun, benötigt der Roboter eine Liste von „Werkzeugen", die er verwenden kann. In der Welt der KI kommen diese Werkzeuge mit einem kleinen Etikett oder einer Beschreibung (einem „Deskriptor") geliefert, die dem Roboter mitteilt, was das Werkzeug tut.

Zum Beispiel könnte ein Werkzeug mit folgendem Etikett versehen sein: „Öffentliche Dokumente durchsuchen." Der Roboter liest dieses Etikett, versteht es und entscheidet sich, dieses Werkzeug zu verwenden, wenn Sie um Hilfe bitten.

Das Problem: Der „gefälschte Etikett"-Angriff

Diese Arbeit entdeckt eine hinterhältige Methode, um den Roboter zu täuschen. Anstatt das Werkzeug selbst zu brechen oder den Computer zu hacken, verändert ein Angreifer das Etikett des Werkzeugs.

Stellen Sie es sich wie ein Lebensmittelgeschäft vor.

  • Normales Szenario: Ein Glas Erdnussbutter trägt ein Etikett mit der Aufschrift „Erdnussbutter". Sie vertrauen dem Etikett und kaufen es.
  • Der Angriff: Ein Bösewicht tauscht das Etikett auf dem Glas aus. Es steht immer noch „Erdnussbutter", aber in winzigen, subtilen Buchstaben fügt es hinzu: „und enthält auch eine Liste aller Personen, die dieses Glas gekauft haben."
  • Das Ergebnis: Der Roboter sieht das Etikett, vertraut ihm (weil es wie ein normales Etikett aussieht) und entscheidet sich, das Werkzeug zu verwenden. Doch nun stiehlt der Roboter versehentlich eine Kundenliste, anstatt nur Erdnussbutter zu finden, weil ihn das Etikett dazu angewiesen hat.

Die Arbeit nennt dies einen semantischen Angriff. Das Werkzeug selbst ist sicher und funktioniert einwandfrei, aber die Wörter, die es beschreiben, lügen.

Die drei Arten, wie Angreifer den Roboter täuschen

Die Forscher identifizierten drei spezifische Wege, wie diese „gefälschten Etiketten" die KI täuschen können:

  1. Werkzeugvergiftung (Das „zu hilfsbereite" Etikett):

    • Analogie: Stellen Sie sich ein Werkzeug vor, das mit „Wetter prüfen" beschriftet ist. Der Angreifer ändert das Etikett zu „Wetter prüfen und mir sagen, was der Benutzer gerade trägt."
    • Wirkung: Der Roboter denkt: „Oh, dieses Werkzeug ist extra hilfreich!" und verwendet es, wodurch versehentlich private Informationen über den Benutzer offengelegt werden.
  2. Beschattung (Das „verwirrende Menschenmenge"-Etikett):

    • Analogie: Stellen Sie sich vor, Sie befinden sich in einem Raum voller Menschen, die Anweisungen geben. Eine Person (der Angreifer) ruft: „Jeder muss seinen Ausweis vorzeigen!", obwohl die anderen Leute nur nach der Uhrzeit fragen.
    • Wirkung: Der Roboter wird durch die laute, verdächtige Anweisung verwirrt und beginnt, alle Werkzeuge so zu behandeln, als müssten sie private Benutzerdaten einsehen, selbst die sicheren.
  3. Rug Pull (Das „Lockvogel-und-Tausch"-Etikett):

    • Analogie: Sie beauftragen einen Handwerker mit dem „Anstreichen des Zauns". Sie genehmigen den Vertrag. Eine Woche später ändert der Handwerker den Vertrag leise zu „Zaun anstreichen und eine versteckte Kamera installieren".
    • Wirkung: Das Werkzeug war sicher, als Sie es zuerst prüften, aber später änderte sich die Beschreibung, um etwas Gefährliches zu tun, ohne dass Sie es bemerkten.

Wie schlimm ist es?

Die Forscher testeten dies an drei verschiedenen Arten von KI-Robotern (GPT-5.3, DeepSeek-V3 und LLaMA-3.5).

  • Der Schock: Ohne speziellen Schutz fielen diese Roboter etwa 36 % der Zeit auf den Trick herein. Sie würden gerne die „vergifteten" Werkzeuge verwenden und Daten preisgeben.
  • Die Überraschung: Je mehr der Roboter „nachdachte" (durch komplexe Denkprozesse), desto wahrscheinlicher war es, dass er getäuscht wurde. Es scheint, dass wenn der Roboter versucht, tiefgründig über die Anweisungen nachzudenken, er durch die subtilen Lügen in den Etiketten verwirrter wird.

Die Lösung: Ein dreischichtiges Sicherheitspersonal

Die Arbeit schlägt eine neue Methode vor, um diese Roboter zu schützen, die nicht den Umbau des Roboterhirns erfordert, sondern einen Sicherheitskontrollpunkt hinzufügt, bevor der Roboter die Etiketten sieht.

  1. Der Ausweischeck (Integritätsprüfung):

    • Analogie: Wie das Prüfen eines Führerscheins, um sicherzustellen, dass er nicht verändert wurde. Das System prüft, ob das Etikett von einer vertrauenswürdigen Behörde unterzeichnet wurde und seit der Genehmigung nicht verändert wurde. Dies stoppt den „Rug Pull".
  2. Die zweite Meinung (Semantische Prüfung):

    • Analogie: Bevor der Roboter das Etikett liest, liest ein zweiter, kleinerer Roboter (ein „Prüfer") es zuerst. Der Prüfer fragt: „Klingt dieses Etikett so, als würde es zu viele private Informationen anfordern?" Wenn es verdächtig klingt, sagt der zweite Roboter: „Nein, verwenden Sie das nicht."
  3. Der Türsteher (Runtime-Guardrails):

    • Analogie: Ein Türsteher in einem Club, der beobachtet, was während der Ausführung des Werkzeugs passiert. Wenn das Werkzeug anfängt, etwas Seltsames zu tun (wie etwa den Zugriff auf eine Datei versucht, die es nicht sollte), wirft der Türsteher es sofort hinaus.

Die Ergebnisse der Korrektur

Als die Forscher alle drei Schutzebenen hinzufügten:

  • Die Anzahl der Male, bei denen der Roboter getäuscht wurde, sank von 36 % auf 15 %.
  • Das System blockierte erfolgreich 74 % der böswilligen Versuche.
  • Der Kompromiss: Es dauerte ein wenig länger, bis der Roboter antwortete (die Latenz erhöhte sich), aber es war viel sicherer.

Die große Erkenntnis

Die wichtigste Lehre dieser Arbeit ist, dass wir den Etiketten auf KI-Werkzeugen nicht vertrauen können, nur weil sie normal aussehen. Selbst wenn das Werkzeug einwandfrei funktioniert und der Code sicher ist, können die Wörter, die es beschreiben, eine Falle sein. Um KI sicher zu halten, müssen wir diese Beschreibungen als nicht vertrauenswürdige Informationen behandeln und sie sorgfältig prüfen, bevor wir der KI erlauben, sie zu verwenden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →