← Neueste Arbeiten
💻 computer science

Capability-Mediated Perimeters for Secure AI Agent Tool Execution: Conditional Non-Escalation Invariants and Empirical Evaluation Against Indirect Prompt Injection

Dieses Paper stellt Mastyf Guard vor, eine deterministisch-orientierte Sicherheitsarchitektur, die LLM-Agenten als nicht vertrauenswürdige Akteure behandelt und bedingte Nicht-Eskalations-Invarianten über einen externen Referenzmonitor erzwingt, wodurch in empirischen Evaluierungen gegen indirekte Prompt-Injection- und Exfiltrationsbedrohungen eine nahezu perfekte Angriffsdetektion bei null Fehlalarmen erreicht wird.

Ursprüngliche Autoren: Rudraneel Das

Veröffentlicht 2026-09-02✓ Author reviewed
📖 9 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Rudraneel Das

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der Welt des modernen Computings hat eine grundlegende Regel die Systeme lange Zeit sicher gehalten: Anweisungen, die einer Maschine sagen, was sie tun soll, müssen von den Daten, die die Maschine verarbeitet, getrennt werden. Diese Trennung stellt sicher, dass ein Benutzer einen Computer nicht versehentlich oder böswillig dazu verleiten kann, Befehle auszuführen, denen er nicht folgen sollte. Die Entstehung autonomer KI-Agenten hat diese Grenze jedoch verschwommen lassen. Diese Agenten, die darauf ausgelegt sind, komplexe Aufgaben wie die Verwaltung von Datenbanken oder die Steuerung von Smart-Geräten zu übernehmen, lesen oft Anweisungen und unvertrauenswürdige Daten aus dem Internet gleichzeitig in einem einzigen Textstrom ein. Da der Computer die Daten und die Anweisungen als Teil derselben Mischung behandelt, kann ein geschickter Angreifer einen verborgenen Befehl in einer scheinbar harmlosen E-Mail oder Webseite verstecken. Wenn der Agent diesen Inhalt liest, folgt er möglicherweise unwissentlich dem verborgenen Befehl und führt Aktionen wie das Löschen von Dateien oder das Stehlen von Passwörtern aus. Diese Schwachstelle, bekannt als indirekte Prompt-Injection, verwandelt den Agenten in einen verwirrten Stellvertreter (Confused Deputy), der Befehlen folgt, denen er nie folgen wollte.

Forscher der Mastyf AI Research Laboratories haben einen neuen Weg vorgeschlagen, um diese Agenten zu schützen, indem sie von der Vorstellung abweichen, dass die künstliche Intelligenz selbst der endgültige Richter über die Sicherheit sein kann. Anstatt sich darauf zu verlassen, dass die KI jeden möglichen Trick erkennt, hat das Team ein Sicherheitssystem gebaut, das als strenger Torwächter fungiert, bevor eine Aktion ausgeführt wird. Sie nennen dieses System Mastyf Guard. Es arbeitet nach einem einfachen, aber leistungsstarken Prinzip: Die KI darf denken und argumentieren, aber ihr wird die Macht entzogen, eigenständig zu handeln. Jedes Mal, wenn die KI ein Werkzeug vorschlägt, das zu verwenden ist, wie etwa das Versenden einer E-Mail oder den Zugriff auf einen Server, überprüft ein separater, unabhängiger Sicherheitsmonitor die Anfrage. Dieser Monitor versucht nicht, die Absicht der KI zu erraten; stattdin prüft er eine digitale Liste von Berechtigungen, ähnlich wie ein Türsteher, der eine Gästeliste bei einem Club kontrolliert. Wenn die angeforderte Aktion für diese spezifische Sitzung nicht ausdrücklich erlaubt ist, wird die Anfrage sofort blockiert, ungeachtet dessen, wie überzeugend die Argumentation der KI auch sein mag.

Die Forscher testeten diesen Ansatz gegen eine riesige Sammlung von fünfzigtausend Szenarien, von denen die Hälfte realistische Angriffe waren, die darauf ausgelegt waren, Agenten zu täuschen, und die andere Hälfte normale, sichere Operationen, die von Entwicklern durchgeführt wurden. Die Ergebnisse zeigten, dass ihr System die überwiegende Mehrheit der Angriffe fast augenblicklich stoppen konnte. In den schnellsten Fällen dauerte die Sicherheitsprüfung nur fünftausendstel einer Sekunde – eine Geschwindigkeit, die so schnell ist, dass sie für einen menschlichen Nutzer kaum wahrnehmbar ist. Das System identifizierte und blockierte erfolgreich 99,33 Prozent der Angriffe, was eine signifikante Verbesserung gegenüber bestehenden Sicherheitstools darstellt, die oft mehr als die Hälfte dieser subtilen Tricks übersehen. Entscheidend war, dass das System dies tat, ohne teure, Hochleistungs-Computerchips zu benötigen, und effizient auf Standard-Prozessoren mit einem Speicherbedarf von nur 1,1 Gigabyte lief. Dies bedeutet, dass der Schutz in alltäglichen Büroumgebungen eingesetzt werden kann, ohne dass spezialisierte Hardware erforderlich ist.

Um zu verstehen, wie dies funktioniert, stellen Sie sich den KI-Agenten als einen hochqualifizierten, aber leicht ablenkbaren Mitarbeiter vor, der einen Generalschlüssel für das gesamte Gebäude erhalten hat. Wenn ein Fremder dem Mitarbeiter eine gefälschte Anweisung ins Ohr flüstert, könnte der Mitarbeiter diesen Generalschlüssel benutzen, um eine Tür zu öffnen, die er nicht öffnen dürfte. Das Mastyf Guard-System nimmt dem Mitarbeiter den Generalschlüssel vollständig aus der Tasche. Stattdessen muss der Mitarbeiter jedes Mal einen Sicherheitsmann um Erlaubnis bitten, wenn er eine Tür öffnen möchte. Der Sicherheitsmann hört sich nicht die Geschichte des Mitarbeiters an oder versucht, seinen Tonfall zu interpretieren; der Sicherheitsmann prüft einfach eine strikte Liste, welche Türen der Mitarbeiter in diesem Moment öffnen darf. Wenn die Anfrage nicht auf der Liste steht, bleibt die Tür verschlossen. Dieser Ansatz löst das Problem des „verwirrten Stellvertreters“, indem er sicherstellt, dass selbst wenn die KI dazu verleitet wird, nach dem Falschen zu fragen, das System dies einfach nicht tun kann, weil es nicht die Autorität dazu besitzt.

Die Forscher befassten sich auch mit einem subtileren Problem: Was passiert, wenn der KI erlaubt ist, ein Werkzeug zu benutzen, sie aber versucht, die Details der Anfrage zu ändern, um Schaden anzurichten? Beispielsweise könnte eine KI autorisiert sein, eine E-Mail zu versenden, aber ein Angreifer könnte sie dazu bringen, diese E-Mail an eine andere Adresse oder mit einem anderen Betreff zu senden. Um dies zu handhaben, fügte das Team eine zweite Verteidigungsebene hinzu, die wie eine sorgfältige Korrekturleserin fungiert. Diese Ebene prüft die spezifischen Details der Anfrage gegen die ursprüngliche Berechtigung. Wenn die KI versucht, Geld an ein neues Konto zu senden oder auf eine Datei zuzugreifen, die sie nicht berühren sollte, erkennt das System die Änderung. In Tests, die dreitausend komplexe Geschäftsszenarien umfassten, fing diese Kombination aus strengen Berechtigungsprüfungen und detaillierter Korrekturlesung 97,5 Prozent der Angriffe ab, während sie eine Fehlalarmrate von null Prozent aufwies, mit einer statistischen Obergrenze von 0,19 % bei 2.000 gutartigen Unternehmensoperationen. Das System war so präzise, dass es bei zweitausend normalen Geschäftsvorgängen keinen einzigen Fehlalarm auslöste.

Eine der bedeutendsten Erkenntnisse der Studie ist, dass das System nicht über eine superintelligente KI verfügen muss, um effektiv zu sein. Die Forscher fanden heraus, dass ein kleines, spezialisiertes Computerprogramm den Großteil der Sicherheitsprüfungen in Mikrosekunden bewältigen kann und erst dann auf ein größeres, komplexeres KI-Modell zurückgreift, wenn eine Anfrage mehrdeutig oder verdächtig ist. Dieser hybride Ansatz hält das System schnell und kostengünstig. Im routinemäßigen Geschäftsverkehr wurde das komplexe KI-Modell nie benötigt, was es dem System ermöglichte, mit der Geschwindigkeit der schnellen, einfachen Prüfungen zu arbeiten. Wenn das System doch einmal das größere Modell aufrufen musste, um eine knifflige Anfrage zu untersuchen, dauerte dies etwa achtzehn Millisekunden, was immer noch schnell genug für die meisten Echtzeitanwendungen ist. Dieses Design stellt sicher, dass Sicherheit nicht auf Kosten der Geschwindigkeit oder Nutzbarkeit geht, wodurch Unternehmen leistungsstarke KI-Agenten nutzen können, ohne ihre tägliche Arbeit zu verlangsamen.

Die Studie untersuchte auch, wie man verhindert, dass Daten durch eine Kette autorisierter Werkzeuge aus dem System nach außen gelangen. Selbst wenn ein Angreifer die KI nicht dazu bringen kann, ein verbotenes Werkzeug zu benutzen, könnte er versuchen, sensible Informationen von einem erlaubten Werkzeug zu einem anderen zu bewegen, um Daten effektiv auszuschmuggeln. Unter standardmäßigen Kapazitätsprüfungen allein fanden die Forscher heraus, dass Angreifer in einem signifikanten Anteil der Testfälle Daten exfiltrieren konnten, indem sie Informationen zwischen autorisierten Werkzeugen bewegten. Um dies zu stoppen, implementierten die Forscher ein Tracking-System, das dem Fluss der Informationen folgt, ähnlich wie eine Bank die Bewegung von Bargeld verfolgt, um sicherzustellen, dass es nicht verschwindet. Dieses System markiert sensible Daten, wie Passwörter oder Finanzunterlagen, und stellt sicher, dass diese Daten nur an Ziele fließen können, die ausdrücklich dafür freigegeben sind. In Tests, die über tausend Versuche zur Datendiebstahl mittels dieser spezifischen Tracking-Methode umfassten, blockierte das System jeden einzelnen Versuch und stellte sicher, dass sensible Informationen nicht an einen unbefugten Ort gelangen konnten.

Obwohl das System bemerkenswerte Erfolge zeigte, waren die Forscher sorgfältig darin, seine Grenzen aufzuzeigen. Die Sicherheitsgarantien beruhen auf der Annahme, dass der Sicherheitsmonitor selbst auf einem vertrauenswürdigen Computer läuft und nicht gehackt wurde. Wenn der Monitor kompromittiert wird, versagt das gesamte System. Zudem ist das System zwar exzellent darin, Angriffe abzufangen, die versuchen, Werkzeuge auf unbefugte Weise zu nutzen, aber es ist nicht perfekt darin, jede mögliche Variation eines Tricks zu erfassen, insbesondere solche, die komplexe, mehrstufige Manöver beinhalten, um das System zu verwirren. Die Forscher identifizierten eine kleine Anzahl von Fällen, in denen ihr System umgangen wurde, hauptsächlich bei sehr spezifischen Finanztricks oder Domainnamen-Tarnungen, und haben bereits Updates vorgeschlagen, um diese Lücken zu schließen. Sie beschreiben ihre Arbeit als eine Pre-Produktions-Architektur, was bedeutet, dass sie bereit für Tests in realen Umgebungen ist, aber noch eine weitere Validierung durch unabhängige Experten erfordert, bevor sie als fertiges kommerzielles Produkt gelten kann.

Die Auswirkungen dieser Arbeit erstrecken sich über die bloße Frage hinaus, wie man KI sicherer macht; sie verändert die Art und Weise, wie wir über den Bau intelligenter Systeme nachdenken. Indem sie die KI als eine potenziell unzuverlässige Komponente behandeln, die ständig überwacht werden muss, anstatt als einen zuverlässigen Partner, dem man zutraut, sich selbst zu kontrollieren, haben die Forscher einen Rahmen geschaffen, der viel schwerer zu brechen ist. Dieser Perspektivwechsel ermöglicht den Einsatz leistungsstarker, autonomer Agenten in sensiblen Bereichen wie Krankenhäusern, Banken und Regierungsbehörden, wo die Kosten eines Fehlers hoch sind. Das System beweist, dass hohe Sicherheit nicht den Verzicht auf Geschwindigkeit oder die Anforderung teurer Hardware bedeutet, was es zu einer praktischen Lösung für die Zukunft der künstlichen Intelligenz macht. Während diese Agenten in unserem täglichen Leben immer häufiger vorkommen, wird die Fähigkeit, das Denken vom Handeln zu trennen und strikte Regeln darüber durchzusetzen, was erlaubte Aktionen sind, entscheidend sein, um unsere digitale Welt sicher zu halten.

Die Forscher machten ihre Werkzeuge und Daten der Öffentlichkeit zugänglich, um anderen Wissenschaftlern zu ermöglichen, ihre Arbeit zu testen und zu verbessern. Sie veröffentlichten den Code für den Sicherheitsmonitor und die trainierten KI-Modelle und luden die weltweite Gemeinschaft ein, Schwachstellen zu finden und Verbesserungen vorzuschlagen. Diese Offenheit ist ein entscheidender Teil des wissenschaftlichen Prozesses und stellt sicher, dass das System nicht nur eine theoretische Idee ist, sondern ein praktisches Werkzeug, das untersucht und verfeinert werden kann. Die Studie kommt zu dem Schluss, dass es durch die Kombination von strengen, deterministischen Regeln mit smarten, flexiblen Prüfungen möglich ist, eine sichere Umgebung für autonome Agenten zu schaffen. Der Weg nach vorn besteht darin, diese Systeme weiterhin in realen Szenarien zu testen, die Regeln zu verfeinern, um neue Arten von Tricks abzufangen, und sicherzustellen, dass die Technologie robust bleibt, während sich die Bedrohungen weiterentwickeln. Die Arbeit stellt einen bedeutenden Schritt dar, um das Versprechen der autonomen KI zu einer sicheren und zuverlässigen Realität für alle zu machen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →