← Neueste Arbeiten
💻 computer science

Agent Guard: Kernel-Enforced Damage Boundaries for AI Agents via Human-Authorized Contracts

Dieses Paper präsentiert Agent Guard, einen Linux-Referenzmonitor, der durch den Einsatz von eBPF-basierten LSMs menschenautorisierte Schadensgrenzen für KI-Agenten erzwingt, indem er unbefugten Datei- und Netzwerkzugriff deterministisch verweigert und strikte „No-Egress“-Zustände über Prozesshierarchien hinweg propagiert, wodurch ein signifikant geringerer Overhead als bei bestehenden Baselines erreicht wird.

Ursprüngliche Autoren: Dongxu Cui, Zhichao Gu, Ping Zheng, Wenshuai Xi, Simeng Han, Yong Liao

Veröffentlicht 2026-09-01
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Dongxu Cui, Zhichao Gu, Ping Zheng, Wenshuai Xi, Simeng Han, Yong Liao

Originalarbeit lizenziert unter CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

In der modernen digitalen Landschaft hat sich künstliche Intelligenz von einem einfachen Textgenerator zu einem proaktiven Arbeiter entwickelt, der in der Lage ist, komplexe Aufgaben zu planen, Programme auszuführen und mit den Dateien und Netzwerken eines Computers zu interagieren. Diese neue Autonomie bringt jedoch eine spezifische Art von Risiko mit sich: Wenn die KI einen Fehler macht, durch einen bösartigen Prompt getäuscht wird oder schlichtweg eine gefährliche Anweisung halluziniert, kann sie Befehle ausführen, die genau das System beschädigen, dem sie eigentlich helfen soll. Traditionelle Sicherheitsmaßnahmen fungieren oft wie ein Türsteher vor einem Club, der den Namen eines Werkzeugs prüft, bevor er es hineinlässt, aber sie haben Schwierigkeiten zu verfolgen, was passiert, sobald dieses Werkzeug eine Shell öffnet, einen Kindprozess startet oder eine Datei schreibt, die später von einem anderen Programm gelesen wird. Sob sobald die KI die erste Prüfung passiert hat, können ihre Handlungen durch das Betriebssystem nachwirken, wodurch Sicherheitsteams nicht mehr unterscheiden können, welcher Teil der Ausführung autorisiert war und welcher Teil den Schaden verursacht hat.

Um dies zu lösen, haben Forscher ein System namens Agent Guard entwickelt, das wie ein kontinuierlicher, unermüdlicher Monitor im Kern des Computers, dem Kernel, agiert. Anstatt darauf zu vertrauen, dass die KI die Regeln befolgt oder sich darauf zu verlassen, dass die KI vorschlägt, was erlaubt sein sollte, erfordert dieses System, dass ein Mensch die Grenzen bestätigt, bevor die KI ausgeführt werden darf. Der Mensch autorisiert einen spezifischen Satz von Regeln für die Handlungen der KI, und das Betriebssystem des Computers setzt diese Regeln mit absoluter Gewissheit durch. Wenn die KI versucht, etwas außerhalb ihres autorisierten Rahmens zu tun, stoppt das System sie sofort, noch bevor ein Schaden entstehen kann. Dieser Ansatz verlagert den Fokus von dem Versuch, jeden möglichen Fehler vorherzusagen, den die KI machen könnte, hin zur Schaffung eines starren, unzerbrechlichen Zauns um die spezifischen Ressourcen, die der Mensch als sicher zum Anfassen definiert hat.

Die Forscher bauten dieses System, indem sie ein spezielles Tor schufen, das zwischen der Autorisierung durch den Menschen und der Ausführung durch die KI sitzt. Bevor die KI irgendeinen Code ausführen darf, muss ein Mensch einen vorgeschlagenen Plan überprüfen und genau bestätるieren, auf welche Dateien und Netzwerkverbindungen die KI zugreifen darf. Diese Bestätigung ist nicht nur ein Vorschlag; sie ist ein formeller Vertrag, den der Computer durch das Betriebssystem festschreibt. Das System bindet diesen Vertrag dann an die spezifische Aufgabe, die die KI gleich ausführen wird. Wenn die KI versucht, einen Befehl auszuführen, der gegen diesen Vertrag verstößt, verweigert das Betriebssystem die Anfrage sofort. Entscheidend ist, dass das System nicht nur den anfänglichen Befehl prüft, sondern die gesamte Kette der Ereignisse überwacht. Wenn die KI eine Datei schreibt und diese Datei später von einem anderen Programm gelesen wird, wandert die Einschränkung mit der Datei mit. Wenn die KI eine Netzwerkverbindung öffnet, stellt das System sicher, dass keine Daten das Computer verlassen können, wenn der Vertrag dies verbietet, selbst wenn die Verbindung etabliert wurde, bevor die Einschränkung vollständig angewendet wurde.

Um dieses Maß an Kontrolle zu erreichen, nutzten die Forscher eine Technologie, die es dem System ermöglicht, sich direkt an die internen Hooks des Betriebssystems anzuhängen. Sie erstellten eine Datenebene, die jeden Prozess, jede Datei und jeden Kommunikationskanal mit einem spezifischen Status kennzeichnet. Wenn ein Prozess eine eingeschränkte Datei liest, erbt er die Einschränkung. Wenn er in eine Pipe oder einen Socket schreibt, geht die Einschränkung auf das andere Ende über. Diese Ausbreitung ist monoton, was bedeutet, dass eine einmal angewendete Einschränkung nicht einfach durch das Neustarten eines Programms oder das Umbenennen einer Datei durch die KI entfernt werden kann. Das System stellt sicher, dass sich der „No-Go“-Status durch das Netzwerk der Prozesse wie ein Fleck ausbreitet, der nicht mehr herauszuwaschen ist, und verhindert so, dass die KI ihre Handlungen durch Zwischenschritte „wäscht“, um die Regeln zu umgehen.

Das Team testete dieses System streng, um zu sehen, ob es tatsächlich den Schaden verhindern kann, den es zu verhindern vorgibt. Sie führten hunderte von formalen Sicherheitstests durch, die neunzehn verschiedene Szenarien abdeckten, darunter Fälle, in denen die KI versuchte, auf Dateien zuzugreifen, auf die sie keinen Zugriff haben sollte, Daten über das Netzwerk zu senden, nachdem sie eingeschränkt worden war, oder Einschränkungen auf andere Programme zu übertragen. In jedem einzelnen der 570 Testdatensätze funktionierte das System genau wie vorgesehen. Es verweigerte unbefugte Aktionen erfolgreich, verbreitete Einschränkungen korrekt über verschiedene Dateitypen und Kommunikationskanäle und stellte sicher, dass keine Nebenwirkungen außerhalb der vereinbarten Grenzen auftraten. Das System bewies, dass es eine strikt vom Menschen autorisierte Schadensgrenze aufrechterhalten kann, ohne jemals auf das eigene Urteilsvermögen der KI angewiesen zu sein oder deren Richtlinienvorschläge zu nutzen.

Über den bloßen Beweis der Funktionalität hinaus maßen die Forscher, wie sehr dieses zusätzliche Sicherheitsschicht den Computer verlangsamte. Sie verglichen ihr System mit einer vorherigen Methode namens ActPlane, einem ähnlichen Sicherheitstool. In Tests, die das Lesen und Schreiben von Dateien betrafen, verursachte das neue System eine Verzögerung von etwa 12 Prozent im Vergleich zu einem Computer ohne Sicherheitsmaßnahmen. Im Gegensatz dazu verlangsamte das ältere System den Computer je nach Aufgabe um zwischen 33 und 61 Prozent. Dieser signifikante Unterschied deutet darauf an, dass der neue Ansatz nicht nur sicherer, sondern auch wesentlich effizienter ist, was ihn für den praktischen Einsatz, bei dem es auf Geschwindigkeit ankommt, praktikabel macht. Die Forscher fanden heraus, dass die Kosten für die Überprüfung der Regeln und die Verfolgung des Datenflusses minimal waren, insbesondere im Vergleich zum schweren Overhead der vorangegangenen Generation von Werkzeugen.

Die Studie hob auch hervor, was das System nicht tut, was ebenso wichtig ist wie das, was es tut. Das System erhebt nicht den Anspruch, jedes mögliche Problem der KI-Sicherheit zu lösen, noch garantiert es, dass die ursprüngliche Entscheidung des Menschen perfekt war. Es stellt lediglich sicher, dass das, was der Mensch als Regel entscheidet, das auch der Computer ohne Fehl und Tadel befolgt. Es schützt nicht vor Ressourcen, die nie deklariert wurden, und es verhindert auch nicht, dass eine KI Schaden anrichtet, wenn der Mensch explizit eine gefährliche Aktion autorisiert hat. Das System ist ein Werkzeug zur Durchsetzung, kein Ersatz für menschliches Urteilsvermögen. Es nimmt die komplexe, oft vage Idee der „sicheren KI“ und verwandelt sie in eine konkrete, technische Realität, in der die Grenzen von einem Menschen definiert und von der Maschine durchgesetzt werden.

Am Ende zeigt die Arbeit, dass es möglich ist, ein Sicherheitsnetz für künstliche Intelligenz zu schaffen, das sowohl strikt als auch effizient ist. Indem die Forscher die Rolle der KI, die Handlungen vorschlägt, von der Rolle des Menschen, der sie autorisiert, trennen und dann das Betriebssystem zur Durchsetzung dieser Autorisierungen nutzen, haben sie ein Modell geschaffen, in dem Schäden begrenzt und vorhersehbar sind. Das System verlässt sich nicht darauf, dass die KI sich gut verhält; es verlässt sich darauf, dass das Betriebssystem verhindert, dass die KI sich schlecht verhält. Dieser Wechsel vom Vertrauen in den Agenten hin zur Durchsetzung des Vertrags stellt eine fundamentale Änderung dar, wie wir die Zukunft des autonomen Computings sichern könnten, indem wir gewährleisten, dass selbst wenn die KI einen Fehler macht, die Konsequenzen innerhalb der Mauern bleiben, die der Mensch gebaut hat.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →