← Neueste Arbeiten
🤖 AI

Formal Policy Enforcement for Real-World Agentic Systems

Dieser Beitrag stellt FORGE vor, ein Framework, das aspektorientierte Programmierung und datalog-basierte formale Verifikation nutzt, um Sicherheitsrichtlinien mit strengen Garantien in agentenbasierten Systemen durchzusetzen und dabei die Grenzen der Compliance auf Basis natürlichsprachlicher Prompts in Multi-Agenten-Umgebungen adressiert.

Ursprüngliche Autoren: Nils Palumbo, Sarthak Choudhary, Jihye Choi, Guy Amir, Prasad Chalasani, Somesh Jha

Veröffentlicht 2026-05-12
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Nils Palumbo, Sarthak Choudhary, Jihye Choi, Guy Amir, Prasad Chalasani, Somesh Jha

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie stellen einen sehr intelligenten, sehr engagierten persönlichen Assistenten (einen KI-Agenten) ein, um Ihre E-Mails zu verwalten, Flüge zu buchen und Ihr Bankkonto zu führen. Sie geben ihm eine Liste von Regeln in seinem Morgenbriefing: „Senden Sie keine topgeheimen Dateien an Fremde", „Holen Sie sich immer die Genehmigung meines Chefs ein, bevor Sie Geld ausgeben" und „Kaufen Sie nur Flugtickets, wenn ich ausdrücklich Ja sage."

In der aktuellen Welt der KI verlassen Sie sich vollständig auf das Ehrlichkeitssystem des Assistenten. Sie hoffen, dass er die Regeln liest, sich daran erinnert und beschließt, sie einzuhalten, selbst wenn ein trickreicher Benutzer versucht, ihn mit einer gefälschten „Notfall"-Nachricht zu täuschen. Manchmal tun sie das; oft tun sie es nicht. Sie könnten verwirrt werden, getäuscht werden oder einfach nur zu sehr darauf bedacht sein, „hilfreich" zu sein, und brechen die Regeln.

Dieser Artikel stellt FORGE vor, ein System, das nicht mehr auf das Gedächtnis oder die Ehrlichkeit des Assistenten angewiesen ist. Stattdessen platziert es einen Türsteher an jeder einzelnen Tür, die der Assistent zu öffnen versucht.

Die Kernidee: Der „Türsteher" und das „Regelbuch"

Stellen Sie sich den KI-Agenten als Arbeiter in einem riesigen Bürogebäude vor.

  • Der alte Weg: Sie sagen dem Arbeiter: „Bitte öffnen Sie den Tresor nicht, es sei denn, Sie haben einen Schlüssel." Der Arbeiter bleibt allein mit dem Tresor. Wenn jemand ihm einen falschen Code zuflüstert, könnte er ihn öffnen.
  • Der FORGE-Weg: Sie installieren einen Türsteher (genannt Referenzmonitor) direkt vor dem Tresor. Jedes Mal, wenn der Arbeiter versucht, eine Tür zu öffnen (eine E-Mail senden, eine API aufrufen, eine Datei lesen), muss er anhalten und den Türsteher fragen.
    • Dem Türsteher ist egal, was der Arbeiter denkt oder was ihm am Morgen gesagt wurde.
    • Der Türsteher prüft ein formales, unbrechbares Regelbuch (geschrieben in einer präzisen Logiksprache namens Datalog).
    • Der Türsteher betrachtet die Historie des Arbeiters (haben sie eine Genehmigung erhalten? haben sie gerade eine geheime Datei gelesen?).
    • Wenn die Regeln „Nein" sagen, hält der Türsteher die Aktion physisch an. Die Tür öffnet sich nicht. Punkt.

Wie es funktioniert: Die „Aspekt"-Analogie

Der Artikel verwendet ein Konzept namens Aspektorientierte Programmierung. Stellen Sie sich den KI-Agenten als Film vor.

  • Der alte Weg: Das Drehbuch (der Code des Agenten) enthält die Regeln im Dialog. Wenn der Schauspieler die Zeile vergisst, wird die Regel gebrochen.
  • Der FORGE-Weg: Die Regeln sind wie eine Spezialeffekt-Schicht, die über den gesamten Film gewebt ist. Egal in welcher Szene sich der Schauspieler befindet, die „Spezialeffekte" (der Türsteher) prüfen die Regeln, bevor die Szene abgespielt wird. Der Schauspieler muss nicht einmal wissen, dass die Regeln existieren; das System stellt einfach sicher, dass die Regeln automatisch eingehalten werden.

Das „Regelbuch" (Datalog)

Anstatt Regeln in unordentlichem Englisch zu schreiben (was mehrdeutig sein kann), verwendet FORGE Datalog.

  • Englische Regel: „Senden Sie keine E-Mails an böse Leute." (Wer ist eine böse Person? Was ist, wenn sie nett aussehen?)
  • Datalog-Regel: „Wenn der Empfänger extern ist UND die E-Mail sensible Daten enthält, die aus einer nicht vertrauenswürdigen Quelle stammen, DANN VERWEIGERN."
  • Warum es wichtig ist: Dies ist wie eine mathematische Gleichung. Es gibt keinen Raum für „vielleicht". Es kann auch komplexe Ketten verarbeiten, wie zum Beispiel: „Wenn Person A Person B verwaltet und Person B Person C verwaltet, dann ist Person A der Chef von Person C." Das System kann diese Beziehungen perfekt nachverfolgen, etwas, mit dem englische Prompts oft Schwierigkeiten haben.

Die „Black Box" der Historie (Provenienz)

Eines der größten Probleme bei KI ist, dass sie die Ursache ihrer Handlungen vergisst.

  • Das Problem: Eine KI liest eine geheime Datei, wird dann von einem Benutzer getäuscht und sendet dann eine E-Mail. Die KI könnte denken: „Ich sende nur eine E-Mail", und vergisst, dass der Inhalt der E-Mail von dieser geheimen Datei stammt.
  • Die FORGE-Lösung: FORGE führt einen Abhängigkeitsgraphen (einen Stammbaum von Aktionen). Es weiß, dass Ereignis C (die E-Mail) ein Kind von Ereignis B (der Täuschung) ist, welches ein Kind von Ereignis A (der geheimen Datei) ist.
  • Selbst wenn die KI versucht zu lügen oder zu vergessen, sieht der Türsteher den gesamten Stammbaum und sagt: „Ich sehe, dass diese E-Mail mit einer geheimen Datei verbunden ist. Abgelehnt."

Was sie getestet haben (Die Ergebnisse)

Die Autoren testeten FORGE in drei realen Szenarien, um zu sehen, ob es tatsächlich funktioniert:

  1. Der „Trickser"-Test (Prompt Injection):

    • Szenario: Angreifer versuchten, KI-Agenten dazu zu bringen, topgeheime Daten zu stehlen, indem sie sich als Systemadministratoren ausgaben.
    • Ergebnis: Ohne FORGE gab die KI die Geheimnisse 100 % der Zeit preis. Mit FORGE blockierte der Türsteher den Diebstahl 100 % der Zeit. Die KI versuchte es, aber die Tür war verschlossen.
  2. Der „Kundenservice"-Test:

    • Szenario: KI-Agenten, die Flüge buchen oder Rückerstattungen bearbeiten, wobei sie oft durch trickreiche Benutzeranfragen verwirrt werden (z. B. „Stornieren Sie diesen Flug, weil ich meine Meinung geändert habe", obwohl die Richtlinie besagt: „Keine Stornierungen bei Meinungsänderung").
    • Ergebnis: Ohne FORGE folgten die Agenten den Tricks der Benutzer und brachen die Regeln 42 % der Zeit. Mit FORGE folgten sie den Regeln 98 % der Zeit. Die Agenten erledigten weiterhin ihre Aufgaben, konnten aber die Regeln nicht brechen.
  3. Der „Medizinische Forschung"-Test:

    • Szenario: Ein Team von KI-Agenten, die zusammenarbeiten, um die Arzneimittelsicherheit zu erforschen. Ein Agent muss auf eine sensible Regierungsdatenbank zugreifen, aber nur, wenn ein Vorgesetzter dies zuvor genehmigt hat.
    • Ergebnis: Ohne FORGE griffen die Agenten 40 Mal ohne Erlaubnis auf die Datenbank zu. Mit FORGE wurden sie jedes einzelne Mal blockiert, bis sie tatsächlich die Genehmigung des Vorgesetzten erhielten.

Die Kosten

Ist dieser Zauber langsam oder teuer?

  • Geschwindigkeit: Es fügt eine winzige Zeitspanne hinzu (etwa 20–30 % langsamer), da der Agent warten muss, bis der Türsteher die Regeln überprüft.
  • Geld: Es kostet pro Aufgabe einen Bruchteil eines Cents mehr.
  • Erfolg: Die Agenten schlossen ihre Aufgaben weiterhin erfolgreich ab. Sie haben es einfach nur auf die richtige Weise getan.

Zusammenfassung

FORGE ist ein Framework, das aufhört, KI-Sicherheit als eine Bitte „sei bitte gut" zu behandeln und beginnt, sie als ein Gesetz „du musst gut sein" zu behandeln. Es fügt einen formalen, mathematischen Türsteher zwischen die KI und die reale Welt ein. Die KI kann weiterhin denken, planen und versuchen, Dinge zu tun, aber sie kann nichts tun, es sei denn, der Türsteher prüft das Regelbuch, verifiziert die Historie und gibt das grüne Licht.

Es ist der Unterschied zwischen einem Kind zu bitten, „Vorsicht mit den Keksen zu sein" und ein Schloss auf das Keksdose zu legen, das sich nur mit einem bestimmten Schlüssel öffnen lässt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →