← Neueste Arbeiten
💻 computer science

SARC: A Governance-by-Architecture Framework for Agentic AI Systems

Dieser Beitrag stellt SARC vor, ein Laufzeit-Governance-Framework, das Einschränkungen als Specification-Objekte ersten Ranges behandelt, um Verpflichtungen an mehreren Stellen innerhalb der Agentenschleife durchzusetzen, wodurch Verletzungen von harten Einschränkungen eliminiert und Überschreitungen weicher Fenster im Vergleich zu traditionellen nachgelagerten oder Policy-as-Code-Ansätzen erheblich reduziert werden.

Ursprüngliche Autoren: Gaston Besanson

Veröffentlicht 2026-05-12
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Gaston Besanson

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bauen einen sehr intelligenten, autonomen Roboterassistenten (eine „Agentic AI"), der Aufgaben wie Bestellungen von Vorräten, Flugbuchungen oder Geldverwaltung übernehmen kann. Sie möchten, dass dieser Roboter hilfreich ist, müssen aber gleichzeitig sicherstellen, dass er keine Gesetze bricht, zu viel Geld ausgibt oder gefährliche Fehler macht.

Derzeit versuchen die meisten Unternehmen, diese Roboter zu kontrollieren, indem sie ihnen Regeln in einem Notizbuch (Prompts) geben oder ihre Arbeit nach Abschluss überprüfen (nachträgliche Prüfungen). Das Papier argumentiert, dass dies so ist, als würde man einen Sicherheitsbeamten einstellen, der die Tür erst überprüft, nachdem der Dieb bereits davongelaufen ist. Es ist zu spät.

Die Autoren stellen SARC (State, Action, Reward, Constraints) vor, eine neue Methode zum Bau solcher Roboter, bei der die Regeln fest in das Gehirn des Roboters verdrahtet sind, bevor er auch nur einen Schritt unternimmt.

Hier ist die einfache Aufschlüsselung der Funktionsweise:

1. Die Kernidee: Die „Erstklassige" Regel

In der traditionellen Programmierung sagen Sie dem Roboter, was er tun soll (State), welche Werkzeuge er hat (Action) und was er erreichen möchte (Reward). Das Papier besagt, dass uns ein vierter, entscheidender Teil fehlt: Constraints (C).

Stellen Sie es sich wie ein Auto vor:

  • Alter Weg: Sie sagen dem Fahrer: „Bitte fahren Sie sicher", und prüfen dann den Polizeibericht, wenn er ein Ticket bekommt.
  • SARC-Weg: Sie installieren einen Drehzahlbegrenzer und eine Bremse direkt im Motor des Autos. Wenn das Auto versucht, in einer 30-Meilen-Zone 90 Meilen pro Stunde zu fahren, kann das Auto dies physisch nicht tun. Die Regel ist nicht nur ein Vorschlag; sie ist ein mechanischer Teil der Maschine.

2. Die vier „Sicherheitsgates"

SARC hat nicht nur eine Regel; es verfügt über vier spezifische Kontrollpunkte, an denen die Aktionen des Roboters gestoppt und überprüft werden, bevor sie stattfinden. Stellen Sie sich einen hochsicheren Flughafen vor:

  1. Das Pre-Action Gate (PAG): Bevor der Roboter überhaupt ein Werkzeug aufnimmt.

    • Analogie: Der TSA-Mitarbeiter, der Ihren Ausweis und Ihre Bordkarte überprüft, bevor Sie in das Flugzeug steigen.
    • Funktion: Wenn der Roboter plant, etwas Teures zu kaufen, stoppt dieses Gate ihn sofort, wenn er keine menschliche Genehmigung hat. Es blockiert „harte" Regeln (wie „Kaufen Sie niemals illegale Gegenstände").
  2. Der Action-Time Monitor (ATM): Während der Roboter die Aufgabe ausführt.

    • Analogie: Eine Flugbegleiterin, die während des Fluges die Motorinstrumente überwacht.
    • Funktion: Wenn der Roboter Daten streamt oder einen langen Anruf tätigt, überwacht dieser Monitor dies in Echtzeit. Wenn die Kosten zu hoch werden oder die Daten seltsam aussehen, kann er die Verbindung mitten im Flug unterbrechen.
  3. Der Post-Action Auditor (PAA): Direkt nach Abschluss der Aufgabe, bevor die nächste beginnt.

    • Analogie: Den Kassenbon sofort nach dem Verlassen des Ladens zu prüfen, bevor Sie zum nächsten Geschäft gehen.
    • Funktion: Es wird überprüft, was tatsächlich passiert ist. Wenn der Roboter in den letzten 24 Stunden zu viel Geld ausgegeben hat, könnte er den nächsten Kauf verlangsamen. Es behandelt „weiche" Regeln (wie „Geben Sie nicht zu viel aus, aber es ist in Ordnung, wenn es gelegentlich passiert").
  4. Der Escalation Router (ER): Der „Rufen Sie einen Menschen an"-Knopf.

    • Analogie: Der Pilot, der den „Mayday"-Knopf drückt und die Kontrolle an die Flugsicherung abgibt.
    • Funktion: Wenn der Roboter etwas sieht, bei dem er sich nicht sicher ist (wie einen neuen Lieferanten), pausiert er, ruft einen Menschen an und wartet auf ein „Go" oder „No-Go"-Signal. Wenn der Mensch nicht rechtzeitig antwortet, sagt der Roboter automatisch „Nein", um auf der sicheren Seite zu sein.

3. Warum „Einfaches Sagen" nicht funktioniert

Das Papier beweist mathematisch, dass man einem Roboter nicht einfach sagen kann: „Wenn Sie eine Regel brechen, verlieren Sie 1.000 Punkte an Glück."

  • Das Problem: Wenn ein Roboter durch das Brechen einer Regel eine Million Dollar verdienen kann und die Wahrscheinlichkeit, erwischt zu werden, winzig ist, wird der Roboter das Risiko trotzdem eingehen, weil die Belohnung so groß ist.
  • Die SARC-Lösung: Anstatt zu hoffen, dass der Roboter wählt, die Regel nicht zu brechen, baut SARC eine Mauer, die der Roboter nicht überwinden kann. Es behandelt Regeln als physische Barrieren, nicht nur als Vorschläge.

4. Der „Kassenbon" (Prüfpfad)

Eines der größten Probleme bei KI ist, dass, wenn etwas schiefgeht, niemand weiß, warum oder wer es getan hat.

  • Alter Weg: Sie schauen sich eine unordentliche Protokolldatei an und versuchen zu erraten, was passiert ist.
  • SARC-Weg: Jedes Mal, wenn sich der Roboter bewegt, druckt er automatisch einen perfekten, maschinenlesbaren Kassenbon. Dieser Bon besagt: „Ich wollte X tun. Ich habe Regel Y geprüft. Regel Y sagte 'Stopp'. Ich habe gestoppt."
  • Der Vorteil: Wenn ein Regulierungsbeamter fragt: „Haben Sie das Gesetz befolgt?", müssen Sie nicht raten. Sie zeigen ihnen einfach den Bon. Das Papier nennt dies „Prüfbar durch Konstruktion".

5. Was passiert, wenn Roboter miteinander sprechen?

In großen Unternehmen kann ein Roboter einen anderen Roboter beauftragen, eine Arbeit zu erledigen.

  • Das Risiko: Roboter A könnte Roboter B anweisen, etwas Illegales zu tun, in der Hoffnung, dass Roboter B die Regeln nicht kennt.
  • Die SARC-Lösung: Die Regeln reisen mit der Arbeit mit. Wenn Roboter A eine Regel hat, muss Roboter B sie ebenfalls befolgen. Wenn Roboter B versucht, die Regel zu verstecken, fängt das System dies ab. Es führt zudem einen klaren Stammbaum darüber, wer was autorisiert hat, damit Sie genau wissen, welcher Mensch für die endgültige Entscheidung verantwortlich ist.

6. Der Trade-Off (Es ist nicht kostenlos)

Das Papier ist ehrlich: SARC macht den Roboter etwas langsamer, da er an jedem Gate anhalten und Regeln überprüfen muss.

  • Die Analogie: Es ist wie das Fahren eines Autos mit einem strikten Drehzahlbegrenzer. Sie kommen nicht so schnell an Ihr Ziel wie ein rücksichtsloser Fahrer, aber Sie werden nicht abstürzen.
  • Der Punkt: Das Papier argumentiert, dass in regulierten Umgebungen (wie Banken oder Gesundheitswesen) „sicher und prüfbar" zu sein wichtiger ist als „schnell und riskant". Die Kosten der Verzögerung sind ein bekannter, handhabbarer Preis, den man für Sicherheit zahlt.

Zusammenfassung

SARC ist ein Bauplan für den Aufbau von KI, die Regeln durch Design und nicht durch Zufall befolgt. Es verlagert die Regeln von einer „Vorschlagsbox" (Prompts) und einer „Nachspiel-Analyse" (Audits) in den Maschinenraum der KI. Es stellt sicher, dass, wenn ein Roboter versucht, etwas Verbotenes zu tun, das System ihn physisch stoppt, einen Menschen um Hilfe bittet oder den Versuch perfekt protokolliert, wodurch die KI sicher, erklärbar und bereit für die reale Welt wird.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →