← Neueste Arbeiten
🤖 AI

Governing Actions, Not Agents: Institutional Attestation as a Governance Model for Autonomous AI Systems

Dieses Papier schlägt ein Governance-Modell für autonome KI-Systeme vor, das die Autonomie der Agenten bei der Planung bewahrt, während die Ausführung hochriskanter Aktionen auf jene beschränkt wird, die unabhängig von autoritativen Quellen attestiert, kryptographisch an die Intention gebunden und durch deterministische Richtlinien validiert sind.

Ursprüngliche Autoren: Jakob Salfeld-Nebgen

Veröffentlicht 2026-06-26
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Jakob Salfeld-Nebgen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die Kernidee: Beobachte nicht den Fahrer, prüfe die Schlüssel

Stellen Sie sich vor, Sie haben ein sehr intelligentes, selbstfahrendes Auto (einen KI-Agenten), das komplexe Fahrten planen, mit anderen Autos kommunizieren und sogar entscheiden kann, selbstständig zum Supermarkt zu fahren.

Derzeit versuchen die meisten Sicherheitssysteme, das Gehirn des Fahrers zu beobachten. Sie fragen: "Denkt der Fahrer gerade darüber nach, einen Unfall zu bauen? Verwendet er die richtigen Worte?" Die Arbeit argumentiert, dass dies der falsere Ansatz ist. Stattdessen sollten wir die Handlung selbst betrachten.

Die Arbeit schlägt eine neue Regel vor: Versuchen Sie nicht, die Gedanken des Fahrers zu kontrollieren; stellen Sie stattdessen einfach sicher, dass er die richtigen Schlüssel und Genehmigungen besitzt, bevor er die Zündung einschaltet.

Das Problem: Der „Black Box“-Fahrer

Momentan können KI-Agenten gefährliche Dinge tun (wie Softwarecode bereitstellen oder Medikamente verschreiben), ohne dass ein Mensch jeden einzelnen Schritt überprüft.

  • Der alte Weg: Wir versuchen, das „Gehirn“ der KI zu beobachten, um zu sehen, ob sie sich korrekt verhält. Aber wenn die KI intelligent ist, kann sie so wirken, als würde sie sich korrekt verhalten, während sie dennoch einen Fehler macht, weil sie einen Fakt übersehen hat (z. B. „Ich habe nicht geprüft, ob der Patient allergisch ist“ oder „Ich habe nicht geprüft, ob der Software-Build fehlgeschlagen ist“).
  • Der Fehler: Die KI kommuniziert vielleicht mit den richtigen Werkzeugen, aber sie weiß eigentlich nicht, ob die Welt sicher ist. Es ist wie ein Fahrer, der denkt, die Straße sei frei, aber nicht tatsächlich auf die Ampel geschaut hat.

Die Lösung: Das „Concierge“-Modell

Die Arbeit schlägt vor, dass wir ein System nutzen, das von menschlichen Institutionen (wie Krankenhäusern und Banken) seit Jahrhunderten verwendet wird. Anstatt die Person zu überwachen, fordern wir unabhängigen Nachweis, bevor eine Handlung stattfindet.

Betrachten Sie die KI als einen Boten (oder Kurier) und das neue System namens Governance Hub als einen strengen Concierge.

So funktioniert der Prozess Schritt für Schritt:

1. Der Bote stellt eine Anfrage (Absichtserklärung)

Die KI (der Bote) sagt zum Hub: "Ich möchte diesen Softwarecode auf die Live-Website bereitstellen."

  • Der Hub sagt noch nicht „Ja“ oder „Nein“.
  • Stattdessen gibt der Hub dem Boten ein einzigartiges, einmaliges Ticket (eine sogenannte Intent ID). Dieses Ticket ist wie ein spezifisches Schloss, das nur zu dieser speziellen Anfrage passt.

2. Der Bote sammelt „versiegelte Umschläge“ (Attestierung)

Der Bote kann nicht einfach sagen: „Ich habe den Code geprüft, er ist in Ordnung.“ Er muss zu drei verschiedenen, unabhängigen Experten (genannt Oracles) gehen und versiegelte, unterschriebene Umschläge von ihnen einholen.

  • Oracle 1 (Der Code-Prüfer): Prüft den Code und unterschreibt einen Umschlag mit der Aussage: „Code hat die Prüfung bestanden.“
  • Oracle 2 (Der Sicherheits-Scanner): Sucht nach Viren und unterschreibt einen Umschlag mit der Aussage: „Keine Viren gefunden.“
  • Oracle 3 (Der Test-Läufer): Prüft, ob die Tests bestanden wurden, und unterschreibt einen Umschlag mit der Aussage: „Tests bestanden.“

Wichtige Regel: Der Bote kann diese Umschläge nicht selbst schreiben. Er kann sie nur einsammeln. Die Umschläge sind mit einem speziellen digitalen Siegel versehen, das beweist, dass sie vom echten Experten stammen und nicht gefälscht sind.

3. Das „Ticket“ muss zum „Umschlag“ passen (Bindung)

Der Bote bringt die Umschläge zum Hub zurück. Der Hub prüft zwei Dinge:

  1. Die Siegel: Sind die Unterschriften echt? Haben die Experten sie tatsächlich unterschrieben?
  2. Das Ticket: Passt das einzigartige Ticket im Inneren des Umschlags zu dem Ticket, das der Hub zu Beginn ausgegeben hat?
    • Warum das wichtig ist: Dies verhindert, dass der Bote einen alten Umschlag von einem erfolgreichen Test von gestern benutzt, um einen heutigen Fehlversuch durchzuwinken. Das Ticket stellt sicher, dass der Nachweis aktuell ist und zu dieser spezifischen Handlung gehört.

4. Der Hub trifft die Entscheidung (Deterministische Richtlinie)

Der Hub betrachtet die Regeln (die Policy). Zum Beispiel: "Wenn der Code bestanden wurde, keine Viren gefunden wurden und die Tests erfolgreich waren, dann erlaube die Bereitstellung."

  • Wenn die Umschläge den Regeln entsprechen, sagt der Hub „GO“ und unterschreibt eine endgültige Erlaubnis.
  • Wenn etwas fehlt oder abgelaufen ist, sagt der Hub „STOPP“.

Warum dies besser ist (Die Metaphern)

1. Die „Notar“-Analogie
Stellen Sie sich vor, Sie möchten ein Haus verkaufen. Sie fragen nicht einfach den Verkäufer: „Ist das Haus sicher?“ Stattdessen gehen Sie zu einem Notar. Der Notar kennt den Verkäufer nicht persönlich; er prüft lediglich die Dokumente.

  • In diesem KI-Modell ist der Hub der Notar.
  • Die Oracles sind die unabhängigen Prüfer (Klempner, Elektriker, Statiker).
  • Die KI ist nur die Person, die die Unterlagen hält. Sie kann die Unterschriften der Prüfer nicht fälschen.

2. Die „Banktresor“-Analogie
Um einen Hochsicherheitstresor einer Bank zu öffnen, benötigen Sie nicht nur einen Schlüssel. Sie brauchen drei verschiedene Personen, die gleichzeitig drei verschiedene Schlüssel drehen.

  • Die KI ist die Person, die vor dem Tresor steht.
  • Die Oracles sind die drei Bankangestellten.
  • Die KI kann den Tresor nicht öffnen, es sei denn, alle drei Angestellten haben die spezifische Transaktion unabhängig vone-einander bestätigt.

Was dieses Modell leistet (und was nicht)

Was es TUT:

  • Garantiert Fakten: Es stellt sicher, dass vor einer gefährlichen Handlung unabhängige Experten die Fakten verifiziert haben (z. B. „Die Wechselwirkung mit Medikamenten wurde geprüft“, „Der Build war erfolgreich“).
  • Verhindert Fälschungen: Die KI kann nicht über die Ergebnisse lügen, da sie nicht im Besitz der Signaturschlüssel ist.
  • Erstellt einen Pfad der Nachvollziehbarkeit: Jede Entscheidung wird in einem permanenten, unveränderlichen Protokoll festgehalten (wie ein Blackbox-Rekorder), damit jeder später prüfen kann: „Haben wir die Wechselwirkung mit Medikamenten wirklich geprüft?“

Was es NICHT tut:

  • Es bewertet nicht die „Gedanken“ der KI: Wenn die KI entscheidet, ein Medikament aus einem seltsamen, schädlichen Grund zu verschreiben, aber dabei technisch alle Regeln befolgt hat (Wechselwirkungen geprüft, Lizenz geprüft), wird dieses System sie trotzdem gewähren lassen. Es prüft den Prozess, nicht das Motiv.
  • Es verhindert nicht das Planen der KI: Die KI ist immer noch frei darin, zu denken, zu planen und zu kommunizieren. Sie kann jedoch bei Hochrisiko-Aktionen nicht ohne die entsprechenden Dokumente handeln.

Das Fazstezt

Die Arbeit argumentet, dass wir nicht versuchen sollten, eine „Gedankenpolizei“ zu bauen, die beobachtet, was KI-Agenten denken. Stattdessen sollten wir ein „Gatekeeper“-System (Torwächter-System) bauen.

Genau wie ein Chirurg nicht operieren darf, ohne eine unterschriebene Einverständniserklärung und eine verifizierte Patienten-ID zu haben, sollte eine KI nicht erlaubt sein, Code bereitzustellen oder Medikamente zu verschreiben, ohne unabhängigen, unterschriebenen Nachweis dafür zu führen, dass die Bedingungen sicher sind. Die KI ist der Bote; der Nachweis ist der Schlüssel; und der Hub ist das Schloss.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →