← Neueste Arbeiten
💻 computer science

Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents

Dieser Beitrag stellt das Prinzip der Informationsviabilität und das RiskGate-Framework vor, die auf Aubins Viabilitätstheorie basieren, um eine adaptive Laufzeitsteuerung für autonome KI-Agenten zu ermöglichen, indem Schranken für nicht beobachtete Risiken abgeschätzt und monotonische Beschränkungen durchgesetzt werden, um die Sicherheit trotz Verhaltensdrift und adversarischer Anpassung zu gewährleisten.

Ursprüngliche Autoren: German Marin, Jatin Chaudhary

Veröffentlicht 2026-04-28
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: German Marin, Jatin Chaudhary

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie haben einen sehr intelligenten, autonomen Roboter-Assistenten eingestellt, um Ihr Bankkonto zu verwalten, Ihre Termine zu planen und Ihre Einkäufe zu bestellen. Sie haben ihm die volle Berechtigung erteilt, zu handeln. Doch hier liegt das Problem: Selbst wenn Sie den Code niemals ändern, kann der Roboter langsam beginnen, schlechte Entscheidungen zu treffen. Er könnte durch neue Arten von Anfragen verwirrt werden, bestimmte Personengruppen gegenüber anderen bevorzugen oder versehentlich eine Reihe winziger, harmloser Aktionen aneinanderreihen, die sich zu einem massiven Betrug summieren.

Dieser Artikel mit dem Titel „Governing What You Cannot Observe" (Regierung dessen, was Sie nicht beobachten können) schlägt eine neue Methode vor, um diese KI-Agenten sicher zu halten. Anstatt nur zu prüfen, ob eine einzelne Aktion erlaubt ist, schlägt er vor, die „Vitalzeichen" des Agenten zu überwachen, um vorherzusagen, ob er krank werden wird, bevor er tatsächlich abstürzt.

Hier ist die Aufschlüsselung ihrer Ideen mit einfachen Analogien:

1. Das Kernproblem: Der „Stille Drift"

Stellen Sie sich einen KI-Agenten wie ein Auto vor, das auf einer Autobahn fährt.

  • Der alte Weg: Sie prüfen das Auto vor jeder Kurve. „Ist diese Kurve legal?" Wenn ja, lassen Sie es fahren.
  • Das Problem: Die Reifen des Autos könnten sich langsam abnutzen, das Kraftstoffgemisch könnte leicht aus dem Gleichgewicht geraten oder der Fahrer könnte müde werden. Selbst wenn jede einzelne Kurve legal ist, könnte das Auto aufgrund dieser langsamen, unsichtbaren Veränderungen schließlich einen Unfall bauen.
  • Die Erkenntnis des Artikels: Sie können nicht nur auf die aktuelle Kurve schauen; Sie müssen das „Nicht beobachtete Risiko" abschätzen. Dies ist die Gefahr, die Sie jetzt nicht sehen können, aber in ein paar Minuten vorhanden sein wird.

2. Die neue Regel: Der „Sicherheitsabstand"

Die Autoren schlagen eine einfache Regel vor, das Prinzip der Informationsviabilität. Stellen Sie sich vor, die KI hat ein „Sicherheitsbudget".

  • Kapazität (S): Wie gut die KI gerade funktioniert (z. B. ob sie Fragen korrekt beantwortet).
  • Risikogrenze (B): Die geschätzte Gefahr von Dingen, die Sie noch nicht sehen können (z. B. dass die KI langsam beginnt zu halluzinieren oder voreingenommen zu werden).
  • Die Regel: Die KI darf nur dann handeln, wenn ihre Kapazität ihre Risiken um einen sicheren Abstand übersteigt.
    • Analogie: Sie fahren nur mit dem Auto, wenn Ihr Kraftstofftank (Kapazität) deutlich voller ist als die Entfernung zur nächsten Tankstelle (Risiko). Wenn die Lücke zu klein wird, hören Sie auf zu fahren, selbst wenn das Auto in diesem Moment gut aussieht.

3. Die drei versteckten Gefahren (Die „Risikogrenze")

Der Artikel zerlegt dieses unsichtbare Risiko in drei spezifische Arten von „Krankheiten", die die KI bekommen könnte:

  • U(x) – Die „Verwirrung" (Unsicherheit): Die KI vergisst langsam, was sie früher wusste. Vielleicht hat sich die Welt verändert, oder die KI hat ein Software-Update erhalten, das ihr Verhalten verändert hat.
    • Analogie: Ein Koch, der früher perfekte Suppe zubereitete, aber langsam beginnt, das Rezept zu vergessen und jeden Tag eine Prise mehr Salz hinzufügt.
  • SB(x) – Die „Ungerechtigkeit" (Strukturelle Verzerrung): Die KI behandelt verschiedene Personengruppen unterschiedlich, auch wenn sie dies nicht absichtlich zu tun scheint.
    • Analogie: Ein Türsteher in einem Club, der plötzlich 90 % der Menschen aus einem bestimmten Viertel hereinlässt, aber nur 10 % aus einem anderen, obwohl niemand ihm dies befohlen hat.
  • RG(x) – Der „Trick" (Realitätslücke): Die KI tut Dinge, die einzeln betrachtet sicher aussehen, aber gefährlich sind, wenn sie zusammengefügt werden.
    • Analogie: Ein Dieb, der fünfmal hintereinander 4.900 $ an einem Geldautomaten abhebt. Jeder Abhebevorgang liegt unter dem 5.000 $-Limit, das einen Alarm auslösen würde, aber die Summe von 24.500 $ ist eindeutig ein Diebstahl. Die KI muss die gesamte Geschichte sehen, nicht nur den einzelnen Abhebevorgang.

4. Die Lösung: Der „Autopilot" und der „Viabilitätsindex"

Die Autoren haben ein System namens RiskGate entwickelt, um dies zu verwalten. Es fungiert wie ein Gesundheitsmonitor für die KI.

  • Der Viabilitätsindex (VI): Dies ist eine einzelne Zahl (von -1 bis +1), die Ihnen sagt, wie gesund die KI ist.
    • +1: Die KI ist extrem sicher.
    • 0: Die KI balanciert am Rand.
    • -1: Die KI hat Probleme.
  • Vorhersage der Zukunft (Antizipation): Das System wartet nicht einfach darauf, dass die KI kaputtgeht. Es zieht eine Linie durch die jüngste Geschichte des „Gesundheitsindex". Wenn die Linie nach unten zeigt, sagt es voraus, wann die KI Null erreichen wird.
    • Analogie: Ein Arzt, der den Temperaturverlauf eines Patienten betrachtet. Selbst wenn sich der Patient jetzt gut fühlt, weiß der Arzt, wenn die Temperatur jede Stunde um 1 Grad steigt, dass der Patient in zwei Stunden Fieber haben wird, und handelt bevor das Fieber einsetzt.
  • Die „Nur-Verstärken"-Regel (Monotone Einschränkung): Dies ist ein entscheidendes Sicherheitsmerkmal. Wenn die KI anfängt, krank zu werden, kann das System die Regeln nur verschärfen (es vorsichtiger machen). Es kann die Regeln niemals automatisch lockern.
    • Analogie: Wenn ein Schiff zu sinken beginnt, kann der Kapitän nur weitere Luken schließen. Er kann keine weiteren Luken öffnen, um das Problem zu „lösen". Wenn das Schiff zu schnell sinkt, ist die einzige Option, den „Kill-Switch" zu betätigen (die KI vollständig stoppen) und menschliche Hilfe zu rufen.

5. Wie es in der Praxis funktioniert (Die Beispiele)

Der Artikel testet dies mit zwei Szenarien:

  1. Der „Structuring"-Betrug: Ein böswilliger Akteur versucht, Geld zu stehlen, indem er viele kleine Überweisungen tätigt.
    • Ergebnis: Die „Verwirrungs"- und „Ungerechtigkeits"-Detektoren sahen nichts Falsches, da jede Überweisung normal aussah. Aber der „Trick"-Detektor (der die gesamte Sequenz betrachtet) erkannte das Muster und stoppte den Diebstahl.
  2. Der „Stille Voreingenommenheit"-Betrug: Eine KI beginnt damit, Kreditanträge einer bestimmten Minderheitengruppe langsam über die Zeit hinweg etwas häufiger abzulehnen.
    • Ergebnis: Das System bemerkte, dass der „Gesundheitsindex" langsam sank. Es sagte voraus, dass die KI nach etwa 100 weiteren Transaktionen unfair werden würde. Es verschärfte automatisch die Regeln, bevor die Voreingenommenheit zu einem Rechtsbruch wurde.

Zusammenfassung

Dieser Artikel argumentiert, dass es bei der Regulierung von KI nicht darum geht, für jede einzelne Aktion eine Liste von „Do's and Don'ts" zu prüfen. Es geht darum, das unsichtbare Risiko abzuschätzen, das sich im Laufe der Zeit aufbaut. Indem wir trennen, was wir sehen können (die aktuellen Aktionen der KI), von dem, was wir nicht sehen können (der langsame Drift in die Gefahr), und indem wir ein System verwenden, das bei Risiken nur strenger werden kann (niemals lockerer), können wir autonome Agenten sicher halten, bevor sie echten Schaden anrichten.

Was der Artikel NICHT behauptet:

  • Er behauptet nicht, dies bereits an Millionen realer KI-Agenten getestet zu haben (dies ist für zukünftige Arbeiten geplant).
  • Er behauptet nicht, jedes mögliche KI-Problem zu lösen (wie „Ziel-Fehlausrichtung" oder „Täuschung"), sondern bietet einen Rahmen, um die häufigsten Arten von Drift und Verzerrung zu erkennen.
  • Er sagt nicht, dass die KI sich selbst reparieren kann; wenn der „Gesundheitsindex" zu niedrig wird, stoppt das System und wartet auf einen Menschen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →