Agentic AI Systems and Financial Stability, From Model Risk to Systemic Risk
Dieses Paper argumentiert, dass der Übergang von prädiktiven zu agentischen KI-Systemen das finanzielle Risiko von diversifizierbaren idiosynkratischen Fehlern in nicht-diversifizierbare systemische Bedrohungen transformiert, wobei durch sechs mathematische Frameworks nachgewiesen wird, dass solche Risiken nicht durch Detektion oder Post-hoc-Kontrollen gemildert werden können, sondern eine ex-ante strukturelle Prävention erfordern.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Finanzielle Stabilität beruht auf einer tröstlichen Annahme: dass der Rest des Systems den Schock abfangen kann, wenn ein Teil des Systems ausfällt. Wenn eine Bank scheitert, überleben die anderen; wenn ein Händler einen Fehler macht, korrigiert sich der Markt selbst. Dies funktioniert, weil Ausfälle meist spezifisch für diese eine Institution sind, verstreut und unzusammenhängend. Doch eine neue Art von Risiko entsteht, die dieses Sicherheitsnetz zerschlägt. Es kommt von „agentischer“ künstlicher Intelligenz – Systemen, die die Zukunft nicht nur vorhersagen, sondern auch Handlungen in der realen Welt vollziehen, wie etwa Geld zu bewegen, Code zu schreiben oder die Patientenversorgung zu steuern. Wenn viele dieser Agenten auf derselben zugrunde liegenden Softwarebasis aufgebaut sind, bleibt ein einzelner Fehler oder ein einzelnes Hack nicht lokal begrenzt. Stattdessen trifft er jeden Agenten gleichzeitig und verwandelt einen kleinen Schluck in einen systemweiten Zusammenbruch.
Forscher der Federal Reserve haben Jahre damit verbracht, das Risiko im traditionellen Bankwesen zu untersuchen, wobei sie die Wahrscheinlichkeit eines Kreditausfalls messen und Rücklagen bilden, um den Verlust zu decken. Sie haben nun dieselbe rigorose Denkweise auf diese neuen KI-Systeme angewandt, stellten jedoch fest, dass die alten Regeln nicht funktionieren. Das Kernproblem besteht darin, dass diese KI-Agenten sich von menschlichen Arbeitern oder traditioneller Software unterscheiden. Sie handeln mit Geschwindigkeit und Autonomie, und wenn sie einen Fehler machen, ist der Schaden oft irreversibel. Man kann keine betrügerische Überweisung „rückgängig senden“ und keine kritische Datenbank „unlöschen“. Da der Schaden dauerhaft ist und instantan eintritt, sind die üblichen Sicherheitsnetze – wie etwa ein Plan B oder das Abwarten, um vor dem Reagieren abzuwarten – nutzlos. Die Forscher entdeckten, dass der einzige Weg, eine Katastrophe zu verhindern, darin besteht, sie von vornherein unmöglich zu machen, indem man die gefährlichen Fähigkeiten entfernt, bevor das System überhaupt läuft.
Die Studie, die sich über sechs verschiedene mathematische Untersuchungen erstreckt, beginnt mit der Betrachtung eines einzelnen KI-Agenten. Im traditionellen Finanzwesen wird das Risiko berechnet, indem man die Wahrscheinlichkeit eines Ereignisses mit der Größe des Verlusts multipliziert. Die Forscher passten dies für KI an, indem sie den Schaden in drei Teile zerlegten: wie wahrscheinlich es ist, dass der Agent eine schädliche Handlung vollzieht, wie schwerwiegend diese Handlung ist und wie weit ihre Reichweite reicht. Sie fanden heraus, dass diese drei Faktoren unter einem Angriff nicht unabhängig voneinander agieren. Ein einziges böswilliges Ereignis kann gleichzeitig dazu führen, dass der Agent wahrscheinlicher handelt, der Schaden schlimmer wird und das Ausmaß des Schadens expandiert. Dies erzeugt ein „Wrong-Way“-Risiko, bei dem sich die Gefahr rasant potenziert. Vor allem bewiesen sie, dass bei irreversiblen Schäden kein Maß an Überwachung oder die Fähigkeit, Fehler rückgängig zu machen, das Problem lösen kann. Wenn eine Handlung nicht rückgängig gemacht werden kann, ist die einzige Lösung sicherzustellen, dass der Agent gar nicht erst die Fähigkeit besitzt, diese Handlung auszuführen.
Die Forscher erweiterten daraufhin ihre Sichtweise von einem einzelnen Agenten auf eine Flotte von Tausenden, die alle auf demselben Fundamentmodell laufen. Hier wird das Risiko wahrhaft systemisch. In einem normalen Portfolio, wenn man viele verschiedene Investitionen besitzt, schadet ein Ausfall in der einen nicht den anderen. Aber wenn jeder Agent in einer Flotte dasselbe Gehirn teilt, betrifft ein Fehler in diesem Gehirn sie alle gleichzeitig. Die Forscher zeigten, dass das Risiko nicht sinkt, egal wie viele Agenten man zur Flotte hinzufügt. Stattdessen erreicht es einen „Boden“, der nicht durch Diversifikation eliminiert werden kann. Selbst wenn die Agenten in unterschiedlichen Unternehmen oder verschiedenen Ländern sind, wenn sie dieselbe zugrunde liegende Software nutzen, kann ein einzener Fehler die gesamte Gruppe zu Fall bringen. Dies ist das, was sie eine „Monokultur“ nennen: ein System, in dem alle derselben Bedrohung verwundbar sind.
Die Studie untersuchte auch, wie diese Agenten miteinander interagieren. In der realen Welt kommunizieren Agenten oft miteinander, tauschen Informationen aus oder koordinieren Aufgaben. Die Forscher fanden heraus, dass diese Interaktion eine neue, verborgene Gefahr schafft. Selbst wenn die Agenten auf unterschiedlicher Software basieren, können sie, wenn sie darauf programmiert sind, einander zuzuhören, in einer Krise beginnen, im Gleichschritt zu agieren. Wenn ein Agent Panik bekommt und sein Verhalten ändert, folgen die anderen, was eine Kettenreaktion auslöst, die das Risiko verbreitet. Dies geschieht selbst ohne einen gemeinsamen Softwarefehler. Darüber hinaus kann ein kompromittierter Agent Sprache nutzen, um seine Peers zu schädlichen Handlungen zu überreden, wodurch eine Kontagion entsteht, die sich eher durch Konversation als durch Code verbreitet. Das bedeutet, dass es nicht ausreicht, die technischen Netzwerke lediglich zu trennen; auch die Art und Weise, wie Agenten kommunizieren, muss kontrolliert werden.
Um zu verstehen, wie sich diese Risiken über die Zeit entwickeln, modellierten die Forscher das System als einen kontinuierlichen Fluss von Ereignissen, ähnlich der Untersuchung von Erdbeben oder Finanzcrashs. Sie fanden heraus, dass das Risiko eher wie ein seltener, massiver Sprung verläuft als wie ein langsames Driften. Das System kann lange Zeit stabil erscheinen und dann plötzlich kollabieren. Sie untersuchten auch, wie man diese Systeme während des Betriebs steuert, indem man „Leitplanken“ nutzt, um schlechte Handlungen zu stoppen. Sie bewiesen, dass diese Laufzeitkontrollen bei irreversiblen Ereignissen fundamental begrenzt sind. Wenn eine Handlung bereits irreversibel ist, ist es zu spät, sie zu detektieren und zu stoppen. Die Wahrscheinlichkeit einer Katastrophe hängt vollständig vom ursprünglichen Design des Systems ab, nicht davon, wie gut man es während des Betriebs beobachtet. Keine Menge an Überwachung kann einen Fehler beheben, der von Anfang an eingebaut wurde.
Die letzten Kapitel der Studie führten einen Gegenspieler ein – einen Hacker oder Angreifer, der ebenfalls fortschrittliche KI nutzt. Die Forscher behandelten dies als ein Spiel, bei dem der Angreifer versucht, den schwächsten Punkt zu finden, und der Verteidiger versucht, diesen zu blockieren. Sie fanden heraus, dass das System zu einem weitaus attraktiveren Ziel wird, wenn Angreifer KI einsetzen. Eine gemeinsame Softwarebasis ist wie ein einziger Schlüssel, der jede Tür in einem Gebäude öffnet; wenn ein Dieb diesen Schlüssel findet, kann er überall gleichzeitig eindringen. Die Studie zeigte, dass in einem dezentralisierten Markt, in dem jedes Unternehmen versucht, sich individuell zu schützen, alle unter den wichtigsten Sicherheitsmaßnahmen unterinvestieren werden: der strukturellen Prävention. Sie werden Geld für Detektion und Reaktion ausgeben, da dies leichter messbar und sichtbar ist, aber sie werden die harte Arbeit ignorieren, die gefährlichen Fähigkeiten gänzlich zu entfernen. Dies lässt das gesamte System verwundbar zurück.
Die Forscher kamen zu dem Schluss, dass der einzig effektive Weg, dieses Risiko zu managen, die „strukturelle Prävention“ ist. Dies bedeutet, das System so zu gestalten, dass katastrophale Handlungen physisch unmöglich sind, anstatt zu hoffen, sie nach dem Auftreten abzufangen. Es beinhaltet das Entfernen gefährlicher Werkzeuge, die Begrenzung von Berechtigungen und die Sicherstellung, dass Agenten nicht auf die Teile des Systems zugreifen können, die irreversible Schäden verursachen könnten. Die Studie bewies, dass dieser Ansatz der einzige ist, der gegen einen wachsenden, intelligenten Gegner funktioniert. Da die KI-Technologie besser wird und Angreifer fähiger werden, wird der Aufwand, auf jedes neue Risiko zu reagieren und es zu detektieren, unendlich. Im Gegensatz dazu ist die Kosten für das Entfernen einer gefährlichen Fähigkeit eine einmalige Investition, die das System dauerhaft schützt, ungeachtet dessen, wie intelligent der Angreifer wird.
Das Paper endet mit einer klaren Botschaft an Regulierungsbehörden und Systemdesigner. Finanzielle Stabilität im Zeitalter der KI kann nicht dadurch erreicht werden, dass man jede Institution genauer beobachtet oder darauf hofft, dass ein einzelner Ausfall sich nicht ausbreitet. Das Risiko ist zu tief und zu vernetzt. Der einzige Weg, das System zu sichern, besteht darin, strukturelle Entscheidungen zu treffen, bevor das System überhaupt in Betrieb geht. Das bedeutet, die Abhängigkeit von einer einzelnen Softwarebasis zu begrenszen, sicherzustellen, dass Agenten keine irreversiblen Handlungen vollziehen können, und das System so zu entwerfen, dass ein einzelner Fehlerpunkt nicht das gesamte Netzwerk zu Fall bringen kann. Die Mathematik ist eindeutig: Man kann einen gemeinsamen Fehler nicht durch Diversifikation eliminieren, man kann einen irreversiblen Fehler nicht durch Detektion ausbügeln und man kann nicht schnell genug reagieren, um einen koordinierten Angriff zu stoppen. Die einzige Lösung besteht darin, das System so zu bauen, dass die Katastrophe gar keine Chance hat, überhaupt zu geschehen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.