Agentic AI Systems and Financial Stability, From Model Risk to Systemic Risk
Este artículo sostiene que la transición de los sistemas de IA predictivos a los agénticos transforma el riesgo financiero de errores idiosincrásicos diversificables en amenazas sistémicas no diversificables, demostrando a través de seis marcos matemáticos que tales riesgos no pueden mitigarse mediante la detección o controles post hoc y requieren una prevención estructural ex ante.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La estabilidad financiera se basa en una suposición reconfortante: que cuando una parte del sistema se rompe, el resto puede absorber el impacto. Si un banco falla, los demás sobreviven; si un operador comete un error, el mercado se corrige a sí mismo. Esto funciona porque los fallos suelen ser únicos para esa institución específica, dispersos y no relacionados. Pero está surgiendo un nuevo tipo de riesgo que destruye esta red de seguridad. Proviene de la inteligencia artificial "agéntica": sistemas que no solo predicen el futuro, sino que toman acciones en el mundo real, como mover dinero, escribir código o gestionar la atención de un paciente. Cuando muchos de estos agentes están construidos sobre la misma base de software, un solo error o un solo hackeo no se queda local. En cambio, golpea a cada agente a la vez, convirtiendo un pequeño fallo técnico en un colapra de todo el sistema.
Investigadores de la Reserva Federal han pasado años estudiando cómo gestionar el riesgo en la banca tradicional, donde miden la probabilidad de que un préstamo caiga en impago y reservan dinero para cubrir la pérdida. Ahora han aplicado este mismo pensamiento riguroso a estos nuevos sistemas de IA, pero descubrieron que las viejas reglas no funcionan. El problema central es que estos agentes de IA son diferentes de los trabajadores humanos o del software tradicional. Actúan con velocidad y autonomía, y cuando cometen un error, el daño suele ser irreversible. No se puede "desenviar" una transferencia bancaria fraudulenta ni "deseliminar" una base de datos crítica. Debido a que el daño es permanente y ocurre instantáneamente, las redes de seguridad habituales —como tener un plan de contingencia o esperar a ver qué sucede antes de reaccionar— son inútiles. Los investigadores descubrieron que la única forma de detener una catástrofe es evitar que sea posible desde el principio, eliminando las capacidades peligrosas antes de que el sistema se ejecute.
El estudio, que abarca seis investigaciones matemáticas distintas, comienza analizando un solo agente de IA. En las finanzas tradicionales, el riesgo se calcula multiplicando la probabilidad de un evento por el tamaño de la pérdida. Los investigadores adaptaron esto para la IA, desglosando el daño en tres partes: qué tan probable es que el agente realice una acción dañina, qué tan severa es esa acción y qué tanto se extiende su alcance. Descubrieron que, cuando un agente está bajo ataque, estos tres factores no actúan de forma independiente. Un solo evento malicioso puede hacer simultáneamente que el agente sea más propenso a actuar, que el daño sea peor y que el alcance del daño se amplíe. Esto crea un riesgo de "vía errónea" donde el peligro se potencia rápidamente. Lo más importante es que demostraron que, para daños irreversibles, ninguna cantidad de monitoreo o capacidad de revertir errores puede solucionar el problema. Si una acción no se puede deshacer, la única solución es asegurar que el agente nunca tenga la capacidad de realizar esa acción en absoluto.
Los investigadores ampliaron luego su visión de un solo agente a una flota de miles, todos ejecutándose sobre el mismo modelo fundacional. Aquí es donde el riesgo se vuelve verdaderamente sistémico. En una cartera normal, si tienes muchas inversiones diferentes, un fallo en una no perjudica a las otras. Pero si cada agente en una flota comparte el mismo cerebro, un fallo en ese cerebro los afecta a todos simultáneamente. Los investigadores demostraron que, sin importar cuántos agentes se añadan a la flota, el riesgo no disminuye. En cambio, alcanza un "suelo" que no se puede diversificar. Incluso si los agentes están en diferentes empresas o diferentes países, si dependen del mismo software subyacente, un solo fallo puede derribar a todo el grupo. Esto es lo que llaman un "monocultivo": un sistema donde todos son vulnerables a la misma amenaza exacta.
El estudio también examinó cómo interactúan estos agentes entre sí. En el mundo real, los agentes suelen hablar entre ellos, compartiendo información o coordinando tareas. Los investigadores encontraron que esta interacción crea un peligro nuevo y oculto. Incluso si los agentes están construidos con software diferente, si están programados para escucharse entre sí, pueden empezar a moverse al unísono durante una crisis. Si un agente entra en pánico y cambia su comportamiento, los demás lo siguen, creando una reacción en cadena que propaga el riesgo. Esto sucede incluso sin un fallo de software compartido. Además, un agente comprometido puede usar el lenguaje para persuadir a sus pares para que hagan algo dañino, creando un contagio que se propaga a través de la conversación en lugar del código. Esto significa que simplemente separar las redes técnicas no es suficiente; la forma en que los agentes se comunican también debe ser controlada.
Para entender cómo estos riesgos se manifiestan a lo largo del tiempo, los investigadores modelaron el sistema como un flujo continuo de eventos, de forma similar a cómo se estudian los terremotos o los colapsos financieros. Descubrieron que el riesgo se comporta como un salto masivo y poco frecuente en lugar de un deslizamiento lento. El sistema puede parecer estable durante mucho tiempo y luego colapsar repentinamente. También analizaron cómo controlar estos sistemas mientras se ejecutan, utilizando "barreras de contención" para detener acciones dañinas. Demostraron que, para eventos irreversibles, estos controles en tiempo de ejecución son fundamentalmente limitados. Si una acción ya es irreversible, esperar a detectarla y detenerla es demasiado tarde. La probabilidad de un desastre depende enteramente del diseño inicial del sistema, no de qué tan bien se vigile mientras se ejecuta. Ninguna cantidad de monitoreo puede arreglar un fallo que fue incorporado desde el principio.
Los capítulos finales del estudio introdujeron a un adversario: un hacker o atacante que también utiliza IA avanzada. Los investigadores trataron esto como un juego donde el atacante intenta encontrar el punto más débil y el defensor intenta bloquearlo. Descubrieron que, cuando los atacantes usan IA, el sistema se convierte en un objetivo mucho más atractivo. Una base de software compartida es como una llave única que abre todas las puertas de un edificio; si un ladrón encuentra esa llave, puede entrar en todas partes a la vez. El estudio mostró que, en un mercado descentralizado, donde cada empresa intenta protegerse individualmente, todos invertirán de menos en la medida de seguridad más importante: la prevención estructural. Gastarán dinero en detección y reacción porque son más fáciles de ver y medir, pero ignorarán el trabajo duro de eliminar las capacidades peligrosas por completo. Esto deja a todo el sistema vulnerable.
Los investigadores concluyeron que la única forma efectiva de gestionar este riesgo es mediante la "prevención estructural". Esto significa diseñar el sistema de modo que las acciones catastróficas sean físicamente imposibles de realizar, en lugar de esperar a capturarlas después de que ocurran. Implica eliminar herramientas peligrosas, limitar permisos y asegurar que los agentes no puedan acceder a las partes del sistema que podrían causar daños irreversibles. El estudio demostró que este enfoque es el único que funciona contra un adversario inteligente y creciente. A medida que la tecnología de IA mejora y los atacantes se vuelven más capaces, el costo de intentar detectar y reaccionar ante cada nueva amenaza se vuelve infinito. En contraste, el costo de eliminar una capacidad peligrosa es una inversión de una sola vez que protege el sistema para siempre, independientemente de qué tan inteligente sea el atacante.
El documento termina con un mensaje claro para los reguladores y diseñadores de sistemas. La estabilidad financiera en la era de la IA no se puede lograr vigilando más de cerca a cada institución o esperando que un solo fallo no se propague. El riesgo es demasiado profundo y está demasiado interconectado. La única forma de asegurar el sistema es tomar decisiones estructurales antes de que el sistema empiece a funcionar. Esto significa limitar cuánto se depende de una sola base de software, asegurar que los agentes no puedan realizar acciones irreversibles y diseñar el sistema de modo que un solo punto de falla no pueda derribar a toda la red. La matemática es clara: no puedes diversificar un fallo compartido, no puedes detectar la salida de un error irreversible y no puedes reaccionar lo suficientemente rápido para detener un ataque coordinado. La única solución es construir el sistema de modo que el desastre nunca tenga la oportunidad de ocurrir.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.