Effective Segregation of Duties in Agentic Enterprise Authorization: Evaluating Shared-Dependence Risk in Maker–Checker Controls
Este artículo introduce el concepto de Segregación de Funciones (SoD) Efectiva para distinguir entre la separación de identidad nominal y la garantía independiente real en la autorización impulsada por IA, demostrando a través de un benchmark P2P a gran escala que la mitigación efectiva del riesgo depende de la mediación de evidencia y de modelos de verificación heterogéneos en lugar de la mera distinción de principios.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
En el mundo de las grandes organizaciones, desde bancos hasta agencias gubernamentales, existe una regla fundamental para mantener la seguridad: ninguna persona sola debe tener el poder de iniciar una transacción y terminarla por sí misma. Este principio, conocido como la separación de funciones, garantiza que si una persona comete un error o intenta actuar de manera indebida, una segunda persona lo detecte antes de que algo perjudicial suceda. Durante décadas, este sistema dependió de dos humanos diferentes revisando el trabajo del otro. Hoy en día, sin embargo, muchas de estas tareas se están delegando a agentes de inteligencia artificial. Estos son programas de software que pueden leer documentos, tomar decisiones e incluso ejecutar transferencias financieras. La pregunta que enfrentan los expertos en seguridad ya no es solo si hay dos programas de IA diferentes, sino si esos dos programas son verdaderamente independientes. Si ambos agentes dependen de la misma tecnología subyacente, de las mismas fuentes de información o de la misma forma de pensar, podrían cometer exactamente el mismo error al mismo tiempo, invalidando la verificación de seguridad.
Un estudio reciente se propuso probar precisamente este escenario. Los investigadores crearon un entorno simulado basado en reglas de adquisiciones del mundo real, donde un agente de IA actuando como "creador" propondría una compra, y un segundo agente de IA actuando como "verificador" decidiría si la aprueba. El objetivo era ver con qué frecuencia el verificador fallaría al no detener una propuesta errónea. El equipo probó diferentes formas de configurar estos dos agentes. En algunos casos, ambos agentes utilizaban el mismo tipo de modelo de IA. En otros, utilizaban modelos diferentes. También probaron si el verificador tenía permitido ver el razonamiento del creador o si debía observar los hechos brutos directamente, y si el verificador tenía que depender de la información que el creador decidía resaltar o si podía acceder a los datos originales y sin filtrar.
Los resultados fueron contundentes. Cuando el sistema se configuró con el nivel más alto de dependencia compartida —donde ambos agentes utilizaban el mismo modelo de IA, el verificador podía ver el razonamiento del creador y el verificador solo veía la información seleccionada por el creador—, el sistema de seguridad fallaba más del sesenta por ciento de las veces. En estas situaciones, el segundo agente simplemente coincidía con los errores del primero, permitiendo que transacciones inseguras procedieran. Sin embargo, cuando los investigadores cambiaron la configuración para reducir estas dependencias compartidas, los resultados mejoraron drásticamente. Al utilizar un modelo de IA diferente para el verificador, ocultar el razonamiento del creador y dar al verificador acceso directo a los datos de origen, la tasa de fallos descendió a poco más del trece por ciento. Esto significa que tener dos agentes de IA diferentes no es suficiente; la forma en que están conectados y qué información ven importa mucho más que sus identidades.
El estudio también analizó con qué frecuencia el sistema entorpecía el buen trabajo. Una verificación de seguridad que rechaza todas las propuestas, incluso las seguras, es inútiles porque detiene el negocio. Los investigadores descubrieron que las configuraciones mejoradas no causaron este problema. Los sistemas que detectaban más propuestas erróneas no rechazaban significativamente más propuestas correctas. Esto sugiere que es posible construir verificaciones de seguridad de IA que sean tanto estrictas como eficientes, siempre que se diseñen para evitar las trampas específicas que causan que fallen en conjunto.
Uno de los hallazgos más significativos fue sobre cómo fluye la información entre los dos agentes. La mayor mejora se produjo cuando el verificador recibió acceso directo a la evidencia original en lugar de depender de un resumen proporcionado por el creador. Cuando el creador actuaba como intermediario de los datos, la tasa de fallos era mucho mayor. Esto indica que el primer agente puede, de forma involuntaria o intencionada, filtrar los mismos detalles necesarios para detectar un error. Al eliminar al intermediario y permitir que el segundo agente vea los hechos brutos, el sistema se volvió mucho más fiable. Del mismo modo, ocultar la explicación escrita del primer agente al segundo ayudó a reducir los errores, lo que sugiere que el segundo agente a veces se veía influenciado por la confianza o la lógica del primero en lugar de ceñirse a los hechos.
Los investigadores también probaron qué sucede cuando se emparejan dos tipos diferentes de modelos de IA. Descubrieron que utilizar un modelo diferente para el verificador reducía significらmente la probabilidad de que ambos fallaran en la misma propuesta errónea. Sin embargo, señalaron con cautela que este resultado era específico para la pareja de modelos que utilizaron. No garantiza que cualquier par de modelos de IA diferentes funcionen siempre bien juntos, pero sí demuestra que mezclar modelos es una estrategia poderosa para romper la cadena de errores compartidos. El estudio también destacó un desafío práctico: una de las combinaciones de modelos era más propensa a fallos técnicos que hacían que sus respuestas fueran ilegibles. Esto recordó a los investigadores que la seguridad no trata solo de inteligencia, sino también de fiabilidad. Si una verificación de seguridad no puede producir una respuesta clara, no puede cumplir su función.
En última instancia, este trabajo cambia la forma en que debemos pensar sobre la seguridad en los sistemas automatizados. Demuestra que la vieja regla de "dos personas diferentes" no se traduce automáticamente a "dos agentes de IA diferentes". Si los dos agentes son demasiado similares en su forma de pensar, en lo que ven o en cómo están construidos, es probable que fallen juntos. La verdadera seguridad requiere un diseño deliberado que obligue al segundo agente a mirar el problema desde un ángulo diferente, utilizando herramientas e información distintas. El estudio concluye que las organizaciones no pueden simplemente asumir que sus verificaciones de seguridad de IA están funcionando porque tienen dos agentes. Deben medir el rendimiento real de esas verificaciones, asegurándose de que el segundo agente sea verdaderamente independiente y capaz de detectar los errores del primero. Solo al tratar la seguridad como un resultado medible y no como una etiqueta estructural podremos confiar estas poderosas nuevas herramientas a nuestras decisiones más sensibles.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.