← Últimos artículos
🤖 AI

CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents

CAGE es un marco de certificación para agentes de LLM que utilizan herramientas que asegura que las acciones autorizadas sigan siendo válidas bajo fallos de vinculación discretos y deriva numérica continua combinados, mediante la certificación directa de vecindades conjuntas, eliminando así los falsos positivos que surgen de tratar los canales categóricos y numéricos por separado.

Autores originales: Blaise Delattre, Cong Wang, Yang Cao

Publicado 2026-08-03
📖 1 min de lectura☕ Lectura para el café

Autores originales: Blaise Delattre, Cong Wang, Yang Cao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: CAGE (Autorización Certificada bajo Incertidumbre de Retorno Tipado)

1. Planteamiento del Problema

El artículo aborda una vulnerabilidad crítica en los Agentes de Modelos de Lenguaje Grande (LLM) con uso de herramientas. Aunque los entornos de despliegue de agentes emplean cada vez más puertas de permisos en tiempo de ejecución para autorizar llamadas a herramientas, estas puertas evalúan el retorno de la herramienta observado y la acción propuesta en un único punto en el tiempo. No tienen en cuenta la incertidumbre de vinculación residual: la posibilidad de que el registro validado observado por el agente (z~\tilde{z}) difiera del retorno "correctamente vinculado" (zz^\star) debido a fallos menores de ensamblaje (por ejemplo, etiquetas de procedencia obsoletas, desajustes de esquema o condiciones de carrera) y deriva numérica acotada.

El problema central es que una acción puede parecer segura bajo el registro observado e incluso bajo verificaciones separadas para perturbaciones discretas (categóricas) y continuas (numéricas), pero puede volverse insegura cuando estas perturbaciones ocurren de forma conjunta. Los autores denominan a esto el ataque de brecha conjunta (joint-gap attack). Las defensas existentes, que a menudo se centran en sanear texto no confiable o en evaluar acciones puntuales, dejan la frontera de decisión desprotegida contra estas incertidumbres semánticas específicas.

2. Metodología: CAGE

Los autores proponen CAGE (Puerta de Autorización Certificada para la Ejecución), un monitor en tiempo de ejecución que desplaza el objeto de la autorización del punto observado (z~,a)(\tilde{z}, a) a un vecindario conjunto Bd,ϵ(z~)B_{d,\epsilon}(\tilde{z}). Una acción aa se autoriza solo si permanece segura para cada retorno plausible correctamente vinculado dentro de este vecindario.

El Vecindario Conjunto

El vecindario se define mediante dos presupuestos:

  • Presupuesto Discreto (dd): Permite hasta dd fallos de vinculación admisibles (por ejemplo, un intercambio de procedencia único o confusión de paquetes de políticas).
  • Presupuesto Continuo (ϵ\epsilon): Permite una deriva 2\ell_2 acotada en campos numéricos (por ejemplo, puntuaciones de riesgo, montos) después de la validación estándar.

El Teorema de No Composición

Una contribución teórica central es la demostración de que la certificación separada de los canales no se compone.

  • Teorema 1: Un predicado de seguridad puede ser seguro bajo todas las perturbaciones continuas del estado discreto original y seguro bajo todos los intercambios discretos del valor continuo original, pero inseguro bajo un cambio combinado de intercambio discreto y desplazamiento continuo.
  • Implicación: Los certificados marginales (verificar texto y números por separado) son inconsistentes. La defensa debe certificar el producto cartesiano de las perturbaciones discretas y continuas.

El Algoritmo CAGE

CAGE opera mediante la enumeración exacta del vecindario discreto seguida de una certificación sólida de la rama continua:

  1. Enumerar: Calcular el conjunto finito de vecinos discretos Nd(s)={s:Ddisc(s,s)d}N_d(s) = \{s' : D_{disc}(s, s') \le d\}.
  2. Certificar Ramas: Para cada vecino discreto ss', certificar que la acción es segura para todas las perturbaciones continuas xx' dentro de la bola ϵ\epsilon.
  3. Decisión: Permitir la acción solo si cada rama pasa su prueba de certificación continua.

La Escalera de Supuestos (Backends)

CAGE soporta diferentes backends dependiendo de la naturaleza de la política (ejecutable vs. aprendida):

  • CAGE-Exact (Nivel 1): Se utiliza cuando la política es un predicado ejecutable (por ejemplo, restricciones afines en Rego o tablas de decisión). Realiza una verificación matemática exacta de las restricciones sobre la bola ϵ\epsilon. Esto es política-certificada.
  • CAGE-Lip (Nivel 2): Se utiliza para puertas aprendidas (políticas implícitas). Emplea una arquitectura de red neuronal 1-Lipschitz. Certifica la decisión de la puerta basándose en el margen Lipschitz (hθ>Lcertϵh_\theta > L_{cert}\epsilon). Esto es puerta-certificada y es sólido bajo un supuesto de fidelidad de la política de la puerta medido.
  • CAGE-RS (Nivel 3): Se utiliza para puertas de caja negra. Aplica Suavizado Aleatorizado (Randomized Smoothing) para proporcionar garantías probabilísticas sobre la bola continua. Esto también es puerta-certificado.

3. Contribuciones Clave

  1. Formalización de la Autorización Robusta: El artículo formaliza la autorización post-retorno de herramienta como una decisión bajo incertidumbre semántica acotada, demostrando que la seguridad dependiente del retorno requiere inspeccionar el retorno realizado (Proposición 1).
  2. Prueba de No Composición: Los autores demuestran que los certificados marginales para los canales categóricos y numéricos no implican seguridad sobre su producto conjunto, identificando la existencia de "testigos de brecha conjunta" (Teorema 1).
  3. Monitor Certificado con Escalera de Supuestos: CAGE proporciona un marco unificado que enumera el espacio discreto exactamente y certifica el espacio continuo utilizando una jerarquía de backends (Exact, Lipschitz, Smoothing), asegurando un suelo de solidez incluso para las puertas aprendidas.
  4. Caso de Seguridad Medido: El trabajo proporciona un caso de seguridad riguroso calibrado sobre fallos inyectados, demostrando que CAGE elimina los "permisos falsos" (false allows) dentro del presupuesto mientras retiene la autonomía útil.

4. Resultados Experimentales

La evaluación abarca entornos sintéticos, política-como-código (Open Policy Agent, GoRules), marcos regulatorios (PSD2/AML) y datos reales de transacciones (IEEE-CIS).

  • Existencia de Testigos de Brecha Conjunta: El estudio confirma que los testigos de brecha conjunta existen en cada configuración, ocurriendo a frecuencias naturales de 3.5% a 12%.
  • Solidez (Soundness): En todos los entornos, CAGE logra una tasa de Permiso Falso Certificado (CFA) de 0. En contraste, las puertas puntuales y las líneas base de composición marginal admiten estos testigos inseguros a tasas altas (a menudo el 100% del conjunto de testigos).
  • Autonomía: A pesar de las estrictas garantías de seguridad, CAGE retiene una autonomía significativa:
    • CAGE-Exact autoriza autónomamente el 22–34% de las decisiones robustamente seguras en configuraciones de política-como-código y el 57% en tráfico natural.
    • Los backends aprendidos (Lip/RS) retienen entre el 6.5% y el 37% de autonomía dependiendo de la rigidez del punto de operación.
  • Validación de Extremo a Extremo: En pruebas de sistemas en vivo (Kubernetes, rutas de escritura de MCP, motores AML), CAGE bloqueó con éxito efectos secundarios no autorizados (por ejemplo, despliegues no autorizados, escrituras que exceden la cuota) que fueron admitidos por agentes sin protección o con puertas de control puntual.
  • Ataques Adaptativos: CAGE permanece sólido contra adversarios adaptativos que conocen la política y el presupuesto, mientras que las puertas puntuales aprendidas sufren altas tasas de permisos falsos (hasta el 98% en algunos ataques sintéticos).

5. Significado y Reivindicaciones

El artículo afirma que CAGE proporciona un mecanismo de autorización calibrado para decisiones donde la seguridad depende de retornos tipados inciertos. Su importancia radica en:

  • Cerrar la Brecha Lógica: Es el primer sistema que certifica formalmente el vecindario conjunto de los retornos tipados, abordando una vulnerabilidad que las defensas puntuales y marginales pasan por alto.
  • Implementabilidad Práctica: Al ofrecer una "escalera de supuestos", cierra la brecha entre las políticas ejecutables teóricamente perfectas y las puertas aprendidas prácticas, proporcionando garantías formales incluso en estas últimas bajo condiciones de fidelidad explícitas.
  • Realismo Operativo: El trabajo separa explícitamente la garantía formal de los precondiciones operativas (por ejemplo, la frescura de los datos, la integridad del constructor). Cuantifica el "riesgo residual" cuando estas precondiciones fallan (por ejemplo, si la obsolescencia de los datos excede el presupuesto declarado), en lugar de reclamar inmunidad absoluta.

Los autores son modestos en cuanto a sus afirmaciones de validez externa: demuestran la existencia, realizabilidad y mecanismo de los ataques de brecha conjunta en tuberías de estilo desplegado, pero no afirman haber medido la prevalencia de estos fallos específicos en todos los sistemas de agentes del mundo real. Concluyen que CAGE es un control de tiempo de ejecución necesario siempre que la incertidumbre del retorno tipado pueda ser medida y aplicada.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →