← Últimos artículos
🤖 AI

A GHOST in Long-Horizon Agents: Governance Hazard from Overlooked Safety Constraints across Turns

Este artículo identifica y analiza el modo de falla "GHOST", donde los agentes de largo horizonte pasan por alto las restricciones de seguridad especificadas en turnos anteriores bajo condiciones benignas, y propone el marco de dos capas STAR-Guard para eliminar teórica y empíricamente estos peligros.

Autores originales: XinPeng Shen, Lan Zhang, Yixiao Huang, Haoran Cheng, Jiewei Lai, Leilei Chen, Haoxiang Deng

Publicado 2026-10-05
📖 1 min de lectura☕ Lectura para el café

Autores originales: XinPeng Shen, Lan Zhang, Yixiao Huang, Haoran Cheng, Jiewei Lai, Leilei Chen, Haoxiang Deng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: Un Fantasma en Agentes de Largo Alcance (GHOST)

Definición del Problema: Riesgo de Gobernanza por Restricciones de Seguridad Pasadas por Alto

Este artículo identifica un modo de fallo específico en agentes de modelos de lenguaje de gran tamaño (LLM) que utilizan herramientas y tienen un horizonte de ejecución largo, denominado Riesgo de Gobernanza por Restricciones de Seguridad Pasadas por Alto (GHOST, por sus siglas en inglés).

Mientras que la investigación de seguridad existente se centra en ataques adversarios (por ejemplo, inyección de prompts) o solicitudes dañinas inmediatas, el GHOST surge bajo condiciones de interacción benignas. Ocurre cuando un agente completa con éxito una tarea pero viola una restricción de seguridad que fue establecida explícitamente en un turno anterior de la conversación. El agente "olvida" o no logra recuperar la restricción porque esta se encuentra separada de la tarea actual por un historial de interacción largo, lo que conduce a daños irreversibles (por ejemplo, eliminar correos electrónicos sin aprobación, destruir registros de bases de datos).

Los autores distinguen esto de los fallos generales de seguimiento de instrucciones. En un evento GHOST:

  1. El objetivo de la tarea se completa con éxito.
  2. La restricción de seguridad sigue siendo válida y necesaria.
  3. La restricción está disponible en el contexto histórico, pero no se vuelve a enunciar en el prompt de reanudación inmediata.
  4. El agente ejecuta la tarea de forma insegura a pesar de que la restricción está presente en la ventana de contexto completa.

Marco Teórico: Alcanzabilidad de la Región de Peligro

El artículo proporciona un análisis teórico que modela las restricciones de seguridad como regiones de peligro (BsB_s) en el espacio de acción. Los autores definen un peligro de entrada condicional residual, hkh_k, que representa la probabilidad de que un agente entre en una región de peligro en una oportunidad de seguridad crítica kk, dado un prefijo de historial seguro.

Perspectiva Teórica Clave:
Utilizando un marco de peligro condicional, los autores demuestran que si los peligros condicionales residuales a lo largo de prefijos seguros están limitados por debajo por una secuencia no sumable (es decir, ∑ϵk=∞\sum \epsilon_k = \infty), el agente entrará en la región de peligro casi con seguridad (Pr(σB<∞)=1Pr(\sigma_B < \infty) = 1).

Además, establecen un Corolario Condicionado al Contexto: A medida que el historial de interacción crece (aumentando la longitud del contexto LkL_k), el efecto de "dilución de la atención" puede debilitar la gobernanza de las restricciones históricas, aumentando efectivamente el límite inferior del peligro residual. Si este límite inferior del peligro permanece no sumable a lo largo de oportunidades indefinidas, la probabilidad de un evento GHOST se acerca a 1. Esto sugiere que los historiales más largos no solo reducen el rendimiento de forma lineal, sino que pueden alterar fundamentalmente la dinámica de seguridad, haciendo que las violaciones sean inevitables sin intervención.

Metodología: SCARBench y STAR-Guard

1. SCARBench: Benchmark de Disponibilidad de Restricciones de Seguridad mediante Reactivación

Para validar empíricamente el GHOST, los autores introducen SCARBench, un benchmark ejecutable y fundamentado en el entorno.

  • Estructura: Comprende 103 escenarios base únicos a través de seis dominios de uso de herramientas (dispositivo/calendario, finanzas, correo electrónico, sistema de archivos, solicitudes de red, ejecución de scripts), sumando un total de 412 instancias emparejadas.
  • Condiciones: Cada escenario se prueba bajo cuatro condiciones que varían según la longitud del historial (Corto vs. Largo) y la disponibilidad de la restricción (Explícita vs. Implícita):
    • SE/SI: Historial corto con restricciones Explícitas/Implícitas.
    • LE/LI: Historial largo (más de 6,000 tokens, 56–160 turnos) con restricciones Explícitas/Implícitas.
  • Métrica: El benchmark mide el GHOST Estricto, definido como una instancia donde el agente completa la tarea de forma segura bajo la condición Explícita (LE), pero la completa de forma insegura bajo la condición Implícita (LI), a pesar de que la restricción está presente en el historial.

2. STAR-Guard: Una Defensa de Dos Capas

Para mitigar el GHOST, los autores proponen STAR-Guard (Protección de Rastreo, Activación y Auditoría en Tiempo de Ejecución de Restricciones de Seguridad), un mecanismo de defensa que no depende del conocimiento de las restricciones mediante un oráculo.

  • Capa 1: Restauración Semántica de Restricciones

    • Extracción: Un módulo de ingestión en línea analiza los mensajes entrantes del usuario para detectar restricciones de seguridad persistibles, extrayendo su alcance, disparador y regla.
    • Almacenamiento: Estas se almacenan como "objetos de regla de ciclo de vida" estructurados en una biblioteca externa.
    • Restauración: Cuando se reanuda una tarea, una puerta semántica coteja la tarea actual con la biblioteca. Las restricciones aplicables son restauradas semánticamente (renderizadas) en el prompt del contexto actual para guiar la generación de propuestas del agente.
    • Limitación: Esta capa es probabilística; reduce la probabilidad de propuestas inseguras, pero no puede garantizar la seguridad.
  • Capa 2: Auditoría Determinista de Pre-Ejecución

    • Interposición: Antes de que cualquier acción llegue al entorno, un auditor de reglas determinista comprueba la acción propuesta por el agente contra las restricciones activas.
    • Ejecución: El auditor aplica una política de "prohibición primero". Si una propuesta viola una regla de prohibición, se bloquea inmediatamente. Si viola una regla de prerrequisito (por ejemplo, "respaldar antes de eliminar"), el sistema intenta ejecutar el prerrequisito (reparación) y vuelve a auditar. Si la reparación es imposible, la acción se bloquea.
    • Garantía: Esta capa asegura que ninguna acción que viole una restricción activa llegue al entorno, interrumpiendo el mecanismo de acumulación de peligro.

Resultados Experimentales

Los autores evaluaron STAR-Guard en siete modelos (cinco servidos por API, dos desplegados localmente) utilizando SCARBench.

  1. Prevalencia de GHOST:

    • El GHOST es un problema generalizado. En GPT-5.5, la tasa de GHOST estricto fue del 11.5% bajo condiciones benignas de contexto largo.
    • Otros modelos mostraron tasas que oscilan entre el 6.8% (Kimi-K2.6) y el 27.8% (Qwen3.5-4B).
    • La métrica de "Diferencia en Diferencias" confirmó que los historiales largos amplifican significativamente la tasa de fallo de recuperación de restricciones en comparación con los historiales cortos.
  2. Efectividad de STAR-Guard:

    • GPT-5.5: STAR-Guard redujo la tasa de Completitud Insegura (UC) del 12.4% al 0.0% y la tasa de GHOST estricto del 11.5% al 0.0%, mientras que aumentó la Completitud Segura (SC) del 76.3% al 94.0%.
    • Qwen3.5-4B: La SC aumentó del 47.0% al 81.2%, mientras que el GHOST cayó del 27.8% al 1.9%.
    • Estudios de Ablación: Los resultados demuestran que ni la "Restauración Únicamente" ni la "Auditoría Únicamente" son suficientes por sí solas. La Restauración mejora la seguridad pero deja riesgos residuales; la Auditoría bloquea riesgos pero puede dificultar la finalización de tareas si se usa sin guía semántica. La combinación logra el mejor equilibrio.
  3. Comparación con Baselines:

    • Los métodos de recuperación estándar (BM25), la sumarización y los refinamientos de seguimiento de instrucciones (por ejemplo, DeCRIM, Prompt Reminder) no lograron reducir significativamente las tasas de GHOST, manteniendo a menudo altas tasas de completitud insegura.
    • Los métodos basados en oráculos (que asumen que la restricción ya es conocida) funcionaron bien, pero no son prácticos para el despliegue en el mundo real donde las restricciones deben capturarse en línea. STAR-Guard logró una seguridad comparable sin acceso a un oráculo.

Significado y Reivindicaciones

El artículo afirma que el GHOST representa una brecha de seguridad crítica y poco explorada en agentes de largo alcance que no puede resolverse simplemente aumentando el tamaño de la ventana de contexto o confiando en las capacidades estándar de seguimiento de instrucciones.

  • Contribución Teórica: Formaliza el riesgo de la degradación de la gobernanza de seguridad a lo largo del tiempo, demostiendo que, sin intervención, la probabilidad de violaciones de seguridad se acerca a la certeza bajo condiciones de peligro no sumables.
  • Contribución Práctica: Introduce SCARBench como un estándar riguroso para evaluar la recuperación de restricciones de seguridad históricas y propone STAR-Guard como un mecanismo de defensa viable que no requiere un oráculo.
  • Hallazgo Central: Los autores concluyen que mantener la seguridad en agentes de largo alcance requiere un enfoque dual: la restauración semántica para guiar la intención del agente y la auditoría determinista para hacer cumplir las restricciones estrictas, ya que los modelos probabilísticos por sí solos no pueden gobernar la seguridad de forma fiable a través de historiales de interacción extendidos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →