Resumen Técnico: SkillJack – Puertas Traseras de Habilidades Persistentes en Agentes de Autoevolución
Declaración del Problema
Los agentes de Modelos de Lenguaje de Gran Escala (LLM) de autoevolución están siendo diseñados cada vez más para convertir historiales de interacción en "habilidades" reutilizables que persisten más allá de tareas individuales. Mientras que la investigación previa ha establecido riesgos relacionados con el envenenamiento de la memoria y la inyección de prompts indirectos —donde los ataques tienen éxito solo cuando los registros envenenados se recuperan como contexto—, este artículo identifica un riesgo más fundamental y duradero. Los autores argumentan que cuando la propia canalización de experiencia-a-habilidad de un agente procesa un registro de experiencia envenenado, puede transformar ese input transitorio en un artefacto de comportamiento duradero. A diferencia del envenenamiento de memoria tradicional, donde eliminar el registro de origen elimina la amenaza, este nuevo vector de ataque permite que los comportamientos maliciosos sobrevivan a la eliminación de su origen, integrándose en el repertorio de habilidades reutilizables del agente.
Metodología
El artículo introduce SkillJack, un marco de ataque que explota la canalización de transformación de experiencia-a-habilidad. La metodología se estructura en torno a una formulación formal del problema y una estrategia específica de diseño de carga útil (payload).
1. Formulación Formal del Problema
Los autores modelan la canalización de experiencia-a-habilidad como un proceso de cuatro etapas: Carga (πL), Transformación (πT), Persistencia (πP) y Enrutamiento (πR). El objetivo del atacante es inyectar un elemento de experiencia envenenado ep de tal manera que la habilidad resultante sp satisfaga tres condiciones:
- Sigilo (Stealth): La habilidad evade la detección por parte de un detector de seguridad D (D(sp)=benigno).
- Enrutabilidad (Routability): El enrutador selecciona la habilidad para una tarea objetivo (sp∈πR(q,S)).
- Ejecución Maliciosa (Malicious Execution): La habilidad activa un comportamiento no deseado tras su ejecución (exec(sp,q)∈B).
El estudio caracteriza tres propiedades de seguridad emergentes de esta composición:
- Blanqueamiento por Sanitización (Sanitization Whitewashing): El proceso de transformación (compresión, abstracción, normalización) oscurece la intención maliciosa, reduciendo las tasas de detección en comparación con el input original.
- Promoción entre Capas (Cross-Layer Promotion): Las experiencias transitorias se convierten en artefactos persistentes y reutilizables que pueden seleccionarse para tareas futuras sin necesidad de volver a leer el registro original.
- Aislamiento de Persistencia (Persistence Isolation): Debido a que la biblioteca de habilidades está desacoplada del corpus de experiencias, la eliminación del registro de origen no elimina necesariamente la habilidad derivada.
2. Diseño de Carga Útil Resiliente a la Transformación
Para materializar este ataque, los autores diseñan cargas útiles resilientes a la transformación. Plantean la hipótesis de que las canalizaciones de extracción están optimizadas para destilar instrucciones útiles de las trazas de tareas y son más propensas a preservar secuencias de acciones enmarcadas dentro de una narrativa plausible y legítima que aquellas descritas mediante un lenguaje abiertamente adversarial.
- Estrategia de Enmarcado (Framing Strategy): En lugar de un lenguaje malicioso directo, los autores construyen trayectorias donde la acción relevante para la política (por ejemplo, exfiltración de datos, escalada de privilegios) se inserta dentro de un marco funcional legítimo (por ejemplo, "respaldo", "archivo" o "recuperación de errores").
- Métricas de Evaluación: El estudio mide el rendimiento de la extracción, la detectabilidad (mediante coincidencia de patrones y jueces LLM) y el éxito del enrutamiento en tareas posteriores.
3. Configuración Experimental
El ataque fue evaluado en dos sistemas representativos:
- SkillX: Utiliza destilación de trayectoria basada en planes y enrutamiento de divulgación progresiva nativo de LLM.
- Anything2Skill (A2S): Compila documentos heterogéneos en contratos de habilidad estructurados.
- Dataset: Un conjunto compartido de 150 trayectorias (65 enmarcadas funcionalmente envenenadas, 65 baselines directamente maliciosas, 20 limpias) a través de cuatro categorías de riesgo de política (exfiltración de datos, escalada de privilegios, transferencia no autorizada, backdoor persistente).
- Modelo: Se utilizó DeepSeek-v4-flash para la extracción, el enrutamiento y el juicio.
Resultados Clave
1. Blanqueamiento por Sanitización (Reducción de Detectabilidad)
El proceso de extracción reduce significativamente la detectabilidad del contenido malicioso.
- SkillX: La detección por juez LLM cayó del 98.5% en las trayectorias envenenadas originales al 11.4% en las habilidades extraídas. La detección por patrones cayó del 44.6% al 11.0%.
- Anything2Skill (Modo DOC): La detección cayó del 100.0% en las trayectorias originales al 44.4% en las habilidades extraídas.
- Mecanismo: El efecto de "blanqueamiento" es impulsado por los metadatos de apariencia benigna (nombres y documentación) adjuntos a las habilidades extraídas. Cuando solo se mostró el contenido del código al juez, las tasas de detección aumentaron significativamente (por ejemplo, del 10.0% al 36.7% en SkillX), lo que indica que los metadatos superficiales impulsan la evasión.
2. Promoción entre Capas (Activación en Tareas Posteriores)
Las habilidades extraídas se enrutan y activan con éxito en tareas objetivo.
- SkillX: El 56.2% de las tareas orientadas al ataque fueron enrutadas a una habilidad que satisfizo el proxy de violación de política.
- Anything2Skill: El 89.2% de las consultas orientadas al ataque activaron el proxy de violación de política.
- Daño Colateral: Las habilidades también se activaron en tareas benignas no relacionadas (20.0% en SkillX, tasa de recuperación del 95.0% en A2S), lo que indica un radio de impacto amplio.
3. Aislamiento de Persistencia (Supervivencia tras la Eliminación de la Fuente)
El ataque persiste incluso después de que los registros envenenados originales son eliminados.
- En un experimento de tarea emparejada, el 80.0% de los ataques que se activaron vía la vía de la habilidad continuaron ejecutándose tras la eliminación de las trayectorias de origen. Esto demuestra que purgar la memoria no elimina el artefacto derivado.
4. Sensibilidad de la Defensa
Experimentos preliminares de defensa revelaron desafíos en la mitigación:
- Revisión Estática: La revisión de seguridad por LLM en el tiempo de extracción redujo las tasas de activación, pero no fue perfecta.
- Monitoreo en Tiempo de Ejecución: El monitoreo consciente del comportamiento (bloqueo de firmas de acciones específicas) fue altamente efectivo de forma aislada (0.0% de activaciones en la muestra de SkillX), pero mostró fragilidad al combinarse con la revisión estática. La acumulación de defensas llevó a fallos de "coordinación de defensa", donde el filtrado ascendente alteró la distribución de acciones, causando que los monitores descendentes perdieran nuevos patrones.
- Especificidades de A2S: Las firmas estándar fallaron en A2S debido al lenguaje normalizado; fue necesario expandir las firmas para cubrir el vocabulario normalizado para reducir las tasas de activación.
Contribuciones Clave
- Nueva Superficie de Ataque: El artículo es el primero en identificar y formalizar el envenenamiento de experiencia-a-habilidad como un riesgo de seguridad distintivo. Caracteriza las tres propiedades (blanqueamiento por sanitización, promoción entre capas, aislamiento de persistencia) que emergen específicamente de la composición del envenenamiento de experiencia con la extracción automatizada de habilidades.
- Método de Ataque Resiliente a la Transformación: Los autores demuestran que el enmarcar acciones maliciosas dentro de narrativas funcionales legítimas permite que sobrevivan a la abstracción y compresión de la canalización de extracción, mientras que el lenguaje abiertamente malicioso es filtrado.
- Validación Empírica Multisistema: El ataque fue validado en dos sistemas implementados independientemente (SkillX y Anything2Skill) utilizando un dataset compartido, estableciendo que esto es un riesgo a nivel de paradigma y no un fallo en una sola implementación.
Significado y Reivindicaciones
El artículo afirma que la evolución de habilidades representa una nueva y crítica superficie de ataque para los agentes de autoevolución. La significancia principal radica en el cambio de la inyección de contexto transitoria al artefacto de comportamiento persistente.
- Brecha en el Ciclo de Vida: Los autores argumentan que los modelos de seguridad actuales asumen que eliminar un registro de origen elimina la amenaza. SkillJack demuestra que una vez que un registro envenenado se compila en una habilidad, el ataque sobrevive a su fuente.
- Implicaciones de Defensa: Los hallazgos motivan un cambio hacia una protección del ciclo de vida de la habilidad consciente de la procedencia. Los defensores deben rastrear las habilidades derivadas hasta sus registros de origen, revocar descendientes cuando las fuentes son puestas en cuarentena e implementar verificaciones conscientes del comportamiento en cada frontera de transformación (carga, transformación, persistencia, enrutamiento).
- Modestia: Los autores declaran explícitamente que sus resultados se basan en una única configuración de modelo y proxies de nivel de enrutamiento en lugar de la ejecución de servicios externos reales. Encuadran los resultados de defensa como preliminares y exploratorios, señalando que el fallo de "coordinación de defensa" requiere más estudio. El trabajo se presenta como un informe técnico para motivar la investigación futura sobre la seguridad de la procedencia y el ciclo de vida en agentes de autoevolución.