Resumen Técnico: Trident – Cómo romper el Aprendizaje por Refuerzo Profundo
Planteamiento del Problema
Los sistemas de defensa cibernética autónomos basados en Aprendizaje por Refuerzo Profundo (DRL) se despliegan cada vez más para monitorear redes y recuperar hosts comprometidos en tiempo real. Sin embargo, su robustez contra amenazas adaptativas sigue estando críticamente subestudiada. Las evaluaciones actuales dependen casi exclusivamente de "agentes rojos" estáticos y heurísticos con firmas de comportamiento fijas. En consecuencia, los defensores de DRL desarrollan políticas condicionadas implícitamente a estos patrones estáticos, creando puntos ciegos sistemáticos que los métodos de evaluación tradicionales no logran descubrir.
Simultáneamente, mientras que el Aprendizaje por Refuerzo con Recompensas Verificables (RLVR) ha avanzado en el razonamiento de los Modelos de Lenguaje Extensos (LLM) en dominios como las matemáticas y la ingeniería de software, su integración en la ciberseguridad se ha visto obstaculizada por la falta de entornos de referencia adecuados. Los conjuntos de datos de ciberseguridad existentes suelen ofrecer corpora estáticos o desafíos aislados de Capture The Flag (CTF), careciendo de las interacciones continuas y de múltiples pasos requeridas para entrenar agentes contra defensores activos y adaptativos. Existe una brecha crítica en la infraestructura capaz de proporcionar entornos adversarios estables y repetibles con señales de recompensa verificables para el entrenamiento de agentes rojos basados en LLM mediante RLVR.
Metodología
Para abordar estas brechas, los autores introducen Trident, un marco de trabajo de red teaming dinámico que comprende una infraestructura de referencia, un conjunto de datos y una arquitectura agéntica.
1. Benchmark y Conjunto de Datos de Trident
Trident opera a través de dos simuladores de alta fidelidad: CybORG CAGE 4 (que modela una red militar segmentada con defensores multi-agente cooperativos) y CyberWheel (que fundamenta los ataques en técnicas reales de MITRE ATT&CK).
- Infraestructura: El marco utiliza servidores sandbox aislados y contenedorizados con una arquitectura cliente-servidor. Las políticas de ataque generadas se transmiten a estos sandboxes, se ejecutan de forma nativa contra defensores DRL vivos y devuelven registros de ejecución deterministas y verificables.
- Conjunto de Datos: Los autores construyeron un conjunto de datos de más de 13,000 trayectorias de interacción red-azul de alta fidelidad. Estas trayectorias se serializan en registros de lenguaje natural estructurados, capturando observaciones parciales, inteligencia diferencial de host y resultados de acciones, sirviendo como base para el post-entrenamiento de RLVR.
2. Arquitectura Agéntica de Trident
Trident Agentic reformula el problema de entrenamiento del agente rojo de un Proceso de Decisión de Markov Parcialmente Observable Descentralizado (Dec-POMDP) a un problema de Bandido Contextual utilizando un paradigma de "Código como Políticas". La arquitectura consta de tres módulos especializados:
- Resumidor de Logs (Log Summarizer): Un módulo híbrido que utiliza el análisis basado en reglas y un LLM congelado para comprimir los logs de ejecución crudos. Preserva eventos críticos de "hito" (p. ej., exploits exitosos, escaladas de privilegios) mientras muestrea intentos fallidos, sintetizando un resumen semántico denso para el planificador.
- Planificador (πθ): El único componente entrenable (un LLM de 7 mil millones de parámetros). Recibe el resumen comprimido como contexto y genera una estrategia de ataque de alto nivel en una sola pasada hacia adelante, emitiendo un payload JSON estructurado. Se optimiza mediante Optimización de Política Relativa de Grupo (GRPO) utilizando recompensas verificables derivadas de la ejecución en el sandbox.
- Codificador (Coder): Un LLM congelado que traduce la estrategia JSON del Planificador en código Python ejecutable. Emplea un mecanismo de parcheo basado en Árboles de Sintaxis Abstracta (AST) y un bucle de autorreparación iterativo (hasta K=3 intentos) para corregir errores de sintaxis antes del despliegue, asegurando que el Planificador no sea penalizado por ruido de implementación incidental.
3. Diseño de Recompensa
El sistema utiliza una función de recompensa densa y verificable derivada directamente de los logs de ejecución:
- Hitos Positivos (R+): Recompensas ponderadas por el progreso en la cadena de ataque (p. ej., impacto en el sistema, escalada de privilegios) aumentadas por un coeficiente de eficiencia basado en la relación logro-paso.
- Eventos Negativos (R−): Penalizaciones por exploits fallidos, acciones inválidas y ruido operativo.
- Penalizaciones de Ejecución: Se aplican penalizaciones estrictas por errores de sintaxis, fallos de tiempo de ejecución o intentos de acceder a internos del simulador no observables (p. ej., banderas señuelo), asegurando que el agente dependa de la inferencia de comportamiento en lugar del acceso a estados privilegiados.
Contribuciones Clave
- Benchmark y Conjunto de Datos de Evaluación de Trident: El primer benchmark de red teaming trans-entorno que abarca CAGE 4 y CyberWheel, que proporciona ejecución en sandbox aislado para recompensas verificables contra defensores DRL en vivo. Incluye un conjunto de datos de más de 13,000 trayectorias diseñadas específicamente para soportar el entrenamiento RLVR.
- Trident Agentic: Una arquitectura agéntica de LLM tripartita que aprovecha el "Código como Políticas" para permitir la generación directa de estrategias de ataque ejecutables. Al tratar la generación de la estrategia como un bandido contextual, evita la intratabilidad computacional de la planificación paso a paso de un POMDP.
- Evidencia Empírica de la Fragilidad de DRL: El marco demuestra que los defensores autónomos actuales son significativamente más frágiles contra atacantes adaptativos de lo que indicaban las evaluaciones estáticas previas.
Resultados Experimentales
Los autores evaluaron Trident Agentic contra agentes azules DRL de última generación (incluyendo variantes de GNN, HMARL y MARL) tanto en CAGE 4 como en CyberWheel.
- Reducción de Rendimiento: Trident Agentic redujo el rendimiento defensivo de los agentes azules en un promedio del 522% en comparación con las líneas base heurísticas por defecto.
- Comparación con Líneas Base:
- Heurísticas Estáticas: Los agentes rojos tradicionales no lograron descubrir las debilidades en las políticas aprendidas.
- Zero-Shot/CoT: Aunque los enfoques de zero-shot prompting y Cadena de Pensamiento (CoT) mostraron cierta mejora sobre las líneas base estáticas, fueron superados sustancialmente por el modelo entrenado mediante RLVR, Trident Agentic.
- Modelos de Frontera: Un modelo de 7 mil millones de parámetros entrenado mediante RLVR (Trident Agentic) superó el rendimiento de los modelos de escala de frontera (p. ej., GPT-4o) utilizados en capacidad zero-shot, resaltando la eficacia del entrenamiento RLVR específico de la tarea sobre la escala bruta del modelo.
- Comportamientos Emergentes: Los agentes entrenados descubrieron autónomamente nuevos vectores de ataque que las heurísticas estáticas no podían representar, incluyendo:
- Evitación de Señuelos (Decoy Avoidance): En CyberWheel, el agente aprendió a abortar ataques en hosts que exhibían fallos repetidos, identificando y evitando eficazmente los honeypots.
- Priorización de Estado Adaptativa: En CAGE 4, el agente aprendió a priorizar objetivos de alto valor (p. ej., acceso de Root/User) sobre el reconocimiento básico, cambiando dinámicamente el enfoque basado en el estado de la red.
Significancia y Reivindicaciones
El artículo afirma que Trident expone una brecha de evaluación fundamental en la defensa cibernética autónoma: las prácticas actuales subestiman críticamente la vulnerabilidad de los defensores DRL ante atacantes generativos y adaptativos. Al demostrar que un LLM compacto de pesos abiertos de 7B puede desmantelar sistemáticamente las defensas de última generación, los autores argumentan que el campo debe ir más allá de la evaluación de adversarios estáticos.
Trident se presenta no solo como una herramienta ofensiva, sino como la infraestructura necesaria para la "co-evolución" de la ofensiva y la defensa cibernética. Su diseño de sandbox RESTful y agnóstico al simulador permite la integración de entornos de mayor fidelidad, permitiendo el entrenamiento de agentes azules que sean robustos contra amenazas generativas y adaptativas. Los autores enfatizan que la transparencia respecto a estas capacidades es esencial para impulsar el desarrollo de sistemas defensivos igualmente adaptativos y basados en RL, antes de que tales estrategias de ataque sean desplegadas independientemente por adversarios.