← Últimos artículos
📊 statistics

Continuous-Time Reinforcement Learning for Controlled Hawkes Jump-Diffusions

Este artículo propone un algoritmo de aprendizaje por refuerzo de tiempo continuo libre de modelo, Hawkes-CT DDPG, que resuelve problemas de control estocástico no markovianos impulsados por procesos de salto-difusión de Hawkes multivariantes mediante la aproximación previa del sistema con una representación markoviana de dimensión finita y la posterior aplicación de aprendizaje de gradiente de política determinista.

Autores originales: Tomasz R. Bielecki, Thibaut Mastrolia, Haoze Yan

Publicado 2026-08-20
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Tomasz R. Bielecki, Thibaut Mastrolia, Haoze Yan

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo digital, las amenazas rara vez llegan como eventos aislados e independientes. En cambio, tienden a agruparse, donde una brecha o ataque hace que un segundo sea más probable que lo siga, creando una cadena de daños en cascada. Este comportamiento, conocido como autoexcitación, es un patrón fundamental en todo, desde los terremotos hasta las caídas de los mercados financieros, y es cada vez más central para comprender el riesgo cibernético. Para gestionar tales riesgos, los defensores deben tomar decisiones dinámicas sobre cómo asignar sus limitados recursos de seguridad a medida que el entorno de amenazas cambia. Sin embargo, las herramientas matemáticas tradicionalmente utilizadas para optimizar estas decisiones tienen dificultades cuando la memoria del sistema es compleja. Si la probabilidad de un ataque depende de todo el historial de eventos pasados en lugar de solo el momento actual, el problema se vuelve demasiado enredado para que los métodos estándar lo resuelvan de manera eficiente.

Un equipo de investigadores ha desarrollado un nuevo enfoque para desenredar esta complejidad, creando un método que permite a las computadoras aprender estrategias de defensa óptimas en tiempo real, incluso cuando las reglas subyacentes de la amenaza son desconocidas. Su trabajo se centra en un tipo específico de modelo matemático llamado proceso de Hawkes, que está diseñado para capturar ese comportamiento de agrupación. El desafío que enfrentaron fue que estos modelos son "no markovianos", lo que significa que el futuro del sistema depende de todo su pasado, lo que hace imposible utilizar algoritios de aprendizaje estándar y eficientes que dependen solo del estado presente. Para superar esto, los investigadores idearon una forma de comprimir la memoria infinita del sistema en un conjunto finito de señales observables, convirtiendo efectivamente un problema dependiente de la historia en uno que puede ser resuelto con el aprendizaje automático moderno.

El núcleo de su solución involucra una técnica llamada "markovianización". Imagine intentar predecir el clima no solo mirando la temperatura actual, sino recordando cada una de las gotas de lluvia que cayeron en el último siglo. Ese es el nivel de memoria que posee un proceso de Hawkes. Los investigadores se dieron cuenta de que, en lugar de intentar recordar cada evento pasado, se podría aproximar la memoria del sistema utilizando una colección de filtros simples y de decaimiento. Construyeron un nuevo estado para el algoritmo de aprendizaje que incluye el estado actual del sistema más un conjunto de estos filtros, cada uno rastreando cómo los eventos pasados se han desvanecido con el tiempo. Al hacer esto, transformaron el complejo problema dependiente de la historia en uno manejable y de dimensión finita que una computadora puede navegar.

Una vez que el problema fue remodelado a esta forma más simple, el equipo aplicó un algoritmo de aprendizaje por refuerzo en tiempo continuo, al cual llamaron Hawkes CT-DDPG. A diferencia de los métodos tradicionales que aprenden en pasos discretos, este algoritmo aprende continuamente, ajustando su estrategia a medida que ocurren los eventos en tiempo real. El sistema opera de manera libre de modelo (model-free), lo que significa que no necesita conocer las fórmulas matemáticas específicas que gobiernan los ataques o los mecanismos de defensa. En su lugar, aprende puramente observando el tiempo de llegada de los eventos, el estado del sistema y los costos asociados con diferentes acciones. Utiliza una red neuronal para actuar como un "crítico" que evalúa qué tan buena fue una decisión, y otra red como un "actor" que decide qué acción tomar a continuación, refinando constantemente su política para minimizar el costo total de los incidentes de seguridad.

Para probar su método, los investigadores simularon tres tipos diferentes de entornos de amenazas, cada uno con un patrón distinto de cómo los eventos pasados influyen en el futuro. El primer escenario utilizó un patrón exponencial simple, donde la influencia de los eventos pasados se desvanece de manera rápida y predecible. El segundo utilizó un patrón de Erlang, que representa un proceso de desvanecimiento más complejo y de múltiples etapas. El tercer escenario, y el más difícil, utilizó un patrón de ley de potencia, donde la influencia de los eventos pasados decae muy lentamente, creando una cola larga y pesada de memoria que es notoriamente difícil de modelar. En cada caso, compararon su método de aprendizaje en tiempo continuo contra técnicas de aprendizaje de tiempo discreto estándar y contra un "oráculo" teórico: una solución perfecta que conoce todas las reglas subyacentes de antemano.

Los resultados mostraron que el nuevo método fue altamente efectivo. En el caso exponencial simple, el algoritmo funcionó casi tan bien como el oráculo perfecto, reduciendo los costos significativamente en comparación con las estrategias de defensa estáticas. Cuando los investigadores pasaron a los escenarios más complejos de Erlang y de ley de potencia, la ventaja de su enfoque se hizo aún más clara. El algoritmo que utilizó los filtros de memoria para aproximar la historia del sistema superó consistentemente a los métodos de aprendizaje estándar que ignoraban la estructura de la memoria. En el escenario de la ley de potencia, que no tiene una representación simple exacta, la versión filtrada de su algoritmo redujo el costo promedio en casi un cinco por ciento en comparación con la versión que no utilizó los filtros de memoria. Esto demostró que capturar la historia del sistema a través de estos filtros era crucial para tomar buenas decisiones.

Además, el estudio demostró que este enfoque funciona incluso cuando los detalles específicos de la amenaza son desconocidos. El algoritmo aprendió con éxito a minimizar los costos sin haber sido informado de la forma matemática exacta de la memoria de la amenaza o de los coeficientes específicos que gobiernan cómo se propagan los ataques. Al observar únicamente los tiempos de llegada de los eventos y los estados resultantes del sistema, fue capaz de construir un modelo interno que era suficiente para encontrar estrategias de defensa casi óptimas. Los investigadores verificaron sus hallazgos comparando sus resultados con soluciones analíticas donde existían y con referencias numéricas de alta fidelidad donde no las había, confirmando que su método produjo consistentemente los mejores resultados entre todas las técnicas de aprendizaje probadas.

Este trabajo representa un paso significativo hacia la gestión de sistemas autoexcitantes complejos. Demuestra que, incluso cuando un problema parece demasiado enredado para resolverlo porque depende de demasiada historia, es posible encontrar una solución práctica aproximando esa historia con un conjunto finito de herramientas. Para las organizaciones que enfrentan la constante y evolutiva amenaza de los ciberataques, esto significa que ahora existe un camino viable para utilizar la inteligencia artificial para asignar dinámicamente los recursos de seguridad, aprendiendo de cada incidente para protegerse mejor contra la próxima ola de amenazas, todo ello sin necesidad de comprender plenamente las matemáticas complejas del peligro mismo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →