← 最新论文
📊 statistics

Continuous-Time Reinforcement Learning for Controlled Hawkes Jump-Diffusions

本文提出了一种无模型连续时间强化学习算法 Hawkes-CT DDPG,该算法通过首先利用有限维马尔可夫化表示对由多元霍克斯跳跃-扩散过程驱动的非马尔可夫随机控制问题进行近似,进而应用确定性策略梯度学习来解决此类问题。

原作者: Tomasz R. Bielecki, Thibaut Mastrolia, Haoze Yan

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Tomasz R. Bielecki, Thibaut Mastrolia, Haoze Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在数字世界中,威胁很少以孤立、独立的事件形式出现。相反,它们往往呈现出集群现象,即一次入侵或攻击使得第二次攻击更有可能随之而来,从而形成一种连锁破坏。这种行为被称为“自激”(self-excitation),它是从地震到金融市场崩盘等各种现象中的一种基本模式,并且在理解网络风险方面正变得日益重要。为了管理此类风险,防御者需要根据威胁环境的变化,对有限的安全资源分配做出动态决策。然而,传统上用于优化这些决策的数学工具在处理系统记忆过于复杂时会显得力不从心。如果攻击的可能性取决于过去所有事件的历史,而不仅仅是当前时刻,那么问题就会变得过于错综复杂,导致标准方法无法高效求解。

一组研究人员开发出一种新方法来理清这种复杂性,该方法允许计算机即使在底层威胁规则未知的情况下,也能实时学习最优防御策略。他们的工作聚焦于一种被称为“霍克斯过程”(Hawkes process)的特定数学模型,该模型旨在捕捉这种集群行为。他们面临的挑战在于,这些模型是“非马尔可夫”的(non-Markovian),这意味着系统的未来取决于其整个过去,导致无法使用仅依赖当前状态的标准化、高效的学习算法。为了克服这一难题,研究人员设计了一种将系统的无限记忆压缩为有限组可观测信号的方法,有效地将一个依赖历史的问题转化为了可以用现代机器学习解决的问题。

他们解决方案的核心是一种称为“马尔可夫化”(Markovianization)的技术。想象一下,你试图预测天气,不仅是看当前的气温,还要记住过去一个世纪里落下的每一滴雨。这就是霍克斯过程所持有的记忆水平。研究人员意识到,与其试图记住每一个过去的事件,不如使用一组简单的、具有衰减特性的滤波器来近似系统的记忆。他们构建了一个新的算法状态,其中包含了当前系统状态以及一组这样的滤波器,每个滤波器都追踪过去事件是如何随时间消退的。通过这样做,他们将复杂的、依赖历史的问题转化为一个可以被计算机处理的有限维问题。

一旦问题被重塑为这种更简单的形式,团队便应用了一种连续时间强化学习算法,并将其命名为 Hawkes CT-DDPG。与在离散步骤中学习的传统方法不同,该算法在连续时间内进行学习,随着事件的发生实时调整策略。该系统以“无模型”(model-free)的方式运行,这意味着它不需要知道控制攻击或防御机制的具体数学公式。相反,它纯粹通过观察事件的发生时间、系统状态以及不同行动相关的成本来进行学习。它使用一个神经网络作为“评论家”(critic)来评估决策的好坏,并使用另一个网络作为“执行者”(actor)来决定下一步采取什么行动,不断优化其策略以最小化安全事件的总成本。

为了测试该方法,研究人员模拟了三种不同类型的威胁环境,每种环境在过去事件如何影响未来方面都有不同的模式。第一种场景使用了简单的指数模式,其中过去事件的影响衰减得很快且具有可预测性。第二种使用了埃尔朗(Erlang)模式,代表了一个更复杂的、多阶段的衰减过程。第三种也是最困难的场景使用了幂律(power-law)模式,其中过去事件的影响衰减得非常缓慢,产生了一个极其难以建模的长尾记忆。在每种情况下,他们都将这种连续时间学习方法与标准的离散时间学习技术以及一个理论上的“先知”(oracle,即预先知道所有底层规则的完美方案)进行了对比。

结果表明,这种新方法非常有效。在简单的指数情况下,算法的表现几乎接近完美的先知,与静态防御策略相比显著降低了成本。当研究人员转向更复杂的埃尔朗和幂律场景时,他们方法的优势变得更加明显。使用记忆滤波器来近似系统历史的算法,其表现始终优于那些忽略记忆结构的标准学习方法。在幂律场景中(该场景没有精确的简单表示形式),使用滤波器版本的算法比未使用滤波器版本的算法平均降低了近百分之五的成本。这证明了通过这些滤波器捕捉系统历史对于做出正确决策至关重要。

此外,研究证明,即使在威胁的具体细节未知的情况下,这种方法依然有效。该算法成功学习了如何最小化成本,而无需被告知控制攻击传播的精确数学形状或具体系数。通过仅观察事件的到达时间和产生的系统状态,它能够构建出一个足以找到近优防御策略的内部模型。研究人员通过将结果与存在的解析解以及高保真数值基准进行对比验证了其发现,确认了该方法在所有测试的学习技术中始终能产生最佳结果。

这项工作代表了管理复杂自激系统迈出的重要一步。它表明,即使一个问题因为依赖过多的历史而显得过于错综复杂,通过使用有限的工具来近似该历史,也是可以找到实际解决方案的。对于面临持续演变的网络攻击威胁的组织而言,这意味着现在已经有一条可行的路径,可以利用人工智能动态分配安全资源,通过从每一次事件中学习,从而更好地防范下一波威胁,且无需完全理解危险背后的复杂数学逻辑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →