← 最新论文
💰 quantitative finance

Tackling Decision Processes with Non-Cumulative Objectives using Reinforcement Learning

本文介绍了一种将非累积马尔可夫决策过程(NCMDPs)转换为标准马尔可夫决策过程(MDPs)的通用映射,该映射能够直接应用现有的强化学习技术来优化任意奖励函数,并证明了在多种任务中均具有提升的性能和训练效率。

原作者: Maximilian Nägele, Jan Olle, Thomas Fösel, Remmy Zen, Florian Marquardt

发布于 2026-10-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Maximilian Nägele, Jan Olle, Thomas Fösel, Remmy Zen, Florian Marquardt

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,有一个强大的框架被用于教机器如何做出决策。想象一个正在学习走路的机器人、一个正在精通电子游戏的计算机程序,或者一个管理股票投资组合的交易算法。这些系统通过对周围环境做出反应,一个接一个地采取一系列行动来运行。随着每一次移动,系统都会收到一个信号,通常被称为“奖励”,告诉它该动作是好是坏。几十年来,这些场景中成功的标准一直很简单:最大化一段时间内收集到的所有奖励的总和。如果机器人每向前走一步就能得到一个小点数,那么目标就是在旅程结束时尽可能多地获得点数。这种被称为马尔可夫决策过程(Markov decision process)的方法取得了巨大的成功,指导着从工业机器人到自动驾驶汽车的方方面面。

然而,现实生活往往比简单的计分表要复杂得多。有时,最重要的结果并不是发生的各种好事之总和,而是过程中发生的那个最坏时刻,或者是性能随时间变化的稳定性。考虑一艘航天器着陆行星的情况。目标不仅仅是安全着陆;而是要确保在整个下降过程中,飞行器绝不会超过一个危险的速度,无论其余部分的飞行有多平稳。在金融领域,投资者可能不太在意一年内赚取的总利润,而更在意利润的波动程度,寻求稳定的回报而非冒险的赌博。这些场景涉及研究人员所说的“非累积目标”,即最终得分取决于整个奖励历史的一个特定函数,例如达到过的最大值或平均收益与波动率的比率。直到现在,教人工智能去优化这些复杂的、依赖于历史的目标仍然很困难,通常需要专门构建难以应用于新问题的自定义算法。

来自马克斯·普朗克光科学研究所和埃尔朗根-纽伦堡大学的研究小组开发了一种解决这一问题的通用方案。他们发现了一种方法,可以将这些复杂的、非累积性的挑战转化为现有强大人工智能工具已经能够解决的标准格式。他们并没有从头开始发明一种新型的学习算法,而是创建了一个桥梁。他们展示了通过稍微改变机器感知当前情况的方式以及计算即时反馈的方式,任何复杂的目标都可以转换为标准的“奖励总和”问题。这使得研究人员可以利用现有的、最先进的“开箱即用”型学习软件,直接应用于此前无法触及的问题,而无需修改软件本身。

该方法的核心在于赋予人工智能代理(agent)更多的记忆。在标准设置中,代理只需要知道其当前状态即可做出决策。但当目标取决于整个奖励历史时——例如记住迄今为止遇到的最高速度——代理就需要携带这些信息。研究人员提出了一种系统,将代理的“状态”扩展到包含一个过去的运行摘要,例如截止到目前为止看到的最高或最低奖励。与此同时,他们调整了代理在每一步收到的即时奖励。代理收到的不再是仅仅反映当前动作的奖励,而是一个经过计算的值,当这些值在整个旅程中相加时,能完美地重构出那个复杂的目标。例如,如果目标是最小化最大速度,代理获得的奖励方式会在其创造新速度记录时进行惩罚,从而有效地将“最大值的最小值”问题转化为一个标准的“求和”问题。

这种方法在各种困难任务中都得到了测试,证明了其通用性。在一次月球着陆器模拟中,研究人员训练了一个代理,使其在严格限制最大速度的同时完成航天器着陆。他们将这种方法与另一种试图通过在飞行结束时添加惩罚来近似目标的标准方法进行了比较。这种新方法将速度限制视为一个连续的、贯穿始终的过程,找到了安全着陆与高效移动之间的更佳平衡。在金融领域,他们将该技术应用于投资组合优化,其中目标是最大化夏普比率(Sharpe ratio)——这是一个衡量风险调整后收益的指标,即平均利润除以这些利润的波动率。以往的方法必须依赖于对该比率的粗略近似。通过使用这种新的映射方式,代理能够直接学习最大化精确的比率,从而在训练期间实现了显著更好的投资策略。

研究人员还探索了离散优化问题,例如寻找量子逻辑门的最有效排列方式,或简化量子计算中使用的复杂图表。在这些任务中,目标通常是在漫长的搜索过程中找到达到的单个最佳状态,而不是整个过程中所有改进的总和。在这里,新方法让代理能够更勇敢地探索。因为代理不会因为为了达到更好的解而必须经历的暂时性挫折而受到惩罚,所以它学得更快,并找到了更高质量的解。在一次涉及量子纠错的实验中,新方法显著提高了性能,以更短的时间找到了更好的解决方案。

这项工作的优势在于其简单性和通用性。研究人员并没有创造一种新的学习算法,而是创造了一个翻译层。这意味着,从机器人技术到金融领域的任何专家,都可以采用他们的现有问题,应用这种映射,并立即使用现有的最强大的强化学习工具。该方法既适用于可预测的环境,也适用于充满随机噪声的环境,并且能够处理简单和复杂的目标。虽然研究人员指出,代理所需的扩展记忆会使问题规模略微变大,但现代深度学习技术完全有能力应对这一点。其结果是一个统一的框架,消除了复杂现实世界目标与先进人工智能工具之间的障碍,为机器学习那些此前难以定义的策略打开了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →