Risk-Sensitive Reinforcement Learning with Smoothed Quantile Objectives
本文介绍了 UCB-BQRL,这是一种基于模型的强化学习算法,它利用平滑的下缓冲分位数目标函数和精确的动态规划程序(EVI-BQ),以实现具有可证明遗憾界限和分位数评估计算难度结果的稳定、风险敏感型学习。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,存在一种被称为强化学习的强大方法,在这种方法中,计算机程序通过尝试并观察结果来学习如何做出决策。想象一个学生学习骑自行车:他们摔倒、调整平衡,最终获得成功。在数字领域,这些程序与环境进行交互,因良好的选择而获得奖励,并学习随着时间的推移实现总奖励的最大化。几十年来,这些程序的标准目标一直很简单:获得尽可能高的平均分。这种方法在许多任务中都表现出色,从玩电子游戏到管理库存。然而,在金融或医疗等高风险领域,仅靠平均值是不够的。医生需要的不仅仅是一个平均表现良好的治疗方案;他们需要一个能够避免灾难性失败的方案,即使这意味着平均成功率略低。同样,投资者可能会更倾向于一种能保证最低安全回报的策略,而不是一种可能带来巨额潜在收益但带有彻底损失风险的策略。为了处理这些情况,研究人员转向了一个被称为“分位数”(quantile)的概念。分位数不看平均值,而是观察结果分布中的特定点,例如底部的 10% 或顶部的 90%,这使得决策者能够根据需要专注于安全性或进取性。
然而,挑战在于优化分布中的这些特定点是非常困难的。与在微调环境时会平滑变化的平均值不同,这些特定点可能会发生剧烈的跳跃。如果一个计算机程序通过数据学习世界的规则,而这些数据存在微小的误差,那么程序对什么是“安全”结果的理解可能会突然转变为完全不同的东西。这种不稳定性使得构建可靠的风险敏感型学习系统变得困难。在一项新的研究中,弗吉尼亚理工大学的研究人员开发了一种解决方案。他们创建了一种新的学习算法,可以平滑掉这些突发的跳跃,使计算机即使在数据不完美的情况下也能安全且有效地学习。
研究人员 Mohammad Alipour-Vaezi、Huaiyang Zhong 和 Sajad Khodadadian 引入了一种他们称之为 UCB-BQRL 的方法。其核心思想是用一个“缓冲”版本来取代特定结果的尖锐、锯齿状目标。该算法的目标不是瞄准分布中一个精确的点,而是瞄准该点下方的一个微小范围。它对这个小范围内的结果进行平均,从而创造出一个平滑、稳定的目标,这使得学习过程变得容易得多。这就像是尝试在铅笔尖上保持平衡,与在小而平坦的平台上保持平衡相比——平台对微小的晃动不那么敏感。通过在学习过程中使用这种平滑后的目标,该算法可以探索环境并建立关于事物运作方式的模型,而不至于被数据的微小误差所干扰。一旦学习完成,算法仍可以针对原始的、尖锐的目标来评估最终结果,确保结果完全符合用户的预期。
为了测试他们的方法,团队将其应用于一个经典的决策问题,即资产出售。在这种场景下,卖家在固定时间内收到一系列物品报价。在每一步,卖家必须决定是接受当前报价并停止,还是拒绝并等待下一个随机报价。挑战在于找到正确的停止时机,以实现最终价格的最大化。在现实世界中,卖家并不了解未来报价的确切概率;他们必须通过经验来学习这些概率。研究人员进行了模拟实验,在这些实验中,他们的新算法必须在学习这些概率的同时,尝试最大化最终价格的特定分位数。他们将自己的方法与几种成熟的学习技术进行了比较,包括那些旨在最大化平均价格以及其他使用不同策略来探索未知领域的算法。
结果显示,该新算法在特定任务中表现优异。当目标是最大化中位数结果(即中间地带)时,新方法学到的策略明显优于其他方法。当目标转向最大化前 10% 的结果时,它再次胜过竞争对手。有趣的是,即使该算法被训练得非常保守,旨在追求底部的 10% 的结果,在以标准平均分为评判标准时,它的表现也并不糟糕。它依然保持着竞争力,这表明专注于风险并不一定意味着牺牲整体性能。研究还包括了一个严密的数学证明,证明该算法的学习速度在考虑到问题的难度下,已经达到了理论上的最快水平。他们证明了学习速度取决于问题的特定属性:即结果分布在目标点附近的变化程度。如果分布在这一点附近非常平坦或不稳定,学习本质上就会变慢,而他们的方法正确地考虑到了这种难度。
除了实际应用的成功之外,研究人员还发现了一个关于这些问题数学性质的惊人事实。他们证明了,即使是在只有两个可能状态和一个动作的极简单场景下,计算特定结果点的精确值在计算上也是极其困难的。这意味着,虽然他们的算法提供了一种有效学习的方法,但对于复杂的现实世界问题,要快速计算出最优策略的精确解很可能是无法实现的。这一发现区分了统计学习能力与完美的规划计算能力。研究人员的工作并不声称解决了所有的风险敏感型问题,但它为在高风险和噪声数据环境下进行学习提供了一个稳健、稳定的框架。通过平滑前进的路径,他们使得人工智能能够以一种此前难以企及的可靠程度,在安全与回报之间进行微妙的平衡。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。