Policy Gradients for Cumulative Prospect Theory in Reinforcement Learning
本文为有限时界强化学习中的累积前景理论(CPT)目标推导出了策略梯度定理,并提出了一种利用蒙特卡洛阶统计量来优化非凸风险敏感策略的、具有可证明收敛性的阶一算法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人类在计算风险方面表现得极其糟糕。我们不会像数学家那样权衡概率,而是去“感受”它们。我们往往对微小的巨大损失感到恐惧,其程度远超对巨大的中等损失的恐惧;我们也经常追求极小的巨额回报,即便胜算并不在 favor 我们的一方。这并非我们的软件出现了故障,而是我们的生理构造使然。几十年来,经济学家和心理学家一直使用一个名为“累积前景理论”(Cumulative Prospect Theory)的框架来描述这些怪癖。该理论表明,我们判断结果并非基于其绝对价值,而是基于其与个人参考点的对比,并且我们会扭曲事件的可能性,高估罕见灾难的发生率,而低估常见事件的发生率。
长期以来,人工智能领域,特别是强化学习领域,一直忽略了这些人类的怪癖。在这个领域中,智能体通过与环境交互来最大化奖励,从而学习如何做出决策。标准方法假设智能体是完全理性的,会计算每条可能路径的平均预期结果,并选择数值最高的那一条。这对于机器来说效果很好,但无法捕捉人类在复杂且不确定的情况下的真实行为。当我们试图构建与人类协作或为人类做决策的 AI 时,纯粹理性的智能体表现出的行为往往会让观察者觉得冷酷、不理性,或者干脆就是错误的。研究人员一直在追问的问题是:我们能否教会机器像我们一样思考,不仅是在最终的选择上,还在于它们如何感知风险与回报。
现在,一组研究人员在回答这个问题上迈出了重要一步。他们开发了一种新的数学框架,允许人工智能智能体基于人类心理学原则而非冰冷的计算来优化其行为。在一系列模拟实验中,他们证明了通过教导智能体通过累积前景理论的视角来看待世界,机器开始展现出人类所表现出的那种微妙且有时相互矛盾的风险行为。研究人员不仅提出了一个理论,还构建了一个实用的算法,使其能够学习这些行为,并在数学上证明了其有效性,为 AI 在金融、医疗和交通管理等高风险环境中与人类偏好保持一致提供了一种途径。
其工作的核心是一种教授智能体如何学习的新方法。在传统的强化学习中,智能体试图最大化它预期的奖励总和。新方法改变了目标。它不再问:“平均奖励是多少?”而是问:“人类是如何感知这一系列奖励流的?”为此,智能体必须首先决定相对于特定的参考点,什么算作收益,什么算作损失。如果一个人的基准线是 7,那么疼痛感从 7 降到 5 可能感觉像是巨大的胜利;但如果基准线是 2,这种下降则只是微小的改善。随后,智能体会对这些收益和损失应用一种特殊的变换,使得损失带来的痛苦感比同等收益带来的快乐感更沉重。最后,它会扭曲概率,使罕见事件感觉更可能发生,而常见事件感觉更不可能发生,正如人类大脑所做的那样。
研究人员在实现这一过程时面临着重大障碍。由这些类人扭曲所创造的数学景观极其崎岖且复杂。不同于标准优化中平滑、可预测的山丘,这种新的景观充满了尖锐的峰值和深邃的谷底,使得算法很难在不被困住的情况下找到最佳路径。此外,用于教导 AI 如何改进其决策的标准工具并不适用,因为这种类人的目标函数并不遵循大多数学习算法所依赖的简单加法和线性规则。团队不得不推导出一套全新的规则,即“策略梯度定理”(policy gradient theorem),它充当了智能体的指南针。这个新定理提供了一种计算方式,即使在性能衡量标准非常复杂(具有类人特征)的情况下,也能计算出智能体应该改变行为以提高性能的方向。
为了测试这个新的“指南针”,研究人员进行了一系列实验。在一个简单的场景中,他们将智能体置于一个必须在安全的小额奖励和冒险的大额奖励之间做出选择的情境中。一个标准的、理性的智能体总是选择具有最高平均回报的选项,即便这意味着要进行一场豪赌。一个旨在规避不确定性的风险厌恶型智能体则会始终避免赌博。但使用这种新型类人框架训练的智能体表现出了更有趣的行为。当涉及潜在收益时,它表现得十分谨慎,倾向于选择稳妥的选项。然而,当情景反转为涉及潜在损失时,同一个智能体突然变得大胆,选择冒险以避免确定的损失。这种被称为“反射效应”(reflection effect)的行为转变是人类决策的一个特征,而标准的 AI 模型难以复制这一点。新算法完美地捕捉到了这种细微差别,在两种情景下都使用了相同的内部设置。
研究人员还将他们的方法与现有的风险建模方法进行了比较。他们发现,旧的方法依赖于零阶估计(本质上是通过尝试微小的变化并观察结果来猜测改进方向),随着问题变得更加复杂,这些方法会显得力不从心。当变量数量增加时,这些方法会变得效率低下且缓慢。相比之下,使用一阶信息来计算精确改进方向的新算法,其扩展性要好得多。即使在环境复杂度增加时,它仍能保持高效,这表明它可以应用于具有许多移动部件的现实世界问题,例如管理电网或进行股票交易。
这项工作的意义超越了简单的游戏。研究人员阐明了这种方法如何应用于关键领域。例如,在医疗保健领域,一位管理患者慢性疼痛的医生可能需要在即时缓解与长期依赖风险之间取得平衡。标准的 AI 可能仅仅是最小化平均疼痛评分,从而可能忽略了患者对戒断症状的恐惧。然而,一个与人类对齐的智能体可以更沉重地权衡罕见但灾难性的副作用带来的恐惧,从而制定出让患者感到更安全、更周到的治疗计划。同样,在金融领域,智能体可以被调整以反映投资者的特定风险承受能力,这不仅仅是通过调整一个数字,而是从根本上改变它对市场崩盘或意外财富的感知方式。
该研究还明确了这些智能体运作所需的条件。研究人员指出,为了使算法发挥作用,人类的偏好——即一个人对损失的恐惧程度或他们如何扭曲概率——必须预先已知。这些并不是由智能体从零开始学习的,而是作为模型的一部分被提供的,就像设定游戏规则一样。这使得系统可以根据特定个人或群体进行定制。研究人员展示了通过调整参考点或对损失的敏感度,可以显著改变智能体的行为,证明了该系统具有模拟广泛人类态度的灵活性。
尽管结果令人鼓舞,但研究人员在界定其发现时非常谨慎,将其置于模拟实验的限制范围内。他们已经证明了该算法能够收敛到稳定解,并且能够在复杂的非线性环境中找到最优策略。他们通过模拟证明了该算法在速度和扩展性方面优于旧方法。然而,他们尚未将该系统部署在人类生命或金融资产面临直接风险的真实世界环境中。这项工作目前仍是一项理论和计算上的突破,是一个概念验证,证明了机器可以被教导去应对人类风险感知中那混乱且不理性的图景。
未来的路径包括完善这些模型,并在更多样化的现实场景中进行测试。研究人员建议,未来的工作可以侧重于直接从数据中学习人类偏好,而不是将其预设程序化,并将该理论扩展到连续的、无限时界的场景中。他们也看到了将这种方法与其他人类反馈学习方法相结合的潜力,从而创建一个能够随时间推移而适应不断变化偏好的混合系统。目前,这一成就构成了两个世界之间的桥梁:一个是机器优化的冷酷逻辑,另一个是人类决策中温暖且往往充满矛盾的现实。它提供了一种途径,让 AI 不仅仅是计算出最佳结果,而且能理解这些结果对服务的人类而言意味着什么。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。