← 最新论文
🤖 machine learning

Policy Gradient Methods for Non-Markovian Reinforcement Learning

本文提出了一种面向非马尔可夫强化学习的以奖励为中心的框架,该框架联合优化智能体状态动力学与控制策略,建立了一个新颖的策略梯度定理,并提出了具有理论收敛保证且在经验性能上优于预测基线的 ASMPG 算法。

原作者: Avik Kar, Siddharth Chandak, Rahul Singh, Soumitra Sinhahajari, Eric Moulines, Shalabh Bhatnagar, Nicholas Bambos

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Avik Kar, Siddharth Chandak, Rahul Singh, Soumitra Sinhahajari, Eric Moulines, Shalabh Bhatnagar, Nicholas Bambos

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人走迷宫,但有个棘手之处:机器人被蒙住了眼睛。它看不见墙壁或出口。它唯一知道的是它听到的声音(比如吱呀作响的地板)和它感受到的触觉(比如撞到了墙)。

在强化学习(RL)的世界里,这被称为非马尔可夫问题。机器人的当前状况不仅仅关乎“现在”;它完全取决于之前发生的一切。如果机器人撞到了墙,除非它记得自己从哪里出发以及走了哪些转弯,否则它不知道撞到了“哪一面”墙。

大多数标准人工智能方法在这里都会陷入困境,因为它们试图仅基于“现在”来猜测未来,或者试图构建一个完美的过去地图,但这会变得过于沉重和复杂,难以携带。

本文介绍了一种教这些蒙眼机器人的新方法,称为ASMPG(智能体状态 - 马尔可夫策略梯度)。以下是其工作原理,使用简单的类比:

1. 问题:“健忘者”与“过度思考者”

  • 健忘者(标准马尔可夫决策过程 MDP): 想象一个机器人,它在迈出一步的瞬间就忘记了一切。它只知道:“我在这里,我饿了。”如果环境很复杂(比如对话或迷宫),这个机器人就会失败,因为它不了解上下文。
  • 过度思考者(基于历史的方法): 想象一个机器人试图记住对话中的“每一个字”或迷宫中的“每一步”。虽然这包含了所有信息,但记忆列表会变得无限长。这使得处理变得不可能。

2. 解决方案:“智能日记”(智能体状态)

作者提出了一种折中方案。机器人既不忘记一切,也不记住一切,而是保留一本智能日记(称为“智能体状态”)。

  • 工作原理: 每当机器人采取行动或看到新事物时,它就会更新日记。它不会写下整个历史;它只写一个摘要
    • 示例: 在聊天机器人中,与其记住整篇 100 页的对话,日记只需写道:“用户正在询问订单状态,并且似乎很不耐烦。”
  • 转折: 在以前的方法中,科学家会尝试通过问“你能预测用户接下来会说什么吗?”(一种预测目标)来编写这份日记摘要。
  • 创新: 本文指出:“停止猜测未来。只需写下能帮助你获得奖励(即满意的客户)的摘要。”他们教导机器人同时编写日记并决定做什么,专门为了最大化得分。

3. 方法:“双引擎”方法

本文引入了一种名为ASMPG的新算法。把它想象成一架双引擎飞机,两个引擎是协同优化的:

  1. 引擎 A(记录员): 根据新输入更新日记(智能体状态)。
  2. 引擎 B(飞行员): 阅读日记并决定采取什么行动。

在旧方法中,记录员是固定的,或者被单独训练成“优秀的预测者”。而在 ASMPG 中,记录员和飞行员是联合训练的。如果飞行员需要日记中的某个特定细节来做出好的决定,记录员就会学会包含该细节。如果飞行员不需要某个细节,记录员就会学会忽略它。他们作为一个团队共同努力以赢得比赛。

4. 证明:为何有效

作者通过数学推导证明了这种“联合训练”方法是有效的。

  • 他们推导出了一个新公式(“策略梯度定理”),精确展示了如何调整记录员和飞行员以获得更好的分数。
  • 他们证明,如果你根据这个公式不断进行微调,机器人最终将学会一个非常好的策略(在数学上保证收敛)。

5. 结果:赢得比赛

他们在五个不同的棘手任务上测试了这种新的“智能日记”方法,在这些任务中机器人无法看到全貌:

  • CheeseMaze(奶酪迷宫): 一个机器人在迷宫中寻找奶酪,其中不同的地点看起来完全相同。
  • 走廊导航: 在走廊中行走,你只能看到紧邻你的墙壁。
  • 医疗保健: 决定医疗治疗方案,其中患者的反应取决于其过去治疗的隐藏历史(毒性和耐药性)。
  • 机器维修: 修理机器,你只能看到它是“生病”还是“健康”,但真正的病因是过去隐藏的磨损。
  • CartPole(倒立摆): 在只能看到速度而看不到位置的情况下,在推车上平衡杆。

结果: 在所有五种情况下,ASMPG 机器人(拥有联合训练的智能日记的机器人)都比那些试图通过预测未来或使用固定记忆系统来学习的机器人学得更快,得分更高。

总结

本文是关于教导人工智能代理如何处理“当下”不足以做出决定的情况。作者没有试图记住一切或猜测未来,而是教导人工智能维护其过去的动态、演变的摘要。关键在于,他们教导人工智能构建这个摘要专门是为了赢得比赛,而不仅仅是为了成为一个好的历史学家。其结果是为复杂的现实世界问题创造了一个更聪明、更高效的学习者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →