← 最新论文
🤖 machine learning

Learning to Control Coupled-Dynamics Environments with Joint Markov Decision Processes

本文通过定义一种非参数分布贝尔曼最优算子,并证明其收敛至最优联合回报律,从而为联合马尔可夫决策过程(JMDPs)引入了最优控制方法,进而保留了标准 MDP 会丢弃的跨反事实结果的依赖关系。

原作者: Ege C. Kaya, Aliasghar Pourghani, Mahsa Ghasemi, Vijay Gupta, Abolfazl Hashemi

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Ege C. Kaya, Aliasghar Pourghani, Mahsa Ghasemi, Vijay Gupta, Abolfazl Hashemi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,智能体通过与环境交互来学习如何做出决策,就像孩子学习如何在房间里穿行一样。几十年来,这种学习的标准数学框架一直是马尔可夫决策过程(Markov decision process)。在这种模型中,智能体尝试一个特定的动作,观察发生的单一结果,并利用该经验进行改进。当目标仅仅是最大化随时间推移的平均回报时,这种方法效果很好。然而,这种标准观点将每一个可能的动作都视为存在于一个独立的、孤立的宇宙中。它假设如果智能体选择了另一条路径,其结果将是由一次完全独立的掷骰子过程生成的。在许多现实世界的场景中,这种假设过于简单了。通常,不同选择的潜在结果是由一个共同的底层现实所联系的。例如,一阵突如其来的阵风可能会影响无人机的飞行轨迹,无论飞行员打算向哪个方向飞行。当这些结果由共同的原因联系在一起时,标准模型会丢弃关于这些可能性之间如何相互关联的关键信息。

普渡大学的研究人员开发了一种处理这些关联场景的新方法,超越了孤立选择的概念,转向一种将所有动作的潜在未来共同计算的框架。他们称之为联合马尔可夫决策过程(Joint Markov decision process)。他们的这种方法不再是问:“如果我向左转会发生什么?”然后又分别问:“如果我向右转会发生什么?”仿佛世界在每个问题之间都重置了一样;而是问:“如果我向左转且北风吹来,会发生什么?以及如果我向右转且同一阵北风吹来,那时又会发生什么?”通过将这些反事实结果——即如果做了不同选择将会发生什么——与同一个时刻的随机性联系起来,研究人员可以观察不同动作是如何相互影响的。这对于安全至上的任务或资源分配至关重要,因为理解选项之间的关系与了解单个选项的价值同样重要。

该团队的工作重点是教导智能体如何在这些复杂的、相互关联的环境中找到最佳策略。他们证明了,如果每一步都存在一个明显的优选动作,那么智能体的学习过程最终会稳定在完美的策略上,并且所有可能未来回报的数学描述将收敛到正确答案。他们还表明,即使两个动作在平均意义上看起来同样好,只要这些关系以特定方式趋于稳定,智能体仍然可以学习到它们之间正确的关系。这使得系统不仅可以计算平均回报,还可以计算不同动作的回报是如何共同变化的。例如,它可以确定一个动作的高回报是否往往伴随着另一个动作的低回报,或者它们是否倾向于同步上升和下降。

为了测试这些想法,研究人员在各种环境中运行了模拟,从简单的状态链到复杂的网格世界,甚至是一个涉及平衡杆的连续控制任务。在一个实验中,他们研究了一个路径选择问题,驾驶员可以在一条安全路径和两条风险路径之间做出选择。这两条风险路径由一个共同的天气条件联系在一起:如果风向对其中一条路径有利,那么对另一条路径通常就是不利的。通过使用他们的新方法,智能体学会了在两条风险路径之间分配交通流量。由于这些风险是负相关联的,这种分流策略消除了彻底失败的可能性,而标准方法(由于忽略了路径之间的联系)无法实现这一结果。在另一个测试中,他们训练神经网络从数据中学习这些关系。网络成功地恢复了动作之间的隐藏联系,证明了联合信息不仅是一个理论概念,而且是现代机器学习系统可以学习并使用的东西。

研究结果表明,通过保留不同可能性之间如何连接的结构,人工智能可以做出更稳健且更细致的决策。研究人员证明了他们的数学工具在简单和复杂的场景中都能可靠地工作,并收敛到正确答案。他们表明,虽然标准方法可能会错过选择之间微妙的相互作用,但他们的方法捕捉到了世界在相同条件下对不同动作做出反应的全貌。这不仅仅是提高了智能体可能获得的平均得分;它从根本上改变了智能体理解风险与回报景观的方式,使其能够在不同选择的命运紧密交织在一起的环境中进行导航。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →