在人工智能领域,智能体通过与环境交互来学习如何做出决策,就像孩子学习如何在房间里穿行一样。几十年来,这种学习的标准数学框架一直是马尔可夫决策过程(Markov decision process)。在这种模型中,智能体尝试一个特定的动作,观察发生的单一结果,并利用该经验进行改进。当目标仅仅是最大化随时间推移的平均回报时,这种方法效果很好。然而,这种标准观点将每一个可能的动作都视为存在于一个独立的、孤立的宇宙中。它假设如果智能体选择了另一条路径,其结果将是由一次完全独立的掷骰子过程生成的。在许多现实世界的场景中,这种假设过于简单了。通常,不同选择的潜在结果是由一个共同的底层现实所联系的。例如,一阵突如其来的阵风可能会影响无人机的飞行轨迹,无论飞行员打算向哪个方向飞行。当这些结果由共同的原因联系在一起时,标准模型会丢弃关于这些可能性之间如何相互关联的关键信息。
普渡大学的研究人员开发了一种处理这些关联场景的新方法,超越了孤立选择的概念,转向一种将所有动作的潜在未来共同计算的框架。他们称之为联合马尔可夫决策过程(Joint Markov decision process)。他们的这种方法不再是问:“如果我向左转会发生什么?”然后又分别问:“如果我向右转会发生什么?”仿佛世界在每个问题之间都重置了一样;而是问:“如果我向左转且北风吹来,会发生什么?以及如果我向右转且同一阵北风吹来,那时又会发生什么?”通过将这些反事实结果——即如果做了不同选择将会发生什么——与同一个时刻的随机性联系起来,研究人员可以观察不同动作是如何相互影响的。这对于安全至上的任务或资源分配至关重要,因为理解选项之间的关系与了解单个选项的价值同样重要。
该团队的工作重点是教导智能体如何在这些复杂的、相互关联的环境中找到最佳策略。他们证明了,如果每一步都存在一个明显的优选动作,那么智能体的学习过程最终会稳定在完美的策略上,并且所有可能未来回报的数学描述将收敛到正确答案。他们还表明,即使两个动作在平均意义上看起来同样好,只要这些关系以特定方式趋于稳定,智能体仍然可以学习到它们之间正确的关系。这使得系统不仅可以计算平均回报,还可以计算不同动作的回报是如何共同变化的。例如,它可以确定一个动作的高回报是否往往伴随着另一个动作的低回报,或者它们是否倾向于同步上升和下降。
为了测试这些想法,研究人员在各种环境中运行了模拟,从简单的状态链到复杂的网格世界,甚至是一个涉及平衡杆的连续控制任务。在一个实验中,他们研究了一个路径选择问题,驾驶员可以在一条安全路径和两条风险路径之间做出选择。这两条风险路径由一个共同的天气条件联系在一起:如果风向对其中一条路径有利,那么对另一条路径通常就是不利的。通过使用他们的新方法,智能体学会了在两条风险路径之间分配交通流量。由于这些风险是负相关联的,这种分流策略消除了彻底失败的可能性,而标准方法(由于忽略了路径之间的联系)无法实现这一结果。在另一个测试中,他们训练神经网络从数据中学习这些关系。网络成功地恢复了动作之间的隐藏联系,证明了联合信息不仅是一个理论概念,而且是现代机器学习系统可以学习并使用的东西。
研究结果表明,通过保留不同可能性之间如何连接的结构,人工智能可以做出更稳健且更细致的决策。研究人员证明了他们的数学工具在简单和复杂的场景中都能可靠地工作,并收敛到正确答案。他们表明,虽然标准方法可能会错过选择之间微妙的相互作用,但他们的方法捕捉到了世界在相同条件下对不同动作做出反应的全貌。这不仅仅是提高了智能体可能获得的平均得分;它从根本上改变了智能体理解风险与回报景观的方式,使其能够在不同选择的命运紧密交织在一起的环境中进行导航。
技术摘要:学习控制耦合动力学环境中的联合马尔可夫决策过程
问题陈述
标准的马尔可夫决策过程(MDP)对环境进行建模,其中智能体观察到执行动作后产生的单个采样结果(状态转移和奖励)。这种抽象足以实现期望回报的最大化,但丢弃了存在于**耦合动力学环境(coupled-dynamics environments)**中的结构化信息。在这些环境中,同一状态下多个反事实动作的一步结果是由一个共享的外生随机性实现所生成的。虽然这些结果的边缘分布定义了一个标准的 MDP,但由于边缘化处理,不同反事实结果之间的依赖结构(例如协方 covariance、优越性的联合概率)也随之丢失。
前人的工作(Kaya 等人,2026)引入了联合马尔可夫决策过程(Joint Markov Decision Processes, JMDPs)来形式化这些环境,从而保留了反事实结果的联合分布律。然而,该工作仅限于固定策略评估。本文解决的开放性问题是 JMDP 的最优控制(optimal control)。将控制扩展到 JMDP 并非易事,因为贪婪选择器(用于最大化价值的动作选择器)可能会随着估计值的演变而改变,且不同的均值最优策略会诱导出不同的联合回报律,从而使收敛保证变得复杂。
方法论
本文在分布层面和矩层面开发了 JMDP 的最优控制方法。
1. 非参数分布控制:
作者定义了一个用于 JMDP 的非参数分布贝尔曼最优算子(nonparametric distributional Bellman optimality operator)。该算子作用于由状态-动作对配置索引的一族联合回报律。
- 收敛性: 他们证明,如果诱导的边缘 MDP 具有唯一的优化策略(条件 1),则贪婪算子的迭代将在 Wasserstein 距离下收敛到最优联合回报律。该证明依赖于这样一个事实:一旦价值估计足够准确,贪婪选择器就会稳定到唯一的优化策略,从而将问题简化为收敛的固定策略算子。
2. 基于矩的控制:
针对实际应用,本文侧重于前两阶矩(均值和二阶矩)。
- 更弱的收敛条件: 作者在更弱的条件(条件 2)下建立了前两阶矩的收敛性,该条件允许存在多个均值最优动作(平局/ties)。只要所有最优平局解决规则都共享一个共同的二阶矩不动点,即可保证收敛。
- 采样目标: 本文推导了用于神经函数逼近的采样目标。至关重要的是,二阶矩(及交叉矩)的目标取决于同时存在的两个后续状态-动作对。对于不同的状态-动作对 (s,a) 和 (s~,a~),目标通过评估联合后续配置下的连续矩来保留依赖结构,而边缘化或打乱后的样本则会丢弃这种结构。
核心贡献
- 算子定义: 定义了用于联合回报律的非参数 JMDP 贝尔曼最优算子。
- 收敛性证明:
- 证明了在唯一优化策略下,风险中性迭代在 Wasserstein 距离下的收敛性。
- 证明了在最优平局共享不动点条件下,前两阶矩的收敛性。
- 逼近目标: 推导了显式依赖于联合后续状态-动作对的采样一阶和二阶矩目标。
- 经验验证:
- 在表格问题中验证了精确的分布和矩递归。
- 在连续状态实验中展示了耦合分支样本如何成功识别出在使用边缘或打乱样本时会丢失的联合量(协方差)。
实验结果
本文通过四个实验验证了所提方法:
- 耦合奖励链(Coupled-Reward Chain): 在唯一策略设置下,联合分布律、均值向量和协方差块均收敛至地面真值(ground truth)。在存在最优平局的设置中,如果平局打破规则发生交替,分布迭代会在不同分布律之间发生振荡,这证实了收敛条件的必要性。
- 多风网格世界(Windy Gridworld): 一个具有共享阵风的随机网格世界,证明了学习到的协方差块与固定策略 JMDP 评估及蒙特卡洛展开相匹配。共享的阵风在反事实回报之间产生了正相关性,模型成功捕捉到了这一点。
- 反相关路径选择(Anti-Correlated Route Choice): 一个交通分配问题展示了交叉动作协方差如何影响风险感知决策。利用完整协方差矩阵的均值-风险组合优化(马科维茨风格)与对角(不相关)基准或单路径规则相比,能产生不同的分配方案,特别是在通过分散负相关风险来减轻灾难性损失方面。
- 耦合倒立摆(Coupled Inverted Pendulum): 在耦合结果表上训练的神经网络成功恢复了联合矩和联合回报律的粒子近似。使用耦合数据训练的模型在估计离角协方差和能量距离方面,显著优于“打乱(shuffled)”基准(破坏了耦合关系)和对角基准。
意义与主张
本文声称将 JMDP 框架从固定策略评估扩展到了最优控制。其主要意义在于证明了在耦合动力学环境下进行最优控制是可行的,并且可以保留并学习反事实结果的联合结构。
作者强调,虽然诱导的边缘 MDP 决定了均值最优策略,但 JMDP 形式化决定了反事实动作的回报如何共同运动。这种联合信息对于涉及比较统计(例如优越性的概率)或分配问题(例如投资组合的方差取决于交叉动作协方差)的任务至关重要。这项工作提供了实现这些控制策略所需的理论收敛保证以及实用的采样目标,使其能够通过表格法和神经函数逼近来实现。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。