技术摘要:分布式主动推理 (Distributional Active Inference)
问题陈述
在复杂的机器人环境中,最优控制面临着两个交织在一起的挑战:感官状态信息的有效组织以及远见性的动作规划。虽然强化学习 (RL) 解决了规划问题,但它通常面临样本效率低下的问题,因为它通常只关注后者。主动推理 (AIF) 作为一种解释生物智能的过程理论,通过动作-感知循环来同时解决这两个问题。然而,现有的 AIF 在人工智能中的应用主要局限于基于模型的方法,这类方法需要学习显式的转移动力学,这在计算上是非常昂贵的,且在处理高保真前向模拟时往往是不可行的。
本文解决的核心问题是如何将主动推理的性能优势集成到一个不需要学习显式转移模型的框架中,从而使 AIF 能够应用于无模型 (model-free) 和分布式 (distributional) 的场景。
方法论
作者提出了一个三步走的理论与算法框架,旨在连接主动推理与分布式强化学习:
1. 主动推理的严谨公式化
作者从贝叶斯和因果推理的第一性原理出发,重新推导了 AIF 的目标函数。通过将 do-演算 (do-calculus) 应用于标准的变分推理设置,他们证明了标准的 AIF 目标函数存在一个更简单的等效形式。
- 他们展示了通过一个期望分布 PR(X)(作为奖励)对可观测状态 X 进行干预,会在乘积法则下断开可观测变量与潜在变量 (Y,S) 之间的联系。
- 这导致了一个简化的证据下界 (ELBO),其目标由重构项、策略熵项以及最大化期望轨迹下目标状态分布对数概率的项组成。
- 至关重要的是,这种公式化揭示了 AI 可以被视为一种预测编码形式,即智能体优化世界模型以拟合期望结果,而不一定需要为每一步都进行复杂的后验潜在变量推理。
2. 推前强化学习 (Push-Forward Reinforcement Learning)
为了在不使用显式转移模型的情况下集成 AIF,作者引入了推前强化学习 (Push-Forward RL),这是一个推广了分布式强化学习的理论框架。
- 轨迹测度 (Trajectory Measures): 他们定义的收益分布不仅是一个期望值,还是通过收益泛函对轨迹测度进行的“推前”映射。
- 状态抽象 (State Abstraction): 他们形式化了状态抽象(潜在空间)与分布式 RL 之间的关系。通过定义编码器 S 和解码器 PD,他们证明了在潜在空间上进行分布式 RL 等同于应用一个复合核算子 (composite kernel operator)。
- 收缩模数 (Contraction Modulus): 一个关键的理论结果(定理 3.5)确立了潜在空间中分布式贝尔曼算子的收缩模数受编码器 Lipschitz 常数 (LE) 与解码器 Lipschitz 常数 (LD) 乘积的缩放。如果潜在空间提供了高效的压缩(较小的 LE)并捕捉了与奖励相关的结构(较小的 LD),则贝尔曼回溯的收敛速度会加快。
- 算法模板: 他们提出了推前策略迭代 (Push-Forward Policy Iteration, PPI),该算法在编码测度空间而非原始状态空间上最小化贝尔曼残差,从而有效地统一了基于模型与无模型的观点。
3. 分布式主动推理 (Distributional Active Inference, DAIF)
作者将上述理论实例化为一个名为分布式主动推理 (DAIF) 的实用算法。
- 机制: DAIF 学习一个状态-动作摊销参数化分布(一个编码器),将观测值映射到潜在空间。随后,它在这一潜在空间上执行时序差分分位数匹配 (temporal-difference quantile matching)。
- 实现细节:
- 分位数回归问题被构建为不对称拉普拉斯分布 (ALD) 的极大似然估计 (MLE)。
- 分位数估计周围的不确定性使用逆伽马分布 (Inverse-Gamma) 先验对尺度参数 (στ) 进行建模。该后验方差充当了隐式认识不确定性 (epistemic uncertainty),能够诱导类似于汤姆森采样 (Thompson sampling) 的探索行为,而无需显式的探索奖励。
- 该算法利用深度 Actor-Critic 架构,包含双评论家 (twin critics)、用于贝尔曼目标的最小裁剪 (min-clipping) 以及延迟 Actor 更新(类似于 TD3),但将其标准的价值目标替换为源自 AIF 目标的分布式收益。
- 核心区别: 与传统 AIF 不同,DAIF 不学习前向转移模型 (P(X′∣X,A))。相反,它直接从潜在空间中的采样转移中学习收益分布,从而继承了 AIF 的状态抽象优势,同时避免了建模转移动力学的计算成本。
核心贡献
- 理论统一: 本文提供了一个涵盖基于模型、分布式和无模型强化学习的正式抽象,证明了 AIF 可以无缝集成到分布式框架中。
- 简化的 AIF 目标: 通过使用 do-演算,作者推导出了一个简化的 AIF 目标,消除了在标准公式中进行复杂后验潜在变量推理的需求,使其更贴近现代强化学习中使用的变分推理机制。
- 推前框架: “推前强化学习”的引入为状态抽象与分布式贝尔曼算子之间提供了严谨的数学联系,展示了潜在空间压缩如何影响收敛速率。
- DAIF 算法: 提出了 DAIF,这是一个实用的算法,能够在获得 AIF 式性能增益(通过状态抽象实现高效规划)的同时,避免学习显式转移模型的计算开销。
实验结果
作者在表格型和连续控制任务中对 DAIF 进行了评估:
- 表格实验 (Latent RiverSwim): 在奖励相关的动力学存在于一维潜在流形上的网格世界中,随着规划时界的增加,DAIF 的表现显著优于基于模型 (PSRL-PI) 和分布式 (IQQL) 基准模型。当状态抽象不再提供优势时(Plain RiverSwim),DAIF 的表现与分布式强化学习相当。
- 连续控制: DAIF 在三个基准套件上进行了测试:
- EvoGym: 软体机器人运动与操控。
- DeepMind Control Suite (DMC): 具有不同形态的连续控制。
- DMC Vision: 基于原始像素观测的控制。
- 性能: DAIF 在所有套件中均一致取得了最先进的性能,特别是在具有复杂动力学或高维状态空间的任务中(如 "Catcher-v0", "Dog Run", "Quadruped Run")。
- 效率: 虽然 DAIF 比标准的分布式 Actor-Critic 多消耗约 12% 的墙钟时间 (wall-clock time),但这一开销低于其他基于模型或重探索的方法,如 DSAC (26%) 和 DRND (37%)。
重要性与主张
本文声称,当智能体计算能力有限时,主动推理表现得尤为强大,这模拟了生物大脑的条件。通过将 AIF 构建为分布式强化学习的一个简单扩展,作者认为,AIF 的性能优势(通过感官信息的有效组织来进行规划)可以在无需承担学习显式前向模型之高昂代价的情况下实现。
这项工作表明,解决感官组织与规划这一“双重问题”的最佳途径,是学习一个能够压缩并结构化收益分布的潜在表示,而不是去建模环境的完整转移动力学。作者将 DAIF 定位为并非要取代所有强化学习,而是一种针对那些对样本效率和计算约束要求极高的挑战性环境的鲁棒控制方法。作者也承认了局限性,指出 DAIF 并没有显式地分离认识价值 (epistemic value) 与工具价值 (instrumental value) 项(而是依赖于隐式不确定性),并且目前的潜在瓶颈大小是取决于架构而非自适应学习的。