← 最新论文
🤖 machine learning

Quotient-Categorical Representations for Bellman-Compatible Average-Reward Distributional Reinforcement Learning

本文引入了一种用于平均奖励分布强化学习的商范畴框架,通过识别模去平移的状态索引定律来解决偏差估计的病态性质,从而定义了良定的非扩张算子,并证明了在在线增益估计下理想化算法与实际采样算法的收敛性。

原作者: Ege C. Kaya, Aliasghar Pourghani, Vijay Gupta, Abolfazl Hashemi

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Ege C. Kaya, Aliasghar Pourghani, Vijay Gupta, Abolfazl Hashemi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创造性类比对这篇论文的解读。

宏观图景:在没有起跑线的情况下衡量“好坏”

想象你在玩一款电子游戏,游戏结束时不会给出最终得分。相反,你将永远玩下去,每秒都在累积分数。你的目标是计算出从长远来看,你每秒平均能赚取多少分。

在人工智能(AI)领域,这被称为平均奖励强化学习。AI 需要学习两件事:

  1. 增益(Gain):长期平均的得分速度(例如,每秒 5 分)。
  2. 偏差(Bias):特定情境相对于该平均值的好坏程度。例如,处于“安全区”可能感觉像 +10 分,而处于“危险区”感觉像 -10 分,即使长期平均值仅为 5 分。

问题所在:
“偏差”有一个奇怪的怪癖。这就像以海平面为基准测量高度。如果你决定“海平面”实际上比之前高了 100 英尺,那么每一个测量值都会增加 100 英尺。山脉和山谷之间的差异保持不变,但数字发生了变化。

用数学术语来说,偏差仅在“加法常数”的范围内定义。如果你将所有数字移动相同的量,AI 学到的东西本质上是一样的。这给一种名为**分布强化学习(DRL)*的特定 AI 类型带来了麻烦。DRL 不仅仅猜测偏差的一个单一数值;为了更准确,它会猜测整个分布*(一团可能性)。但是,如果你无法确定“零”在哪里,你如何在地图上画出这团云?如果你移动地图,云也会随之移动,数学逻辑就会崩溃。

解决方案:“商”映射

作者 Ege C. Kaya 及其来自普渡大学的团队提出了一种巧妙的解决方法。他们没有试图强迫 AI 选择一个单一的“零”点,而是将这个问题视为一个滑动拼图

类比:滑动的火车车厢
想象 AI 对偏差的猜测是一节装满乘客(概率分布)的火车车厢。

  • 旧方法:你试图将火车车厢停靠在轨道上的特定坐标(例如,“停在 50 英里标记处”)。但由于“零”点不断移动,车厢会不断滑出轨道。
  • 新方法(商 - 分类法):作者说:“谁在乎火车停在哪里?我们只关心火车的形状以及乘客之间的距离。”

他们创建了一个名为商空间(Quotient Space)的新数学空间。在这个空间中,如果两个火车车厢仅仅是彼此向左或向右平移了相同的距离,它们就被视为“相同”。他们称此为识别模去共同平移的定律

通过这样做,他们消除了关于“零在哪里”的困惑。AI 不再试图猜测一个绝对数值;它猜测的是偏差云的形状,而不管它位于数轴上的哪个位置。

引擎:“非扩张”算子

一旦修复了地图,他们就需要一条规则(算法)来在游戏进行中更新 AI 的猜测。

在标准的 AI 学习中,我们通常依赖“压缩”属性。想象一根橡皮筋,每次拉伸时都会收缩,最终弹回到一个点。这保证了 AI 能够学会答案。

然而,由于偏差的“滑动”性质,这个新系统中的橡皮筋不会收缩。相反,它表现得像一个非扩张物体。想象一根刚性金属杆。如果你推一端,另一端也会移动相同的距离,但杆子永远不会变短或变长。它不会自然地弹回到一个点,只是保持相同的距离。

作者证明,即使这根“金属杆”不会收缩,他们的新算法仍然有效。他们表明:

  1. 该算法是良定义的(在数学上是合理的)。
  2. 它是非扩张的(不会让误差扩大)。
  3. 它仍然能找到一个不动点(稳定解),即 AI 停止改变其判断的地方。

实用技巧:实时学习“增益”

还有一个最后的障碍。要使用他们完美的“滑动地图”算法,AI 需要知道确切的“增益”(平均速度),以便将其从奖励中减去。但在现实世界中,AI 还不知道平均速度;它正试图学习它!

解决方案:耦合递归
作者添加了一个更简单的学习过程,与主过程并行运行。

  • 主脑:学习偏差分布的形状(火车车厢)。
  • 副手:一个简单的计算器,根据最新获得的分数不断更新其对平均速度(增益)的猜测。

他们证明这两个“大脑”可以互相交流。副手在猜测平均速度方面变得更准确,这有助于主脑正确地将火车车厢居中。即使副手是在猜测,整个系统仍然保持稳定并收敛到正确答案。

他们测试了什么

为了证明这行之有效,他们进行了实验:

  1. 一个简单的 5 状态游戏:他们创造了一个微小而简单的世界。他们表明,他们的新方法收敛到了正确答案,而那些试图强制设定“零”点的旧方法则失败或陷入停滞。
  2. 摆锤模拟:他们在更复杂的连续任务(平衡摆锤)上使用神经网络进行了测试。即使增加了复杂性,他们的方法在学习偏差分布方面也比忽略“滑动”问题的朴素方法要好得多。

一句话总结

作者发明了一种让 AI 学习长期奖励的新方法,他们将“零的不确定性”视为一种特性而非缺陷,采用了一种“滑动地图”方法,使 AI 能够在无需知道确切起点的情况下学习偏差的形状,同时还能学习游戏的平均速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →