想象一下,你正在教一个机器人探索一个巨大、黑暗的迷宫。这个机器人没有地图,没有手电筒,也没有人告诉它出口在哪里。它唯一的目标是通过移动和观察结果来学习迷宫的运作方式。
主要问题是:机器人如何知道哪些步骤是“好”的? 如果它只是随机游荡,可能会永远在原地打转。如果它被困在一个角落里,它就无法了解迷宫的其他部分。
这篇论文提出了一种新方法,为机器人采取明智的步骤提供“好奇心奖励”。作者将这种方法称为CIG(条件信息增益)。
以下是使用日常类比对问题及其解决方案的简要分解。
问题:两种有缺陷的好奇心方式
在 CIG 之前,机器人主要使用两种方式来决定什么是有意义的。这两种方式都有一个重大盲点:
“终身记忆”方法(终身奖励):
- 工作原理: 机器人检查它的整个生命历史。“我以前见过这个地方吗?”如果没有,它就获得一大笔奖励。
- 缺陷: 想象机器人正走在一条漫长而无聊的走廊上。它走了 10 步。在第 1 步,它看到了一个从未见过的奇怪墙壁纹理,因此获得了奖励。在第 2 步,它再次看到了完全相同的墙壁纹理。因为机器人只查看它的终身记忆,它会想:“嘿,在我的整个生命中,我从未见过这种墙壁纹理!”然后再次给自己奖励。
- 结果: 机器人因同一个发现获得了两次报酬。它浪费时间重新探索同一条走廊,而不是转弯去寻找新事物。
“当前行程”方法(片段奖励):
- 工作原理: 机器人只查看它当前正在进行的行程。“我刚刚见过这个地方吗?”如果没有,它就获得奖励。
- 缺陷: 想象机器人已经在迷宫中探索了数周。它已经完美地掌握了第一个房间。现在,它进入了一个全新的、令人困惑的房间。它迈出了一步。因为它从未在这个特定的房间待过,机器人会想:“这是新的!”然后给自己奖励。
- 结果: 它将一个全新的、令人困惑的房间与它已经搞清楚的房间同等对待。它没有意识到这种“新”仅仅是因为它处于一个新的环境中,而不是因为它正在学习关于迷宫规则的真正重要的东西。
解决方案:CIG(聪明的探索者)
作者创造了CIG,它结合了两种方法的最佳之处。对于每一步,它同时提出两个问题:
- “我在整个生命中以前见过这个吗?”(终身检查)
- “我在这次特定行走的最后几步中见过这个吗?”(当前行程检查)
创造性类比:侦探的笔记本
想象机器人是一个正在破案的侦探。
- 终身检查就像查阅案件档案。我们是否已经解开了这个线索?如果是,就不要浪费时间。
- 当前行程检查就像检查犯罪现场录像带。我们是否在五秒钟前刚刚走过这个线索?如果是,就不要再次为此兴奋。
CIG 是交叉引用这两者的侦探。
- 如果侦探看到一个线索,它对案件档案来说是新的,并且对犯罪现场来说也是新的,他就会获得巨额奖励。
- 如果线索对案件档案来说是新的,但他们刚刚看到过它(它是同一条路径的一部分),他们会获得较小的奖励。他们会意识到:“哦,我只是在走我刚刚走过的同一条路。我现在没有学到任何新东西。”
- 如果线索在案件档案中是熟悉的,但对犯罪现场来说是新的,他们会获得微薄的奖励。他们会意识到:“我知道这个线索,但我正在城市的新区。让我们看看这里的规则是否不同。”
工作原理(魔法技巧)
论文解释说,对于复杂的机器人(如使用深度神经网络的机器人),完美计算这种“交叉引用”在数学上是不可能的。这就像试图计算一个拥有十亿个拨盘的锁的所有可能组合。
作者发明了一个巧妙的捷径(一种“代理”)来近似这种数学计算。
- 他们使用一个专家团队(AI 模型的集成)来猜测接下来会发生什么。
- 如果所有专家都达成一致,机器人就感到无聊(低奖励)。
- 如果专家们意见不一,机器人就感到好奇(高奖励)。
- CIG 的转折: 他们使用一种数学技巧(称为"Cholesky 分解”,就像一层层剥洋葱)来减去机器人刚刚采取的步骤所导致的“无聊”。这确保机器人只对新的方向感到兴奋,而不仅仅是重复同一条路径。
结果:它有效吗?
作者在 12 种不同的游戏和模拟中测试了 CIG,范围从简单的网格世界迷宫到复杂的机器人控制任务。他们还在“嘈杂”环境中进行了测试,机器人会受到随机闪烁灯光的干扰(就像随机变色的电视屏幕)。
- 获胜者: CIG 始终优于或匹配所有其他方法。
- 鲁棒性: 当开启“嘈杂电视”干扰时,大多数其他机器人会感到困惑并停止学习,因为它们认为闪烁的灯光是新发现。然而,CIG 忽略了噪音,继续探索实际的迷宫。
- 效率: CIG 学习得更快,并且比其他方法到达了更多独特的地方,特别是在机器人必须规划长序列移动的任务中。
总结
简而言之,CIG是一种教机器人保持好奇心的新方法。它阻止机器人因在原地打转(重复步骤)而获得报酬,也阻止它们因被已知事物分散注意力(忽略终身进展)而分心。它迫使机器人只专注于真正新颖且富有信息量的步骤,使其成为复杂未知世界中更优秀的探索者。
技术摘要:CIG:通过条件信息增益进行探索
问题陈述
在具有稀疏或延迟外在奖励的强化学习(RL)中,智能体必须依赖内在动机进行探索。有效的探索需要识别那些对环境动力学具有信息量的状态转移。然而,现有的内在奖励方法在如何利用上下文方面面临一个根本性的权衡:
- 终身奖励(例如,集成不一致性、预测误差)基于累积的 replay buffer 进行条件化。它们为每一个探测模型差距的转移分配信用,无论当前轨迹是否已经探索了该差距。这导致单次 rollout 内的冗余(例如,在迷宫中反复访问同一条不确定的走廊)。
- 回合奖励(例如,基于计数的奖励、可达性奖励)基于当前 rollout 的前缀进行条件化。它们惩罚轨迹内的重复,但忽略了终身进展。在基于模型的 RL 中,策略优化的是较短的“想象”rollout(T≈15),前缀往往太短,无法提供丰富的信号来纠正冗余。
- 混合方法试图通过启发式权重结合这些信号,或依赖高斯过程(GP)动力学,但这无法扩展到高分辨率状态空间。
- **轨迹级信息增益(IG)**提供了一个原则性的目标,同时基于 buffer 和前缀进行条件化。然而,计算精确的 IG 需要对模型参数的后验分布进行边缘化,这对于深度神经网络来说是难以处理的。
方法论:条件信息增益(CIG)
作者推导出了条件信息增益(CIG),这是轨迹级信息增益的一个可处理的代理目标,它既能扩展到高分辨率潜在空间,又能同时基于 replay buffer 和 rollout 前缀进行条件化。
- 公式化:目标是最大化模型参数 w 与轨迹 s1:T 在给定 replay buffer D 下的互信息:I(w;s1:T∣D)。利用链式法则,这分解为每步项 I(w;st∣s<t,D)。
- 近似:
- 集成后验(A1):后验 p(w∣D) 被近似为 M 个独立训练的集成成员上的均匀分布。
- 马尔可夫 - 高斯动力学(A2):每个集成成员将下一个潜在状态预测为具有高斯分布,具有共享的各向同性偶然协方差 σ2Id。
- 矩匹配高斯(A3):集成预测的混合熵被具有匹配均值和协方差的高斯分布的熵所上界。
- 秩饱和瓶颈:最大化完整认知协方差矩阵 Σ(大小为 Td×Td)的对数行列式在高分辨率下会失效,因为协方差的秩受限于集成大小(M−1)。对于典型值(M=5,d=200),单个观测值即可使奖励信号饱和,导致后续步骤没有信用可分配。
- 迹缩减(设计选择 D1):为了解决容量瓶颈,作者将认知协方差的每个 d×d 块坍缩为其迹。这产生了一个核 K∈RT×T,其中 Kjt=M1∑k(δk(j))⊤δk(t),δ 代表集成成员与均值的偏差。这将有效容量从 M−1 提升至 min(T,(M−1)d)。
- 每步分解:轨迹目标 J~=logdet(K+σ2dIT) 利用 Cholesky 分解(LL⊤=K~)分解为因果每步奖励。步骤 t 的奖励为:
rt=log(Ktt+σ2d−k<t⊤K~<t−1k<t)
- 终身项(Ktt):标准的集成不一致性(buffer 条件化)。
- 前缀冗余项(k<t⊤K~<t−1k<t):一个二次型,减去步骤 t 处已被 rollout 中前序步骤解释的不一致部分。
- 偶然脊(σ2d):一个基于训练残差事后估计的底线,防止奖励因不可约噪声而消失。
主要贡献
- CIG 奖励:一种源自轨迹级信息增益的对数行列式代理的可处理、每步内在奖励。它同时基于 replay buffer(通过训练好的集成)和 rollout 前缀(通过 Cholesky 分解)进行条件化。
- 秩饱和分析:识别了有限集成代理中的容量瓶颈,并推导了迹缩减技术,以在不进行完整协方差估计的情况下恢复有效容量。
- 对随机干扰的鲁棒性:该方法通过集成的偶然尺度自然过滤动作依赖的随机噪声(Noisy-TV),这与基于计数或原始预测误差的方法不同。
实验结果
作者在离散(MiniGrid)和连续控制(OGBench)领域的 12 个任务上评估了 CIG,包括干净版本和随机干扰(Noisy-TV)变体。评估采用了无奖励协议以隔离探索质量。
- 性能:CIG 在大多数任务上优于或匹配了所有基线(包括 Plan2Explore、RND、ICM、APT、E3B 和 E3B × P2E)。在汇总统计(四分位数均值)中,CIG 取得了最高分数,且与其他所有方法的置信区间不重叠。
- Noisy-TV 鲁棒性:在具有动作依赖随机干扰的环境中,依赖原始预测误差的方法(ICM、RND、APT)崩溃至接近零的成功率。CIG 和 Plan2Explore(P2E)由于集成过滤而保持鲁棒,但 CIG 始终优于 P2E,表明前缀冗余校正提供了超越简单不一致性的额外价值。
- 消融实验:移除迹缩减会导致奖励立即饱和,从而停止探索。移除前缀冗余项降低了样本效率,证实了该校正防止了在同一 rollout 内对相关性步骤的重复计数。
- 熵与成功:虽然 APT 和 E3B 等方法实现了更高的状态访问熵,但这与任务成功并不相关。CIG 以较低的熵实现了高成功率,表明有针对性的不确定性减少(探索信息丰富的前沿)比均匀覆盖更有效。
意义与主张
该论文声称,CIG 证明了终身和回合探索信号不需要通过启发式方式结合。相反,它们源自单一的信息论目标而共同涌现。对数行列式代理的 Cholesky 分解自然地产生了因果的、每步的奖励,同时保留了两个条件集。
作者强调,CIG 在各种问题结构中具有鲁棒性:它在随机环境中过滤不可约噪声,并在确定性环境中提供结构化奖励。虽然 CIG 并未在所有单个任务中占据主导地位(例如,APT 在干净的 ObstructedMaze 上表现更好),但它是唯一一种在所有测试条件下避免退化的方法。该工作局限于具有短想象 rollout 的基于模型的 RL;作者指出,O(T3) 的 Cholesky 成本和 T×T 的核存储对于长视野的无模型回合可能变得不可行,建议将滑动窗口或低秩近似作为未来的工作方向。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。