Learning Suffers More Than the Policy Class Under Partial Observability: A Closed-Form Analysis
本文表明,在部分观测线性二次强化学习中,实现最优性的主要障碍并非策略的表达能力,而是由无法解释的状态变化所导致的评论家价值估计偏差,这种偏差可以通过调整智能体的前瞻视野来进行精确表征与修正。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人正在尝试学习走路。它有一个大脑(一种算法),决定何时收缩肌肉,但它只有一个微小的摄像头,只能看到自己的脚,看不到脚下的地面,也看不到吹来的风。这就是**强化学习(Reinforcement Learning)**的世界——机器通过试错来获得最高分。通常,当这些机器人失败时,我们假设它们在某种程度上是“盲目”的,这种盲目使得任务变得不可能实现:我们认为它们只是无法看到足够多的信息来做出正确的动作。我们称之为“策略差距”(policy gap)——即机器人的大脑过于简单,无法承载完美的解决方案。
但存在第二个更隐蔽的失败原因。即使机器人能够找到完美的动作,它的学习方式也可能会误导它。机器人必须根据它所看到的内容来猜测一个情境有多好。如果它看不全全局,它的猜测就会产生偏差。它可能认为一个情境很危险,而实际上它是安全的,反之亦然。这就是“学习差距”(learning gap)。这并不是说机器人不够聪明;而是老师(学习算法)给了它错误的作业。这篇论文提出了一个简单的问题:在一个机器人部分失明的情况下,问题在于它太笨无法理解世界,还是在于它的学习方法出了问题?
蒙眼驾驶员与错误的地图
想象一位驾驶员正试图在颠簸的路上驾驶汽车。驾驶员可以看到车头正前方的路面(“观测状态”),但他们看不见几秒钟后即将出现的坑洼(“未观测状态”)。汽车的悬挂系统正在对这些隐藏的坑洼做出反应,导致汽车颠簸。
在这个故事中,驾驶员是执行者(Actor)(负责决定转动方向盘的部分),而**评论家(Critic)**则是记录得分的乘客,告诉驾驶员行驶过程的好坏。乘客只能看到颠簸的汽车,却看不到隐藏的坑洼。
论文设定了一个非常具体且可解的此类问题版本。汽车行驶在一条轨道上,隐藏的坑洼以一种可预测的、数学化的方式推动汽车。驾驶员被允许使用一个简单的规则:“如果车向上颠簸,就向下转动方向盘。”这个规则足够简单,如果驾驶员知道全部真相,他们就能计算出完美的转向角度。事实上,完美的转向角度仅比那个能看到一切的最优驾驶员差了约 10.4%。因此,“策略差距”(驾驶员表达能力的限制)是很小的。驾驶员本可以接近完美。
但转折在于:当驾驶员尝试使用标准的“执行者-评论家”(Actor-Critic)方法进行学习时,他们并没有找到那个好的解决方案。相反,他们陷入了一个极其糟糕的解,比他们本可以达到的最佳水平还要差 35%。
为什么乘客在撒谎
为什么学习失败了?论文表明,这并不是因为驾驶员愚蠢。而是因为乘客(评论家)在误导他们,尽管并非有意。
乘客看到了汽车的颠簸。他们知道汽车之所以颠簸是因为隐藏的坑洼,但他们看不见坑洼。他们只看到汽车。对他们来说,这种颠簸看起来像是一场狂暴且不可预测的风暴。因为乘客必须仅根据汽车的位置来编写评分卡,他们必须解释为什么汽车会如此剧烈地颠簸。
由于他们无法说“哦,那是坑洼造成的”,他们便将原因归咎于汽车位置本身。他们认定:“哇,这个位置非常不稳定!如果我们移动哪怕一点点,这里的价值都会大幅下降。”他们在地图上画出了一个极其深邃且狭窄的“谷底”。
驾驶员信任这张地图,心想:“噢不!我需要猛烈且快速地转向,才能留在这一小块安全区域内!”于是,驾驶员将转向过度。他们最终驾驶时的“增益”(转向灵敏度)比实际需要的要大 15 倍。他们是在为一个在地图上看起来比实际情况更可怕的“风暴”做过度反应。
论文精确地计算了这一点。在驾驶员应该停止学习的点上,乘客的地图显示“曲率”(谷底有多陡峭)为 16.7。但如果他们能看到整个世界,真实的曲率其实只有 1.11。这张地图比实际陡峭了 15 倍!驾驶员顺着这个错误一直开到了坠毁。
向前看的魔力
那么,如何修复一个被拿着错误地图的乘客所欺骗的驾驶员呢?论文找到了一个非常具体的“旋钮”可以调节。
在许多学习算法中,乘客不仅看下一步,还会向未来多看一步,以观察得分的变化。这被称为自助步长时界(bootstrap horizon)(或 参数)。
- 如果乘客只看一步(短时界),他们会得到错误的、陡峭的地图,然后驾驶员就会坠毁。
- 如果乘客看得足够远——具体来说,远到足以覆盖隐藏坑洼发挥作用所需的时间——地图就会自我修正。
论文表明,如果你将这个“向前看”的时间设置为与隐藏坑洼的“记忆”相匹配,驾驶员就会停在完美的位置。这就像是告诉乘客:“不要仅仅猜测现在为什么车在颠簸;再等等看颠簸是否会持续。如果持续,那就是路面的问题;如果停止了,那只是个小颠簸。”
深度学习的惊喜
作者不仅仅是在纸上做数学题;他们还用现代深度强化学习(即那种玩电子游戏的 AI)测试了这一点。他们通过展示过去 32 帧的视频给了 AI 一种“记忆”,希望这能帮助它看到隐藏的坑洼。
这里有一个令人惊讶的结果:给 AI 增加记忆并没有帮助。
即使有了视频历史记录,如果“向前看”的旋钮设置错误,AI 仍然会坠毁。无论 AI 有多么高级的大脑或记忆库,如果学习规则(乘客的地图)存在偏差,AI 就会遵循这种偏差。然而,当他们将“向前看”的旋钮调到正确的设置时,即使没有记忆,AI 也能找到好的解决方案。
论文还排除了其他几种可能性。他们检查了是否可能是 AI 需要更多的“探索”(尝试随机动作)来解决问题。他们保持随机噪声的量不变,发现这并不重要;问题仍然在于“向前看”的设置。他们还检查了是否 AI 只需要停止学习得早一点,但数学证明了这是一个结构性问题,而非时间问题。
总结
其核心结论对于我们通常看待 AI 的方式来说是一个冲击。我们通常将“部分可观测性”(失明)归咎于 AI 的大脑不够复杂,无法记住过去。但这篇论文说:不,大脑没问题。 问题在于学习算法将它看到的噪声误解为了信号,创造了一种虚假的危险感,从而驱动 AI 做出过度反应。
解决方案并不一定是给 AI 一个更大的大脑或更好的记忆。解决办法是调整向前看时界(look-ahead horizon),让 AI 等待足够长的时间,以便区分真正的麻烦和暂时的波动。如果你能正确调节这一个旋钮,即使在失明的情况下,AI 也能学会正确的路径。如果你没调好,即使是最聪明的 AI 也会在坚信自己在拯救世界的过程中,把自己开下悬崖。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。