想象一下,你正在教一个机器人穿越一个巨大且令人困惑的迷宫。这个机器人非常聪明(它使用“深度强化学习”),但它是通过试错来学习的。它必须撞墙、尝试死胡同,并等待非常长的时间才能获得一次“做得好”的奖励。如果迷宫巨大或奖励稀少,机器人可能永远无法破解,或者需要尝试数百万次。
本文提出了一种方法,为机器人提供一份由简单逻辑规则组成的“作弊表”,同时不强迫它盲目遵循这些规则。作者称这种方法为“神经符号”方法,这只是一个花哨的说法,意指他们将机器人的“大脑”(神经网络)与“规则手册”(符号逻辑)相结合。
以下是他们如何使用两种不同方法来实现这一点的:
两种方法:“轻推”与“教练”
研究人员采用了一种现有的、流行的学习算法,称为PPO(近端策略优化),并以两种不同的方式加入了他们的逻辑规则。
1. H-PPO-Product:“轻推”(采样偏差)
这就像一位友好的向导站在机器人身边的每一个十字路口。
- 工作原理:当机器人准备选择一条路径时,向导会说:“嘿,根据我们已知的规则,这条路径看起来很有希望。”
- 技巧:向导并不强迫机器人走那条路。相反,它只是让那条路径被选中的可能性略微增加。这就像在秤上加了一点重量。
- 逐渐淡出:在训练开始时,向导非常大声且乐于助人。但随着机器人自行学习得越来越多,向导的声音逐渐变小,直到完全消失。这确保了机器人最终学会自行探索,而不是永远只听从指令。
- 最佳适用场景:帮助机器人在巨大、空旷的迷宫中脱困,在那里它需要快速找到任何一条好路径。
2. H-PPO-SymLoss:“教练”(损失正则化)
这就像一位严格的教练在机器人完成一次奔跑后检查它的作业。
- 工作原理:机器人尝试解决迷宫。之后,教练查看机器人的选择并说:“你做得不错,但请记住规则:‘如果你看到红门,先别打开。’你违反了那条规则,所以我要在你的分数上增加一个小惩罚。”
- 技巧:这个惩罚被加入到机器人的学习数学计算中。它温和地推动机器人的大脑调整其内部设置,以便在未来减少“违反规则”的错误。
- 最佳适用场景:在机器人已经开始学习后进行微调。它帮助机器人变得非常精确和高效,但在机器人完全迷失的初期,它帮助不大。
实验:三种不同的迷宫
团队在三种不同类型的“迷宫”(计算机模拟)上测试了这些方法:
- DoorKey(门与钥匙):一个网格世界,机器人必须找到特定的钥匙来打开特定的门。
- 结果:“轻推”方法在这里表现出色。在最困难的版本(大网格、多把钥匙)中,标准机器人陷入了困境,但“轻推”机器人迅速找到了解决方案。“教练”方法起步较慢,但最终赶了上来。
- OfficeWorld(办公室世界):一个包含办公室、邮件、咖啡和植物的网格。机器人必须按特定顺序访问地点(例如,先拿咖啡,再取邮件),同时不能撞到植物。
- 结果:“教练”方法在这里大放异彩。一旦机器人开始学习,“教练”就帮助它完善了例行程序,取得了最高分。“轻推”方法起步很快,但后来卡在较低的分数上。
- WaterWorld(水世界):一个连续空间,里面有不同颜色的移动球体。机器人必须按特定颜色顺序击中它们。
- 结果:这是最难的测试。“轻推”方法是唯一能够成功导航复杂序列的方法。“教练”方法在这里实际上很吃力,因为规则对于机器人自行掌握复杂动作来说过于严格。
主要启示
本文的主要观点是,你不需要成为完美的专家来帮助机器人学习。作者表明,即使他们给机器人的“规则手册”不完美,或者仅从游戏的简单版本中学习而来,它仍然能帮助机器人更快地学习困难版本。
- 如果你需要在巨大、空旷的空间中快速起步:使用轻推(H-PPO-Product)。
- 如果你需要优化性能并获得最高分:使用教练(H-PPO-SymLoss)。
通过将逻辑规则与标准人工智能学习相结合,他们使机器人学得更快,使用了更少的尝试(样本),并解决了标准机器人通常会放弃的问题。他们这样做无需在每次游戏变难时不断调整机器人的设置。
以下是论文《样本高效的神经符号近端策略优化》的详细技术总结。
1. 问题陈述
深度强化学习(DRL),特别是近端策略优化(PPO)等算法,在稀疏奖励环境中面临长规划视野和多个子目标的重大挑战。
- 样本效率低:智能体需要海量的交互数据才能收敛,导致训练成本高昂且缓慢。
- 黑盒性质:神经策略缺乏可解释性和形式化保证。
- 现有解决方案的局限性:
- 奖励塑形(例如奖励机): 通常计算成本高昂,且对不准确的启发式规则高度敏感;糟糕的启发式规则会损害性能。
- 纯神经方法: 缺乏直接将人类可读的领域规则整合进来的机制。
- 纯符号方法: 由于难以准确定义策略搜索空间,难以扩展到复杂领域。
作者提出了一种神经符号框架,该框架将在简单实例中学习到的部分逻辑策略规范迁移过来,以指导更复杂、更具挑战性的环境中的学习,从而在不重新调整超参数的情况下提高样本效率。
2. 方法论
核心创新是一种PPO 的神经符号扩展,它利用符号策略(πsym)。该策略是一组逻辑规则(霍恩子句),将环境特征(谓词)映射到动作项。一个在线推理机制将原始观测值转化为高层逻辑谓词,并将其与 πsym 进行比对,以推导出有希望的动作。
本文介绍了两种不同的集成策略,将这种逻辑指导注入到 PPO 循环中:
A. H-PPO-Product(动作级偏差)
- 机制:在训练阶段修改动作采样分布。
- 实现:
- 在每个时间步,根据动作是否被 πsym 逻辑蕴含,对神经策略的动作概率进行重加权。
- 重加权项 mt(a,s) 通过受置信度参数 λ 和退火因子 ϵt 控制的因子,增加逻辑建议动作的概率。
- ϵt 遵循线性衰减计划,开始时较高以鼓励由逻辑引导的探索,并随着训练的进行衰减至零。
- 目标:使早期阶段的探索偏向于逻辑上合理的轨迹,允许智能体随着神经策略学习真实的环境动力学,而忽略不完美的符号建议。
B. H-PPO-SymLoss(优化级正则化)
- 机制:用符号正则化项增强PPO 损失函数。
- 实现:
- 基于符号指示器构建参考策略 πref,将更高的概率质量分配给逻辑蕴含的动作。
- 计算当前神经策略与该符号参考策略之间的比率 ρtsym(在此特定项中,用其替换比率中的标准 πold)。
- 将符号辅助损失 Lsym(结构类似于截断的 PPO 代理)添加到总损失函数中,并由参数 Θ 加权。
- 与 H-PPO-Product 类似,权重 Θ 可以随时间退火。
- 目标:作为正则化器,在优化过程中使神经策略与逻辑约束保持一致,防止策略偏离到次优区域,即使符号规则不完美。
3. 主要贡献
- 神经符号 PPO 框架:一种新颖的方法,利用部分逻辑规则引导 PPO 智能体,使用采样偏差(H-PPO-Product)或优化惩罚(H-PPO-SymLoss)。
- 对不完美知识的鲁棒性:这些方法旨在处理从简单任务诱导并迁移到更难任务的逻辑规则,即使这些规则不完整或不完美。
- 无需重新调整超参数:该框架允许扩展到更大、更复杂的领域,而无需重新调整 PPO 超参数,因为符号指导会自动调整学习过程。
- 实证验证:在三个标准网格世界基准(DoorKey, OfficeWorld, WaterWorld)上进行了广泛评估,证明了其优于普通 PPO 和奖励机基线的性能。
4. 实验结果
作者在具有不同复杂度(网格大小、钥匙数量、序列长度)的三个基准上评估了他们的方法:
DoorKey(带钥匙/门的导航):
- H-PPO-Product 作为探索驱动表现出色,实现了最快的收敛和最高的回报,特别是在最具挑战性的 16x16 网格和 4 把钥匙的设置中。
- H-PPO-SymLoss 达到了高回报,但收敛较慢。
- 奖励机(RM) 基线在 4 钥匙设置中完全失败(零回报),突显了奖励塑形在复杂稀疏奖励任务中的脆弱性。
OfficeWorld(顺序子目标):
- H-PPO-Product 显示出快速的初始学习,但在复杂任务(如 DeliverCoffeeAndMail)中回报略低并趋于平稳。
- H-PPO-SymLoss 起步较慢,但作为强大的策略正则化器,最终通过更有效地塑造策略,实现了最高的最终回报。
WaterWorld(连续 2D 物理/序列):
- 在复杂序列任务(如 RedGreenAndBlueCyanAndMagentaYellow)中,H-PPO-Product 是唯一成功穿越稀疏奖励空间并达到高回报的方法。
- H-PPO-SymLoss 在此处表现挣扎,证实了其优势在于策略巩固,而非从头开始启动复杂的探索序列。
性能总结:
- H-PPO-Product:最适合稀疏、长视野任务中的探索。
- H-PPO-SymLoss:最适合在已发生一定探索的任务中进行策略细化并最大化最终回报。
- 两种方法均一致优于普通 PPO 和奖励机。
5. 意义
本文解决了 DRL 中的一个关键瓶颈:复杂稀疏奖励领域中的样本效率。通过将符号推理直接集成到 PPO 算法结构中(而不仅仅是作为奖励塑形器),作者证明了:
- 逻辑先验可以显著加速学习,同时不牺牲神经网络的灵活性。
- 将逻辑规则从简单任务迁移学习到复杂任务是可行且有效的。
- 不同的集成策略(采样偏差与损失正则化)发挥不同的作用,为从业者提供了一套工具,以便根据是需要更好的探索还是更好的策略收敛来选择正确的方法。
这项工作弥合了符号 AI 的可解释性与深度强化学习的可扩展性之间的差距,为现实应用中更稳健、更具泛化能力的智能体铺平了道路。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。