Noisy-Space Policy Gradient for Diffusion Policies in Offline Reinforcement Learning
本文介绍了噪声空间策略梯度(Noisy-Space Policy Gradient, NSPG),这是一种新颖的框架,通过在扩散潜变量上推导出一个 KL 正则化目标函数,使得在优化时可以使用干净动作空间的价值估计,而无需通过去噪过程进行反向传播,从而实现了基于扩散策略的高效离线强化学习。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,存在着一个被称为“离线强化学习”(offline reinforcement learning)的持久挑战。想象一名学生试图学习玩一款复杂的电子游戏,但他被禁止触摸控制器。他只能观看其他玩家录制的数小时视频,其中有些人是专家,而有些人则经常犯错。目标是学习一种比视频中的人获胜频率更高的策略,同时绝不能冒险尝试可能导致失败的新动作。这之所以困难,是因为人工智能必须从一组固定的数据中学习,而没有试错带来的安全保障。如果人工智能猜出了一个在录像中从未出现过的动作,它可能会遭遇灾难性的失败,因为它无法得知这个动作究竟是好的,还是仅仅是一个危险的幻觉。
为了解决这个问题,研究人员转向了一种被称为“扩散策略”(diffusion policy)的人工智能模型。这类模型非常擅长理解复杂的模式,例如人类手部抓取工具的多种不同方式,或者机器人穿越迷宫的路径。它们的工作原理是从一个混乱、多噪声的猜测开始,通过一步步的细化,直到变成一个清晰、可用的动作。然而,在试图教导这些模型如何获胜时,产生了一个根本性的问题:模型在隐藏且充满噪声的空间中做出决策,但它接收到的奖励是基于它最终采取的那些清晰动作。这就像是通过观察学生凌乱、涂改的草稿,而不是看最终润色后的成品,来给学生的作文评分一样。反馈循环因此断裂,人工智能难以学习哪些隐藏步骤导致了成功。
一支研究团队现在通过一种名为“噪声空间策略梯度”(Noisy-Space Policy Gradient)的新方法弥合了这一差距。他们并没有试图让隐藏的噪声步骤直接匹配最终奖励,而是创造了一种为这些隐藏步骤分配价值的新方法。他们意识到,一个单一的噪声猜测并不对应于仅仅一个最终动作,而是对应于可能由此产生的整个动作云。通过计算从特定噪声猜测中可能产生的各种清晰动作的平均奖励,他们为该猜测创建了一个公平且准确的分数。这个分数告诉人工智能,基于其可能产生的潜在结果,某个特定的隐藏步骤究竟有多好,而不是强迫它去承诺一个单一的、可能是错误的最终答案。
研究人员在各种任务上测试了这种方法,范围从简单的机器人运动到复杂的视觉谜题。在这些实验中,新方法始终优于以往的技术,尤其是在数据稀疏或任务需要长链条精确动作的困难场景下。例如,在涉及穿越大型迷宫或操纵精细物体等任务时,新方法的成功率显著高于早期模型。它在处理人工智能必须在常见、安全的动作与罕见、高回报的动作之间进行选择时表现得尤al 尤其有效,而这种选择往往会让旧模型感到困惑。通过观察全范围的可能性而非单一路径,人工智能学会了更可靠地瞄准高回报的结果。
这项工作的最显著方面之一是它如何处理人工智能的内部思维过程与现实世界之间的关系。以往的方法通常试图直接评估人工智能的隐藏步骤,这会导致混乱和不稳定。另一些方法则试图简化人工智能的思维过程以使其更容易评估,但这往往剥夺了使人工智能变得强大的复杂性。新方法通过将评估严格限制在现实动作的世界中,同时允许人工智能以其复杂的噪声方式进行思考,从而避免了这些陷阱。它扮演着一个翻译者的角色,确保人工智能接收到的反馈始终植根于现实,即使人工智能是在隐藏空间中学习。
研究结果表明,这种方法为利用历史数据训练先进的人工智能系统提供了坚实的基础。研究人员发现,该方法保持了稳定性和高效性,仅需少量的计算即可估算每个步骤的价值。这种效率至关重要,因为这意味着该方法可以应用于大型复杂问题,而不会变得过于缓慢而失去实用性。团队还探索了系统对不同设置的敏感度,发现它在广泛的条件下都能良好运行,无需不断的、精细的调优。这种鲁棒性使其成为未来机器人技术和自动化领域的有力工具,在这些领域,从过去的数据中学习往往是唯一的选择。
最终,这项工作解决了人工智能如何从经验中学习的一个长期脱节的问题。它证明了,通过正确理解隐藏思维与可见动作之间的关系,我们可以教导复杂的系统在不脱离其训练数据范围的情况下实现进步。该方法并不依赖于魔法或猜测,而是依赖于对噪声如何转化为动作的清晰数学理解。随着人工智能领域的不断演进,能够安全且有效地从过去学习的方法对于构建既强大又可靠的系统至关重要。这种新技术提供了一种有原则的途径,将从静态数据中学习的混乱过程转变为通往更好决策的清晰路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。