← 最新论文
🤖 machine learning

Disentangled Unsupervised Skill Discovery for Efficient Hierarchical Reinforcement Learning

本文提出了解耦无监督技能发现(DUSDi),这是一种通过基于互信息的优化目标和价值分解来学习可重用的、特定因子的技能的新方法,在高效解决下游分层强化学习任务方面显著优于现有方法。

原作者: Jiaheng Hu, Zizhao Wang, Peter Stone, Roberto Martín-Martín

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaheng Hu, Zizhao Wang, Peter Stone, Roberto Martín-Martín

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在教一个机器人开车。在旧的方法中,你会给机器人一个单一的“技能旋钮”。如果机器人把这个旋钮调大,汽车会同时加速、向左转向并闪烁大灯。如果你只想让机器人打开大灯而不改变速度或方向,那简直会是一场噩梦。机器人必须去猜测:“如果我把旋钮转动一点点,也许灯会亮起但车子保持不动?”这就像是在控制一个木偶,拉动一根绳子就会导致全身乱跳。这就是研究人员所说的“纠缠”技能,论文指出,这使得学习新任务变得极其困难且缓慢。

于是有了 DUSDi(解耦无监督技能发现),这是一种全新的方法,它像是一位手持遥控器的顶级木偶师,而这个遥控器上的每个动作都有独立的按钮。DUSDi 没有使用一个巨大的旋钮,而是给了机器人一组独立的“技能按钮”。一个按钮只控制速度,另一个只控制转向,第三个只控制大灯。机器人通过在世界中进行探索,在没有老师或奖励的情况下通过自我尝试来学习这些按钮。

论文的主要发现是,当你教会机器人这些独立的、“解耦的”按钮时,它在日后学习新任务时会变得非常聪明。在一系列计算机模拟实验中——从简单的 2D 射击游戏到复杂的 3D 机器人居家导航——DUSDi 都学会了独立控制这些因素。当研究人员随后要求机器人解决特定的挑战(比如“开车前往红色区域”或“打开电视”)时,使用 DUSDi 独立按钮的机器人比使用旧式“纠缠”旋钮的机器人学得更快,表现也更好。

论文明确反对“单一且混乱的技能变量足以应对复杂工作”这一观点。它表明,当你强迫机器人学习那些“一个变化会影响一切”的技能时,机器人会感到困惑,并难以弄清楚如何组合这些技能来实现新目标。作者通过在四个不同环境中运行 13 种不同的下游任务来衡量这一点。在机器人需要同时操控许多事物的复杂世界中(比如控制 10 个不同的智能体或在凌乱的房间里操作机械臂),旧方法往往会失败或学习得非常缓慢,而 DUSDi 则始终表现优于它们。

论文使用的一个很酷的技巧是一个叫做“互信息”的数学“计分卡”。你可以把它想象成一场游戏:如果机器人能让某个特定按钮(比如“速度”按钮)改变速度,它就会获得分数;但如果同一个按钮意外地改变了转向或灯光,它就会被扣分。机器人通过保持技能的完美分离来最大化其得分。为了让这个学习过程更快且更稳定,研究人员将机器人的“价值”计算分解成了更小的部分,即为每个按钮各设一个部分,而不是试图一次性猜测整个混乱整体的价值。这有助于机器人更稳定地学习独立的技能,尤其是在规模更大、更复杂的模拟实验中。

论文还测试了当机器人只能通过摄像头(像素)而非精确的世界数值来“观察”世界时,这种方法是否依然有效。通过先使用一种特殊的图像读取工具,DUSDi 仍然能够学习这些独立的技能并解决任务,而其他方法在仅有图像的情况下甚至无法开始。

然而,作者也谨慎地指出,这种方法依赖于机器人能够获得世界的“分解”视图——这意味着它需要能够将世界视为独立的各个部分(如速度、方向和大灯),而不是仅仅一个模糊的色块。虽然他们展示了通过先提取这些部分,该方法可以处理图像,但他们也暗示,对于那些机器人无法轻易分离因素的、非常混乱的现实世界环境,该方法可能需要帮助。但在他们测试的模拟世界中,结果是明确的:相比于给机器人一个单一且纠缠在一起的旋钮,赋予机器人一组独立的、解耦的技能,是为现实世界做好准备的一种更好的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →