← 最新论文
🤖 machine learning

ReBRAC-v2: The Return of the King

ReBRAC-v2 表明,通过特定的工程选择——例如正规化流策略、混合行为正则化以及阶段性优化——对传统的行为正则化演员-评论家算法进行系统性的现代化改造,可以在无需针对特定任务进行结构性改变的情况下,使用单一且可迁移的配置,在多种离线强化学习基准测试中实现最先进的性能。

原作者: Denis Tarasov, Robert K. Katzschmann

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Denis Tarasov, Robert K. Katzschmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:机器人不再通过在现实世界中不断试错来学习走路、跳舞或踢足球,而是通过研读一本庞大的过往视频库来进行学习。这就是**离线强化学习(Offline Reinforcement Learning)**的领域。在现实世界中,一个学习走路的机器人可能会摔倒上千次,折断它的腿并浪费数小时。但在这一数字图书馆中,机器人可以从一组关于“优秀”动作的固定数据集中学习,而无需承担哪怕一次跌倒的风险。但问题在于,这个机器人有点像个“书呆子”;它害怕尝试任何不在书本中的新动作。如果它猜出了一个不在库中的动作,它可能会得到一个极差的分数,因为它无法判断这个猜测是否真的安全。

多年来,科学家们一直试图制造出能够阅读这些书籍,并能据此发明出比库中动作更优异的新动作的“超级智能”机器人。为了实现这一目标,许多研究人员一直在构建极其复杂的机器——想象一下它们是巨大的、多层结构的工厂,拥有传送带、蒸馏罐和辅助策略车间。这些机器试图通过生成数千种可能性,并通过复杂的价值系统进行过滤,来猜测最佳动作。但一个核心问题仍然存在:我们真的需要这样一座庞大且复杂的工厂才能获得出色的结果吗?或者说,一个仅仅是用现代工具进行了升级的、更简单且更有纪律性的车间,是否也能胜任这项工作?

ReBRAC-v2 应运而生,它提出了一个大胆的问题:“如果我们不再致力于建造更大的工厂,而是仅仅升级我们现有车间里的工具呢?”来自苏黎世联邦理工学院(ETH Zurich)的研究员 Denis Tarasov 和 Robert K. Katzschmann 决定对一种被称为“行为正则化演员-评论家”(behavior-regularized actor-critic)的传统且直接的方法进行一次严肃且系统的升级。他们并没有发明一种全新的复杂算法,而是使旧算法实现了现代化。他们用一种被称为**正规化流(normalizing flow)**的强大数学工具替换了机器人的“大脑”(演员),这就像一张超级智能的地图,能够瞬间生成完美的动作,同时精确知道这些动作有多大的概率是优秀的。他们还增加了一个“残差评论家”(一个为动作评分的裁判),该裁判利用一种巧妙的分类技巧来提高准确性,并引入了一种“阶段式训练”计划,这就像是在让学生跑步之前先教他们走路。

这种“现代化配方”的结果令人瞩目。在十个不同的挑战性机器人任务(从迷宫导航到物体操控)中进行测试时,这种精简的方法不仅跟上了步伐,而且占据了统治地位。新方法 ReBRAC-v2 取得了 74.8 的平均分,打破了之前 52.3 的最高综合得分纪录。它在十个类别中的八个类别中排名第一。更令人印象深刻的是,这并非针对每个任务进行专门调优的案例。团队发现了一套“共享配方”(一组特定的设置),它几乎适用于所有任务,仅需两个微小的调整即可适应不同的环境。他们在其他著名的机器人数据集(AntMaze 和 Adroit)上测试了同一套配方,结果依然名列前茅,分别取得了 90.233.6 的高分。

论文指出,成功的秘诀不在于增加复杂度,而在于“纪律严明的工程设计”。通过仔细结合几种现代技术——例如使用正规化流来同时生成动作并检查其可能性,以及使用一个多步骤的“精炼”过程(即机器人在行动前会反复核实其最佳猜测)——他们在没有放弃传统学习那简单、可靠的基础之上,实现了最先进的性能。虽然他们承认仍存在一些谜题(例如在某个特定的“立方体双重”任务中机器人表现不佳),但整体信息非常明确:有时,最强大的工具并非一项新发明,而是一个经过精心调优、现代化的旧有经典版本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →