← 最新论文
🤖 machine learning

Conservative Query and Adaptive Regularization for Offline RL Under Uncertainty Estimation

本文提出了一种名为“不确定性估计下的保守查询与自适应正则化”的轻量级框架,该框架利用 Morse 网络来估计动作不确定性,从而引导信息丰富的偏好查询并动态调整数据级约束,进而提升在 D4RL 基准测试上的离线强化学习性能。

原作者: Li-Rong Zhou, Qin-Wen Luo, Sheng-Jun Huang

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Li-Rong Zhou, Qin-Wen Luo, Sheng-Jun Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正试图教一个机器人走路,但你不能让它在现实世界中练习。也许这太昂贵了,或者太危险了,又或者机器人可能会弄坏东西。相反,你给了机器人一个关于别人走路的巨大视频库。这就是**离线强化学习(Offline Reinforcement Learning)**的世界。机器人必须仅仅通过观看这些旧视频来学习策略,而无需亲自迈出一步。棘手的部分在于,机器人可能会尝试模仿它在视频中看到的某个动作,但如果它尝试做一些与视频库中略有不同的动作,它可能会感到困惑或摔倒。这被称为“分布偏移(distribution shift)”问题:机器人在对它从未见过的事物进行猜测。

为了让机器人变得更聪明,科学家们有时会允许它向人类专家寻求帮助。想象一下机器人说:“我应该向左迈步还是向右迈步?”然后专家说:“向左更好。”这被称为动作偏好查询(action preference query)。这就像是在不需要亲自去尝试那个动作的情况下,获得一个提示。然而,这里有一个陷阱:如果机器人询问的是一个过于古怪或远离它在视频中所见内容的动作,专家的建议实际上可能会干扰机器人的内部数学逻辑,让它学到错误的东西。大问题在于:我们如何在不让机器人陷入麻烦的情况下,询问正确类型的帮助?

这篇论文介绍了一个名为 CQ2L(保守查询 Q 学习,Conservative Query Q-Learning)的巧妙新系统来解决这个难题。作者——来自南京航空航天大学的周礼荣、罗钦文和黄胜军——意识到以前的方法有点过于鲁莽。以前的方法会对机器人想出的任何动作寻求建议,即使那个动作对于训练视频来说完全是陌生的。这经常导致机器人因为错误的建议而变得“醉态蹒跚”并跌跌撞撞。

作者提出了一个由两部分组成的“安全网”来解决这个问题。首先,他们使用了一个特殊的工具,叫做莫尔斯神经网络(Morse neural network)。你可以把它想象成一个“古怪检测器”。在机器人请求帮助之前,这个检测器会检查:“这个新动作是我们以前见过的,还是完全陌生的?”如果这个动作太陌生(即分布外),系统就会说:“不,不要问那个;那太冒险了。”它只允许机器人询问那些接近视频库中动作的动作。这就是保守查询(Conservative Query)

其次,即使机器人得到了好的建议,系统也需要知道该听取多少。作者创建了一个**自适应正则化(Adaptive Regularization)**系统。想象一下机器人有一个调节专家建议“音量”的旋钮。如果机器人正在做一些非常熟悉(安全)的事情,音量会被调低,因为机器人仅凭视频数据就能学得很好。但如果机器人正在尝试一些稍微新颖但仍然安全的事情,音量会被调高,以让专家的建议起到引导作用。如果机器人尝试危险的行为,系统会将音量调到最大,以迫使其回归安全。这种动态调整防止了机器人变得过于固执或过于容易被左右。

研究人员在名为 D4RL 的著名基准测试上测试了这个想法,该测试包括让虚拟猎豹奔跑或让蚂蚁在迷宫中导航的任务。他们将他们的方法与其他顶尖算法进行了比较。结果表明,他们的“智能提问”方法比标准的离线学习效果更好。事实上,它的表现甚至达到了、有时甚至超过了那些被允许在现实世界中练习很长时间的方法,但它们使用的“提问”次数要少得多(相比于其他方法需要 250,000 步现实世界的练习,它们仅用了 90,000 次偏好查询)。

论文明确反对那种仅仅针对任何随机动作寻求建议的旧方法,指出这会导致学习不稳定和糟糕的结果。他们认为,通过谨慎对待询问什么以及如何倾听,你可以获得两全其美的方法:既拥有从静态库中学习的安全性,又拥有专家指导带来的提升,同时避免了机器人崩溃的风险。他们在 D4RL 基准测试上的实验表明,这种方法是让离线学习变得更聪明、更可靠的一种稳健且可靠的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →