← 最新论文
🤖 machine learning

Gated Q-learning: Add Off-Policy Bias to Taste

门控 Q 学习通过引入一种在 Watkins 和 Peng 的 Q(λ\lambda) 极端情况之间进行平滑插值的创新门控机制,解决了强化学习中长期存在的离策偏差与信用分配长度之间的权衡问题,从而在不依赖重要性采样的情况下实现更快的学习并控制偏差。

原作者: Brett Daley

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Brett Daley

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人通过迷宫寻找隐藏的宝藏。机器人通过尝试来学习:它移动、撞到墙壁、遇到死胡同,偶尔还会撞见金子。这个过程被称为强化学习(Reinforcement Learning)。机器人的目标是弄清楚哪些动作能在一段时间内带来最多的宝藏。其中一个关键部分是信用分配(Credit Assignment):弄清楚在一段漫长的旅程中,究竟是哪些具体的步骤导致了最终的奖励。是机器人因为最后一次转弯得到了金子,还是因为它在十分钟前做了一个聪明的举动?

为了学得更快,机器人通常会使用一种技巧叫做 Q学习(Q-learning)。机器人不会等到游戏结束才学习,而是在每一步之后都会更新自己的知识,利用它对未来的预判来推测当下的价值。然而,这里有一个陷阱。机器人在探索(尝试随机动作)时进行学习,但它又想表现得像一个完美的、贪婪的专家,即绝不犯错。这产生了一种冲突:如果机器人从它为了观察情况而做的随机、“愚蠢”的动作中学习,它可能会不小心教给自己坏习惯。几十年来,科学家们一直处于一个两难境地:要么在机器人做出“愚蠢”动作时停止学习(这很安全但极其缓慢),要么从所有动作中学习(这很快,但有风险,因为机器人可能会从自己的错误中学习)。

这篇论文介绍了一种巧妙的新方案,叫做门控 Q 学习(Gated Q-learning)。作者 Brett Daley 提出了一种拥有“两全其美”的方法。与其使用一个严格的“开/关”开关,不如引入一个“门”或一个调光器。当机器人做出一个愚蠢的、探索性的动作时,门并不会砰地关上;而是部分关闭。这使得机器人能够从长链条的事件中持续学习,而不至于被自己的随机实验所迷惑。通过计算机模拟,论文表明这种“恰到好处”的方法比旧的极端方法学得更快,找到了一个既能快速学习又不会犯太多错误的平衡点。

问题所在:“全或无”的困境

想象你是一名正在训练足球运动员的教练。球员正在学习比赛,但他们也在尝试一些奇怪的新踢法,以看看效果如何。

  • 方法 A(严厉的教练): 每当球员尝试一个奇怪的、实验性的踢法时,教练就会大喊:“停!忘掉那个!”并重置训练。这是安全的,因为球员永远不会从一个错误的动作中学习,但他们学习得极其缓慢,因为他们大部分时间都在停止和重置。这就像是 Watkins' Q(λ)
  • 方法 B(宽容的教练): 教练允许球员继续进行,即使是在一个糟糕的、实验性的踢法之后。他们会说:“好吧,那次踢法很烂,但让我们看看接下来会发生什么!”这很快,因为球员可以保持移动,但如果他们后来运气好,他们可能会误以为“糟糕的踢法其实也可以”。这就像是 Peng's Q(λ)

三十年来,教练们(或 AI 研究人员)必须在过于严厉且缓慢,或过于宽容且冒险之间做出选择。现代解决此类问题的尝试通常涉及复杂的数学,称为“重要性采样(importance sampling)”,但当机器人试图成为一个贪婪、完美的专家时,这些数学工具就会失效。这就像是用一个复杂的秤去称一根羽毛;这个工具并不适用于这项特定的工作。

解决方案:“门”

论文介绍了 Gated Q-learning,它就像一个智能、可调节的门,位于教练和球员之间。

它不是一个硬性的“停止”或“全速前进”,而是一个调光器。当球员做一个标准的、聪明的动作时,门是完全敞开的(全量学习)。但当球员做一个奇怪的、实验性的动作时,门并不会完全关闭。相反,它会部分关闭。

把它想象成一根水管。

  • 严厉的教练会在水看起来有点浑浊时完全关闭水管。
  • 宽容的教练会让浑浊的水淹没整个系统。
  • Gated Q-learning 在水管里放了一个过滤器。如果水很浑浊(来自实验性动作),过滤器会让一部分水流过,但会对其进行一定的净化。它会说:“好吧,我们会从这个动作中学到一点,但不会像对待一个完美动作那样多。”

这个“门”由研究人员称为 χ (chi) 的数值控制。

  • 如果 χ = 0,门会在坏动作面前紧闭(就像严厉的教练)。
  • 如果 χ = 1,门会保持完全敞开(就像宽容的教练)。
  • 如果 χ = 0.5,门是半开的,允许适量的学习通过。

他们的发现

作者在一个简单的“随机游走”(一个有 19 个位置的直线,机器人必须找到正确的一端)的计算机模拟中测试了这个想法。他们运行了数千次实验,改变了机器人学习的速度、回溯多远以及门开启的程度。

以下是模拟结果所示:

  1. 存在“甜点位(Sweet Spot)”: 当门的设置处于“中等”水平(大约 χ = 0.45)时,机器人的学习速度最快。它既没有完全敞开,也没有完全关闭。
  2. 更快的学习速度: 通过使用这个中等强度的门,机器人的学习速度明显快于严厉型和宽容型教练。它可以回溯更久的时间来弄清楚是什么导致了奖励,而不会被自己的随机实验所迷惑。
  3. 鲁棒性(Robustness): 结果出人意料地具有包容性。即使门的设置不是完美的数字,只要它处于中间位置(0.2 到 0.6 之间),机器人仍然能学得非常好。

魔法背后的理论

论文不仅展示了它有效,还通过数学证明了它为什么有效。他们证明了这种“门控”方法是一种收缩映射(contraction mapping)。简单来说,这意味着每次机器人更新知识时,它在数学上都会向真相靠近,并且永远不会陷入循环或变得失控。

他们还证明了机器人最终会稳定在一个特定的“不动点(fixed point)”。这个不动点并不是完美的专家(因为机器人仍然从错误中学习了一点点),但它是一个非常优秀的专家,其学习速度比那些拒绝从错误中学习的专家要快得多。数学证实,通过调整这个门,你可以精确控制你愿意接受多少“偏差(bias)”(即从错误中学习)以换取更快的学习速度。

这为什么重要

这篇论文表明,我们不必在 AI 训练中选择安全或速度。通过简单地添加一个“门”来部分过滤掉探索过程中的噪声,我们可以构建出能从长链条事件中高效学习的智能体。虽然这是在简单的模拟中进行的测试,但作者认为这种方法可以很容易地应用到更复杂的 AI 系统中(例如用于视频游戏或机器人技术的系统),使它们在不需要复杂的重要性采样数学的情况下学得更快。这是一个简单、优雅的改进,解决了困扰 AI 研究人员 30 年之久的难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →