← 最新论文
🤖 machine learning

Understanding and Stabilizing Deep Q-Learning via Controlled Bootstrapping and Regulated Value Dynamics

本文通过识别三个相互作用的误差来源——算子级偏差、估计器敏感性和参数动力学失衡——对深度Q学习的不稳定性进行了统一分析,并提出了一个包含受控自助法、集成分位数估计和基于脉冲的参数调节的稳定框架,该框架在Atari-100K和Procgen基准测试上实现了具有竞争力的性能并提升了训练稳定性。

原作者: Bozhou Chen, Yongyi Wang, Hanyu Liu, Xionghui Yang, Wenxin Li

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Bozhou Chen, Yongyi Wang, Hanyu Liu, Xionghui Yang, Wenxin Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一台计算机正在学习玩电子游戏,它不是通过被告知规则,而是通过尝试各种方法、犯错,并慢慢弄清楚哪些动作会导致得分,哪些会导致失败。这就是深度强化学习(deep reinforcement learning)的核心,在这个领域中,人工智能智能体通过试错来进行学习。这些智能体最常用的学习方式是构建一个关于“价值”的心智地图——即对特定情境有多好以及未来可能带来多少回报的一种猜测。计算机不断地更新这张地图,利用当前的猜测来预测下一步,这个过程被称为“自助法”(bootstrapping)。虽然这种方法已让机器掌握了复杂的游戏,但它有一个臭名昭著的缺陷:学习过程通常是不稳定的。智能体的猜测可能会失控,导致它忘记已学到的知识或做出反复无常的决策,就像一个学生因为对一个新想法过于兴奋,以至于不再听老师讲课一样。

多年来,科学家们一直试图通过归咎于特定的“罪魁祸首”来修复这种不稳定性,例如计算机对获胜机会过于乐观。然而,一项新的研究表明,问题不仅仅是一个坏分子,而是一个涉及三个不同学习系统部分相互作用、自我强化的复杂循环。由北京大学团队领导的研究人员发现,不稳定性源于计算机构建未来预测的方式、它在做决策时如何解释噪声数据,以及其内部记忆结构随时间变化的方式。通过理解这三种相互作用的力量,他们开发出一种新方法来稳定学习过程,使人工智能在数据稀缺的环境中能够学习得更快、更可靠。

研究人员首先仔细观察了计算机如何构建其预测。在标准设置中,人工智能观察一个情境,选择它认为可以做的最佳动作,并利用该动作带来的奖励来更新其地图。团队发现,当人工智能获得正向奖励时,会发生一种奇怪的反馈循环。由于计算机对世界的内部表示在不同动作之间是共享的,针对某一特定动作的奖励可能会意外地在紧接其后的情境中抬高该动作的价值。当计算机随后观察并决定下一步做什么时,它看到了这个被抬高的价值,并再次选择了同一个动作。这创造了一个循环,使计算机不断重复选择同一个动作,并深信这是最佳选择,即使事实并非如此。研究人员称之为“自我强化陷阱”(self-reinforcing trap),这是一种机制,即人工智能陷入了由自身制造的循环,放大自身的偏见,直到学习过程崩溃。

第二个问题在于计算机在数据不完美时如何做出决策。学习是一个充满噪声的过程;计算机对价值的估计永远不会完美精确。当最佳动作与次佳动作之间的差距很小时,哪怕是一点点噪声也会导致计算机改变选择。由于计算机的选择决定了它接下来收集什么样的数据,基于噪声的一个错误决策就可能导致它走向一条糟糕的经历之路。研究人员意识到,这种对噪声的敏感性意味着计算机需要一种能够对其估计更加自信的方法,以确保微小的数据波动不会导致它在不同策略之间剧烈摆动。

第三个问题更为微妙,发生在计算机“大脑”深处,其大脑由被称为参数的数学连接层组成。在训练过程中,特别是当计算机被迫多次重复使用旧数据以提高学习效率时,这些连接会开始发生不平衡的变化。少量的连接会变得极其庞大且占据主导地位,而网络中的其余部分则保持相对较小且不活跃。研究人员引入了一种衡量这种不平衡的方法,称之为“脉冲比”(spike ratio),并发现随着计算机更积极地重复使用数据,这些脉冲会变得更加显著。这种不平衡是危险的,因为它使网络变得僵化;由于其内部结构已经过度特化于看过的旧数据,它失去了适应新情况的能力。

为了解决这些问题,团队设计了一个新的学习框架,充当人工智能的“刹车”和“稳定器”。首先,为了打破自我强化陷阱,他们改变了计算机选择下一步动作的方式。他们没有让同一个网络部分既负责决定动作又负责评估其价值,而是将这些任务分配给不同版本的网络。此外,他们增加了一条规则,防止计算机立即选择刚刚给予其奖励的动作,从而迫使它探索其他可能性,打破放大循环。

其次,为了处理决策中的噪声,团队使用了“集成学习”(ensemble learning)技术。他们不再依赖单个计算机大脑来做出猜测,而是训练了一组略有不同的网络,并让它们对每个动作的价值进行投票。通过平均多个不同网络的意见,单个网络中的随机噪声会被抵消,从而实现更稳定、更可靠的决策。这种方法还使用了“分位数回归”(quantile regression)技术,使计算机能够理解结果的全貌,而不仅仅是一个平均数值,从而进一步降低被异常值误导的风险。

最后,为了防止网络变得僵化,研究人员增加了一个监控系统,观察连接的“脉冲比”。如果他们检测到一小组连接正在变得过大并主导网络,他们会轻轻地将这些特定的连接重置为中性状态。这就像是一种周期性的刷新,清除掉网络记忆中过度生长的分支,使其能够保持灵活性并准备好学习新模式。这确保了即使在被迫大量重复使用数据时,计算机也不会失去适应能力。

团队在两个具有挑战性的环境中测试了这种新方法。第一个环境是一系列经典的视频游戏,其中计算机只能进行10万步操作,与通常需要的方法相比,这是一个非常有限的数据量。在这些测试中,他们的方法优于许多现有技术,实现了更高的分数,并在比测试的其他方法更多的游戏中达到了人类水平的表现。第二个测试涉及一组程序化生成的游戏,其中的关卡是随机创建且每次都会变化的。这里的目标是观察计算机是否能将其学到的知识泛化到从未见过的全新关卡中。新方法表现出了卓越的适应未知挑战的能力,这表明它提供的稳定性有助于计算机建立更稳健的世界观。

研究人员还进行了专门的实验来证明他们的想法确实有效。他们展示了当移除“防止计算机重新选择同一奖励动作”的规则时,在奖励频繁的游戏中学习会变得不稳定。他们证明了使用更大的网络组能持续提高性能,证实了通过投票减少噪声的重要性。他们还追踪了训练期间的“脉冲比”,并表明如果没有他们的重置机制,网络的内部平衡会随着数据的频繁重复使用而恶化。这些发现证实,深度学习中的不稳定性不仅仅是一个需要用单一技巧修复的问题,而是一个需要对预测方式、决策权重以及网络结构维护进行协调处理的系统性问题。

这项工作为为什么深度学习智能体会失效提供了更清晰的图景,并提供了一套实用的工具包来让它们保持正轨。通过认识到不稳定性源于预测偏差、决策噪声和结构僵化之间的相互作用,研究人员超越了简单的修补,转向了更全面的解决方案。他们的方法不仅让人工智能变得更聪明,而且让学习过程本身变得更加可靠,确保智能体即使在数据稀缺或环境混乱的情况下,也能持续有效地学习。随着人工智能继续从玩游戏转向解决机器人技术及其他领域的现实世界问题,稳定这些学习动态的能力对于构建不仅强大而且值得信赖且一致的系统至关重要。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →