← 最新论文
🤖 machine learning

Endpoint Replay: Compressing the Recency Buffer in Deep Reinforcement Learning

本文介绍了“端点重放”(Endpoint Replay),这是一种通过存储连接的 n 步序列端点的代表性转换来压缩经验回放缓冲区的策略,在实现与传统大型缓冲区相当的性能的同时,将存储需求降低了一个数量级。

原作者: Parham Mohammad Panahi, Armin Ashrafi, Haoyu Du, Andrew Patterson, Martha White, Adam White

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Parham Mohammad Panahi, Armin Ashrafi, Haoyu Du, Andrew Patterson, Martha White, Adam White

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人正在学习玩电子游戏。为了变得优秀,它需要练习,但它不能仅仅依赖于过去几秒钟发生的事情;它需要记住几小时前的教训。在人工智能的世界里,这个记忆库被称为“经验回放缓冲池”(experience replay buffer)。你可以把它想象成一个学生的笔记本,他在上面记录下自己做的每一个动作、得到的得分以及随后发生的事情。大多数现代 AI 机器人使用一个巨大的笔记本——通常包含一百万条记录——以确保它们不会忘记重要的内容。它们通过随机翻阅这个笔记本,从过去的错误和胜利中学习。但问题在于:存储一百万条记录需要消耗大量的计算机内存和能量。科学家们一直在问一个简单的问题:我们能否把这个笔记本缩小到极小的尺寸,同时又不让机器人忘记如何玩游戏?

你即将阅读的这篇论文正是在解决这个问题的。它引入了一种巧妙的新方法来压缩这种记忆,证明了 AI 使用比标准版本小 10 到 50 倍的笔记本也能学得一样好。研究人员发现,如果你只是从一个巨大的笔记本中随机挑选一些“重要的”页面来保留,机器人会感到困惑,因为这些页面之间无法相互连接。他们的解决方案是什么?他们不再保留孤立的页面,而是保留将事件连接在一起的“链条”,确保每一课都能逻辑严密地引向下一课。通过使用一种特殊的数学技巧来处理时间上的间隙,他们成功地将庞大的记忆压缩进了一个极小的空间,让机器人在不损失技能的前提下,学习得更快、成本更低。

问题所在:装满零散页面的笔记本

多年来,教导 AI 智能体(例如那些玩 Atari 游戏的智能体)的标准配方是保留一个巨大的“先进先出”(FIFO)缓冲池。想象一条传送带,新的经验从前端滑入,旧的从后端掉落。这条传送带通常长达一百万步。AI 从这条传送带上随机抽取页面来进行学习。这种方法有效,但非常臃rx。

研究人员以前也尝试过缩小这条传送带。有些人尝试只保留“最重要的”页面,这种技术被称为核心集(coreset)。其核心思想是挑选出最好、最具代表性的经验,然后扔掉其余的部分。然而,本文的作者发现这种方法存在一个隐藏的缺陷。

当你从一段漫长的历史中随机抽取孤立的页面时,你往往会得到这样一个页面:“我做了这个动作,然后我落在了这个状态。”但如果你扔掉了中间所有的页面,AI 就永远无法真正学习到那个落点状态内部发生了什么。这就像在读一本连环画,你只保留了场景的第一帧和最后一帧。你看到了英雄跳跃,然后看到了他们着陆,但你完全不知道他们是如何到达那里的,或者着陆时的感觉如何。用 AI 的术言,这种“自助目标值”(bootstrap target,即 AI 试图预测下一步的数值)变得脱锚了(unanchored)。AI 正在猜测一个它在当前微小的记忆中从未实际更新或观察过的状态的数值。这会导致错误的猜测和糟糕的表现。

解决方案:端点回放(Endpoint Replay)

作者提出了一种名为端点回放(Endpoint Replay)的新方法。他们不再保留孤立的页面,而是保留链条

想象你正在将一部长电影压缩成精彩片段集。你不是随机挑选帧,而是选取一个起始帧,跳过 10 帧,然后将中间发生的整个序列的奖励记录为一个单一的“摘要”。你保留起点和终点,但通过这段跳跃期间获得的累计总分将它们连接起来。

以下是他们在系统中的运作方式:

  1. 两个缓冲池:AI 保留一个小的“近期缓冲池”(最后 10,000 步)用于即时学习,就像一个标准的笔记本。
  2. 滞后缓冲池(The Lag Buffer):当旧数据从近期缓冲池中掉出时,它并不会被直接删除。它会进入一个大约持有 10 个步骤的微型“滞后缓冲池”。
  3. 链条:一旦滞后缓冲池满了(或回合结束),AI 会计算这 10 个步骤的总奖励,并创建一个单一的“n 步转换”。它存储起始状态、结束状态以及期间赚取的总奖励。
  4. 核心集:这些“链式”摘要被存储在第二个稍大的缓冲池中,称为核心集

神奇之处在于,核心集中的每一个结束状态也是另一个链条的起始状态。这意味着 AI 永远不需要去猜测一个它未曾见过的状态;每一个“着陆”都被一个同样存在于记忆中的“起飞”所锚定。即使中间的步骤消失了,连接性依然得以保留。

修复“旧闻”偏差

还有一个障碍。由于这些链条是由旧版本的 AI 收集的数据构建的(因为智能体会不断进步),链条中的奖励可能看起来比当前更聪明、更强大的 AI 所能实现的要“悲观”或偏低。

为了解决这个问题,作者使用了名为**期望 Sarsa(Expectile Sarsa)**的数学工具。

  • 标准学习试图寻找平均奖励。
  • **期望(Expectile)*学习则像是一个“悲观过滤器”。它专注于那些比平均水平更好*的奖励,有效地告诉 AI:“不要仅仅满足于中间值;要瞄准高分。”

通过使用这种特定类型的数学方法,AI 可以观察那些旧的、10 步长的链条,并依然能学习到正确的数值,而不会被过去的错误所拖累。

研究发现

研究人员在两个截然不同的世界中测试了这个想法:

  1. Pinball:一个基于物理规律、球在桌面上弹跳的游戏。
  2. Atari 2600:包含 12 款经典视频游戏(如 BreakoutSpace InvadersPong)的集合。

他们将他们的端点回放方法与以下方法进行了对比:

  • 标准的巨大缓冲池(100 万步)。
  • 没有链条的微型缓冲池(10 万步)。
  • 使用“脱锚”随机采样的微型缓冲池(旧方法)。
  • 其他压缩方法,如 MeDQN。

结果如下:

  • 大规模压缩:即使使用 10 到 50 倍更少的存储空间,端点回放的表现也与巨大的 100 万步缓冲池一样出色。
  • 击败基础模型:在 10 倍和 50 倍更小的设置下,端点回放的表现显著优于使用随机采样或标准 1 步更新的微型缓冲池。
  • “锚定”证明:当他们移除“链式结构”(使状态重新变得脱锚)时,性能大幅下降。这证明了“脱锚自助”问题确实存在,并且他们的链式连接方案是关键。
  • 数学至关重要:当他们移除特殊的“期望”数学并改用标准平均值时,性能略有下降,这表明处理“旧闻”偏差也是至关重要的。

核心结论

这篇论文不仅仅是建议较小的缓冲池可能有效;它证明了通过正确的结构,它们确实有效。作者在数学上证明了他们的方法是可靠的,并通过模拟展示了其性能可以匹配大规模记忆库,同时仅使用极小部分的存储空间。

他们不仅缩小了笔记本,还重写了页面之间的连接方式。通过保留长链的“端点”并将它们链接在一起,他们解决了 AI 在自身记忆中迷失的问题。这意味着未来的 AI 智能体可以在内存极小的设备上学习复杂的任务,使强大的人工智能变得更加普及且高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →