← 最新论文
🤖 machine learning

Data Deletion Can Help in Adaptive RL

本文证明,在上下文强化学习中随机删除部分训练数据,通过隐式加权近期且与分布对齐的样本,提升了上下文估计与策略的鲁棒性,这一现象在理论上得到论证,即当正则化与信噪比处于特定范围内时,此类删除能在分布不匹配的情况下降低期望测试损失。

原作者: Param Budhraja, Aditya Gangrade, Alex Olshevsky, Venkatesh Saligrama

发布于 2026-05-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Param Budhraja, Aditya Gangrade, Alex Olshevsky, Venkatesh Saligrama

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人走路。你在模拟环境中训练它,那里的地面有时湿滑,有时粘滞,有时重力还各不相同。机器人通过观察自己最近的步伐来适应这些变化,并推测:“啊,现在地面肯定很滑”,然后调整它的步态。

这篇论文介绍了一个令人惊讶的技巧,能让那个机器人学得更好删除它的一部分训练记忆。

以下是用简单类比对这一机制的解析:

1. 问题所在:机器人被陈旧信息搞糊涂了

在标准训练中,机器人经过多轮训练,收集了成千上万条“记忆”(数据点)。

  • 早期轮次:机器人笨手笨脚。它会犯错,并基于糟糕的推测收集数据。
  • 后期轮次:机器人变得更聪明了。它会基于更准确的推测收集数据。

问题在于,当机器人试图学习如何推测环境(即“上下文”)时,它会同等地审视所有记忆。这就像试图通过混合研究以下两类视频来学习如何在雨中开车:

  1. 专业驾驶员在完美天气下的视频(优质数据)。
  2. 幼儿在暴风雪中学走路的视频(劣质数据)。

早期笨拙轮次产生的“劣质数据”与机器人未来将面对的“现实世界”并不匹配。它会混淆学习过程。

2. 解决方案:“记忆衰退”技巧

作者提出了一条简单却反直觉的规则:在每次训练会话后,随机丢弃机器人记忆库中的一块数据。

你可以把这想象成一个旋转书架

  • 每当你添加一本新书(新数据),你就会随机从书架上抽出几本旧书扔进垃圾桶。
  • 因为你每轮都这样做,最旧的书(笨拙的早期数据)最有可能被扔掉。
  • 更新的书(聪明的近期数据)则更有可能保留下来。

这为何如此神奇?

  • 它保留了“新鲜”数据:机器人专注于它最近学到的内容,这与当前情况更相关。
  • 它保留了“多样性”:与那种保留最新数据(可能过于狭隘)的系统不同,这种随机删除机制保留了不同场景的混合,只是去除了来自非常古老、无用尝试的“噪音”。

3. 结果:小脑瓜能战胜大脑袋

研究人员在机器人行走和平衡的计算机模拟中测试了这一方法(例如月球着陆器或奔跑的蚂蚁)。

  • 令人惊讶的是:他们发现,使用这种“删除技巧”的微小、简单的脑(小型神经网络),实际上能够击败未使用该技巧的巨大、复杂的脑(大型神经网络)。
  • 数据表明:在某些情况下,带有删除功能的小模型在适应性方面比没有该功能的大模型高出 30%。即使在平均情况下,其性能也提升了约 6%。

这就像是一个只保留最佳、最新笔记的小笔记本学生,其表现优于拥有满是过时、令人困惑教科书的庞大图书馆的学生。

4. 理论:为何丢弃反而有帮助?

作者通过数学推导解释了为何这能奏效。

  • 想象你试图找到靶心的位置。
  • 如果你的训练数据(你射出的箭)来自与实际目标(“分布不匹配”)略有不同的角度,那么保留每一支箭可能会把你的瞄准方向拉偏。
  • 通过随机删除一些箭,你会意外地移除那些最严重地将你带偏的箭。
  • 数学证明,如果你的数据中的“噪音”足够大(就像有很多风在吹你的箭),随机删除几支箭实际上能帮助你更频繁地击中靶心。

总结

该论文认为,在需要适应变化环境的 AI 世界中,少即是多。通过随机删除旧的、可能令人困惑的训练数据,AI 能够专注于最重要的内容:近期的、多样化的经验。这使得即使是小型、简单的 AI 模型也能变得高度适应,并超越那些更大、更复杂的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →