← 最新论文
🤖 machine learning

Forager: a lightweight testbed for continual learning with partial observability in RL

本文介绍了 Forager,这是一个轻量级、部分可观测的持续强化学习环境,具有恒定的内存占用,旨在促进对智能体可塑性丧失的深入研究,以及状态构建在处理无尽新任务流中的关键作用。

原作者: Steven Tang, Xinze Xiong, Anna Hakhverdyan, Andrew Patterson, Jacob Adkins, Jiamin He, Esraa Elelimy, Parham Mohammad Panahi, Martha White, Adam White

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Steven Tang, Xinze Xiong, Anna Hakhverdyan, Andrew Patterson, Jacob Adkins, Jiamin He, Esraa Elelimy, Parham Mohammad Panahi, Martha White, Adam White

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名在巨大、无边森林中觅食的采集者。你的目标很简单:找到美味的蘑菇来吃,并避开有毒的蘑菇。但有一个陷阱:你戴着眼罩,只能看到你脚周围的一小圈区域。你无法看到整片森林,而且森林还在不断变化。有时美味的蘑菇会移动,有时会腐烂,有时“美味”的规则甚至会在 overnight 改变。

这就是计算机科学家所称的**持续强化学习(CRL)**在现实世界中的挑战。它关乎如何教导人工智能体在一个巨大、混乱且不断变化的世界中永远学习。

问题在于,大多数当前的人工智能研究都在微小、完美的世界中测试这些智能体,在那里它们可以看到一切(就像国际象棋棋盘)。但现实世界并非如此。为了研究人工智能如何应对“眼罩”和无尽的变化,研究人员需要一个特殊的测试场地。

于是,Forager 登场了。

Forager 是什么?

可以将 Forager 想象为一个轻量级、超快的视频游戏,专门设计用于测试人工智能在戴着那个眼罩时的学习能力。

  • 旧方法: 以前的测试场地就像背着装满砖块的沉重背包跑马拉松。它们速度慢,需要庞大的计算机,并且当人工智能试图记住更多内容时,经常陷入内存错误。
  • Forager 方法: Forager 就像一只 sleek、轻盈的跑鞋。它运行得极快(每秒高达 10 万次),并且无论人工智能运行多久,它使用的计算机内存都极少且恒定。这使得研究人员能够快速运行数千次实验,以观察什么有效、什么无效。

大考验:“眼罩”与“切换”

该论文在两个主要场景中测试了人工智能:

  1. 受限视野: 人工智能拥有一个小的“视野”。如果视野宽阔,人工智能可以看到整片森林并轻松找到食物。但随着研究人员缩小视野(使眼罩更紧),人工智能必须记住好蘑菇曾经在哪里,并预测它们何时会重新生长。

    • 结果: 标准人工智能体(如 DQN 和 PPO)迷失了方向。它们忘记了食物在哪里,学习变得低效。它们只是漫无目的地游荡。
  2. 永无止境的切换: 研究人员增加了一个转折,即规则不断变化。也许今天紫色蘑菇是美味的,但明天它们就有毒了,而黄色蘑菇成了新宠。人工智能必须不断瞬间地忘掉旧习惯并学习新习惯。

    • 结果: 人工智能开始“忘记”如何学习。这被称为可塑性丧失。这就像一个学生为一次考试如此努力地学习,以至于大脑变得如此饱和,以至于无法为下一次考试学习任何东西。

“修复”有效吗?

研究人员尝试了几种“创可贴”来解决人工智能的记忆和学习问题。他们尝试了:

  • 正则化: 告诉人工智能更紧密地坚持其原始的“个性”。
  • 特殊激活: 改变人工智能脑细胞的触发方式,以防止它们消亡。
  • 多网络: 给人工智能一个由多个大脑组成的团队,而不仅仅是一个。

裁决: 这些修复只起到了一点作用,就像给断腿贴上创可贴。它们阻止了人工智能随时间推移而变得更糟,但并没有让它变得擅长这项任务。人工智能仍然难以在盲目的森林中导航。

真正的解决方案:赋予人工智能记忆

该论文发现,秘密武器不是复杂的算法,而是记忆

  • 简单记忆: 当研究人员给人工智能一本简单的“笔记本”来记录它最近吃过的东西时,它的表现要好得多。它可以记住:“哦,我在这里吃了一个粉色蘑菇,而且它很好吃。”
  • 循环记忆(英雄): 表现最好的是拥有循环大脑的人工智能(具体是一种称为 RTU-PPO 的算法)。这可以想象成一个拥有工作短期记忆的人工智能。它不仅仅看着眼前的蘑菇;它记得它走过的路径、经过的气味以及它看到的变化。
    • 这个人工智能不仅生存了下来,而且蓬勃发展。它学会了预测变化,并在几乎与能看到整个世界的人工智能体一样好的程度上导航盲目的森林。

终极挑战:无限流

最后,研究人员创建了 Forager 的“困难模式”版本。在这个版本中,每当人工智能吃掉足够多的蘑菇时,森林就会生成带有新规则的、源源不断的新蘑菇物种。人工智能必须学习、适应并永远记住,而从不安定下来。

即使是拥有记忆的最聪明的人工智能在这里也挣扎不已。它无法跟上无尽的新任务流。这证明,虽然我们取得了进展,但当前的人工智能仍然远未能够在像我们这样复杂、部分可见的世界中“永远”学习。

总结

Forager 是一个新的、快速且高效的工具,它向我们展示了当前人工智能确切失败的地方。它揭示出,当世界很大且我们无法看到一切时,仅仅让人工智能变得“更强”是不够的。人工智能需要记忆来追踪变化并构建世界的心理地图。没有它,人工智能就会迷失并停止学习。这个测试平台为科学家提供了一个清晰的游乐场,以构建下一代能够真正终身学习的人工智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →