← 最新论文
🤖 machine learning

Position: Deployed Reinforcement Learning should be Continual

本立场文件认为,部署的强化学习系统应当采用持续学习范式,而非传统的“先训练后修复”模式,因为现实世界的非平稳性要求智能体必须永不停歇地进行适应,以保持最优性能。

原作者: Parnian Behdin, Kevin Roice, Golnaz Mesbahi

发布于 2026-06-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Parnian Behdin, Kevin Roice, Golnaz Mesbahi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你雇佣了一位才华横溢的厨师来为你的家人准备晚餐。你他们在测试厨房里训练了数月,向他们展示了可能需要的所有食谱。在他们通过最终考试后,你锁上了厨房门,给了他们一份固定的菜单,并告诉他们:“你的学习阶段结束了。就永远按照这个菜单做下去吧。”

这就是当今大多数人工智能(AI)系统的工作方式。这篇论文称之为**“训练后固定”(Train-Then-Fix)范式**。

该论文的作者认为,这种方法对于现实世界的 AI 来说存在根本性的缺陷。他们认为,一旦 AI 被部署(投入实际工作),它永远不应该停止学习。他们称之为**“持续强化学习”(Continual Reinforcement Learning)**。

以下是使用简单类比对他们论点的拆解:

1. 问题所在:世界是一个移动的目标

在现实世界中,事物在不断变化。

  • 厨师类比: 想象一下你家人的口味发生了变化。也许他们吃腻了意面,突然开始渴望寿司。或者某种新食材变得流行起来。如果你的厨师被困在旧菜单上,食物最终会变得难吃,你的家人也会停止进食。
  • AI 的现实情况: 论文指出,现实世界过于复杂(即“大世界”),任何 AI 都无法在开始工作前学完所有知识。即使 AI 很聪明,它也无法预测未来的每一次变化。如果你在训练后冻结了它的“大脑”,它会逐渐过时,表现也会随之下降。

2. 为什么“训练后固定”会失败

作者指出了四个导致 AI 开始工作后世界发生变化的特定原因,使得“设置后即忘弃”变得不可能:

  • AI 改变了世界(行动诱导的非平稳性):
    • 类比: 想象一个音乐推荐应用。如果它一直推荐同一种类型的歌曲,用户可能会感到厌倦并停止听这类音乐。应用的自身选择改变了用户的品味。
    • 现实: AI 的行为往往会改变它所运行的环境。
  • 世界自身在变化(环境动态性):
    • 类比: 季节更替、交通模式转移,或者硬件(如机器人的关节)随着时间的推移而磨损。
    • 现实: AI 控制之外的事物在发生变化,使得旧规则变得不再适用。
  • 目标移动了(演变中的目标):
    • 类比: 一家公司可能会决定今天“速度”是最重要的指标,但明年“安全性”成为了优先级。
    • 现实: 人类的优先级和监管政策在变化,这意味着什么才算“做得好”也在变化。
  • 突发事件(涌现的新奇性):
    • 类比: 一个“黑天鹅”事件,比如突如其来的全球大流行病,或者一种从未见过的奇怪新代码。
    • 现实: AI 必然会遇到它从未接受过训练的情况。

3. 解决方案:“可衡量部署”

论文聚焦于一种被称为**“可衡量部署”(Measurable Deployment)**的特定场景。

  • 类比: 这就像一位仍处于被观察状态下的厨师。尽管他们在为真实的顾客烹饪,但顾客仍然会留下评价(评分、小费或投诉)。厨师可以实时知道食物的好坏。
  • 论点: 如果 AI 得到了反馈(奖励信号)来告知其表现如何,那么忽略这些反馈就是一种潜力的浪费。与其等待人类说:“嘿,你的表现下降了,让我们重新训练你,”不如让 AI 利用这些反馈在“此时此地”进行学习和适应。

4. 现实世界案例

论文指出两家已经在成功实践此做法的公司:

  • Cursor Tab(编程助手): 这个工具帮助程序员编写代码。它不仅仅是坐等指令;它通过程序员实际接受哪些代码建议来学习。它根据实时反馈每隔几小时更新一次其“大脑”,而不是等待数月后的软件更新。
  • Lyft(网约车): Lyft 使用 AI 来匹配司机和乘客。由于交通、需求和司机位置每秒都在变化,他们的 AI 会实时学习并更新策略。如果他们等到线下重新训练模型,将会错过数百万美元的潜在订单。

5. 行动呼吁

作者敦促两类人群改变思维方式:

  • 针对从业者(构建者): 不要将部署视为学习过程的“终点”。要构建能够从错误和成功中学习的系统,让 AI 在工作的同时进行学习。将实时数据视为训练数据。
  • 针对研究人员: 不要试图构建旨在“收敛”(即在找到完美答案后停止学习)的 AI。相反,要构建设计初衷就是为了永远进行搜索和适应的 AI,因为在现实世界中,并不存在“完美的答案”。

总结

论文的核心信息很简单:如果你将 AI 置于一个能获得反馈的现实世界中,你必须让它保持学习。 冻结它的知识就像是在驾驶员通过驾驶考试后,要求他闭上眼睛继续开车。道路在变,车辆在变,目的地也在变。保持安全和高效的唯一方法就是持续驾驶、持续观察并持续学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →