← 最新论文
💬 NLP

Scaling In-Context Online Learning Capability of LLMs via Cross-Episode Meta-RL

本文介绍了 ORBIT,这是一个多任务元强化学习框架,它显著增强了大语言模型的上下文在线学习能力,使较小的开源模型能够在未见的交互式环境中达到与 GPT-5.2 等先进专有模型相媲美的性能。

原作者: Xiaofeng Lin, Sirou Zhu, Yilei Chen, Mingyu Chen, Hejian Sang, Ioannis Paschalidis, Zhipeng Wang, Aldo Pacchiano, Xuezhou Zhang

发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaofeng Lin, Sirou Zhu, Yilei Chen, Mingyu Chen, Hejian Sang, Ioannis Paschalidis, Zhipeng Wang, Aldo Pacchiano, Xuezhou Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文《通过跨回合元强化学习提升大语言模型的上下文在线学习能力》(ORBIT)的解释,使用了简单的语言和类比。

核心问题:拥有“失忆症”的天才

想象你有一个才华横溢的学生,他读遍了图书馆里的每一本书。他在回答基于已读知识的问题时是个天才。然而,如果你把他放进一个全新的电子游戏或一个他从未见过的迷宫里,他就会感到吃力。

如果他在第一轮中犯了错误,他并不会为下一轮真正“学到”教训。他把每一次新的尝试都当作是第一次尝试,忘记了之前尝试中得到的经验。这就是目前许多大语言模型(LLM)的状态。它们擅长静态任务(如写文章),但并不擅长在线学习(online learning)——即通过与世界的交互、犯错并实时调整策略来摸索规律。

解决方案:ORBIT(“熟能生巧”的教练)

作者创建了一种名为 ORBIT 的新训练方法。不要把 ORBIT 看作是一个直接给学生答案的老师,而要把它看作是一个强迫学生一遍又一遍玩同一个游戏的教练,但有一个转折:允许学生保留一份关于之前尝试记录的“笔记本”。

在这种训练中:

  1. 设置: AI 多次玩一个游戏(比如迷宫或益智游戏)。
  2. 规则: 在第一次尝试失败后,AI 不会经历一个“重置”过程(即忘记一切)。相反,它会在其“上下文窗口”(短期记忆)中看到它第一次尝试的完整历史(在哪里卡住了,尝试了什么)。
  3. 目标: AI 不仅仅因为第一次赢了而获得奖励。它是因为学会如何学习而获得奖励。它通过利用自己的笔记本来弄清楚在第二和第三次尝试中如何制定更好的策略,从而获得分数。

类比:学习玩“大师爷”(Mastermind)

想象一个叫做 Mastermind 的游戏,你需要猜出彩色柱子的秘密代码。

  • 没有 ORBIT 时: 你猜了一个代码。错了。你再次尝试,但你猜了完全相同的代码,因为你并没有真正理解为什么第一个失败了。你陷入了死循环。
  • 有了 ORBIT 后: 你猜了一个代码。错了。在进行下一次猜测之前,你看了看你的“笔记本”(游戏历史)。你会对自己说:“好吧,在我的第一次尝试中,我把红色放在第一个位置,结果错了。在第二次尝试中,我试了蓝色,也错了。所以我知道第一个柱子不是红色也不是蓝色。我应该试试绿色。”

ORBIT 训练 AI 自动进行这种程度的反思,而不需要人类告诉它去“思考你的错误”。

他们是如何测试的

研究人员使用一种名为 Qwen3-14B 的相对较小的开源 AI 模型,利用 ORBIT 方法在一些简单的游戏(如扫雷和二十一点)上进行了训练。

然后,他们将它投入到完全陌生的游戏(如复杂的迷宫和 Mastermind)中。

  • 结果: 经过训练的 AI 不仅仅是在随机猜测。在第一次尝试时,它可能会失败。但在第二和第三次尝试中,它利用了失败的历史,在导航迷宫或破解代码方面表现得更好。
  • 对比: 它的表现非常出色,甚至达到了大型顶级商业 AI(如 GPT-5.2)的能力水平,并击败了那些通常只教 AI 解决特定问题而不会从过去错误中学习的标准训练方法。

“规模化”的惊喜

论文还发现了一个关于规模有趣的现象。他们测试了不同规模版本的 AI。

  • 小型 AI: 擅长立即解决谜题。
  • 大型 AI: 出人意料的是,更大的 AI 愿意“浪费”第一次尝试来收集信息(探索)。它会尝试一些东西来看看会发生什么,记录下来,然后利用这些知识在第二和第三次尝试中彻底解决谜题。
  • 结论: 以这种方式训练的大型模型在“边做边学”的策略上表现得更出色。

这意味着什么(严格基于论文内容)

论文声称:

  1. 训练有效: 你可以教会 AI 通过与其自身的交互进行学习,而无需在实际执行任务期间改变其“大脑”(权重)。它完全通过对过去尝试的记忆来进行学习。
  2. 它具有通用性: 这种技能可以迁移到未见过的全新环境中。AI 不仅仅是记住了迷宫;它学会了探索和适应的技能
  3. 简单即胜利: 他们不需要复杂的外部记忆库,也不需要人类编写提示词来告诉 AI 去“反思”。训练方法本身就足以让 AI 自然地开始总结过去的失败并更好地规划行动。

简而言之,ORBIT 将一个静态的、“书本知识丰富”的 AI 转变为一个“街头智慧型”的智能体,使其能够通过尝试、错误以及记住发生过的事情,来摸索出新的规则和环境。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →