← 最新论文
🤖 machine learning

In-Context Reinforcement Learning via Communicative World Models

本文介绍了 CORAL,这是一个通过将世界建模与控制解耦来增强上下文强化学习的框架,其中预训练的信息智能体将任务理解提炼为因果消息,从而使新的控制智能体能够在多种环境中实现高效的零样本适应。

原作者: Fernando Martinez-Lopez, Tao Li, Yingdong Lu, Juntao Chen

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Fernando Martinez-Lopez, Tao Li, Yingdong Lu, Juntao Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人如何通过迷宫。通常情况下,你必须坐在那里一步步引导它,让它经历数千次的失败才能最终学会路径。这既慢又昂贵。

这篇论文介绍了一种训练机器人的新方法,叫做 CORAL。CORAL 不仅仅是教机器人“如何移动”,它还在教一个“智能向导”如何与机器人“交流”。

以下是其工作原理的简单拆解,使用了日常类比:

两个角色:向导与驾驶员

CORAL 将任务拆分为两个截然不同的角色,就像车里的团队协作一样:

  1. 信息智能体 (Information Agent, IA) —— “向导”:
    你可以把它想象成一位去过成千上万个不同迷宫的资深导游。向导的任务不是开车,而是理解地形、预测转角处会出现什么,并弄清楚交通规则。

    • 它是如何学习的: 向导是在各种各样的不同迷米宫中进行训练的。它并不以开车快慢获得积分;它获得的积分来自于能够预测接下来会发生什么(例如:“如果我左转,我会撞墙”)以及如何将这些知识总结成简短、清晰的信息。
    • 它的输出: 它向驾驶员发送一条微小的“短信”(潜表征/latent representation)。
  2. 控制智能体 (Control Agent, CA) —— “驾驶员”:
    这是实际控制汽车的机器人。它从未见过这个特定的迷宫。

    • 它是如何学习的: 驾驶员倾听向导的消息。它不需要重新学习物理规则或墙壁是如何运作的;它只需要学习如何解读向导的建议,从而做出正确的转向。

核心秘诀:“因果影响”

论文引入了一个特殊的规则,用于指导向导如何说话。这被称为 因果影响损失 (Causal Influence Loss)

想象向导正在对驾驶员说话。如果向导说了一些模糊的话,比如“随便走走”,驾驶员的行为不会发生改变。但如果向导说“现在左转”,而驾驶员确实向左转了,这就是一次“因果影响”。

系统仅在向导的消息引起了有用的变化并导致更好的结果时,才会奖励向导。这就像一位老师,只有当他们的提示确实帮助学生解决了问题,而不是仅仅大声说话时,才能获得小红花。

训练过程:两个阶段

第一阶段:新兵训练营 (预训练)
向导和驾驶员在大量不同的任务(不同的迷宫)中共同训练。

  • 向导学习理解这些世界的“物理特性”,并将这种理解压缩成简短的信息。
  • 驾驶员学习倾听这些信息并完成驾驶。
  • 至关重要的是,它们学习了一种共享的“语言”或协议。

第二阶段:正式上岗 (部署)
现在,你把驾驶员放入一个全新的、未见过的迷宫中。

  • 向导被冻结: 我们停止训练向导。它成为了一个固定的、专家级的顾问。
  • 驾驶员瞬间适应: 驾驶员从零开始,但会立即开始倾听向导的消息。因为向导已经理解了迷宫的一般规则,驾驶员能够极其快速地学习新任务,通常不需要经历多次失败。

为什么这比其他方法更好

  • 对比标准学习法: 通常情况下,机器人必须为每个新迷宫从头学习一切。CORAL 的机器人已经拥有了关于世界运作方式的“心理模型”,因此学习速度更快。
  • 对比“世界模型 (World Models)”: 其他方法试图让机器人同时担任向导和驾驶员。这篇论文认为,这就像要求一名飞行员同时还要担任空中交通管制员;这会让事情变得混乱。通过将两者分离,那个“向导”成为了一个更出色、更具迁移性的专家。
  • 零样本成功 (Zero-Shot Success): 即使机器人从未见过特定类型的迷宫,只要向导见过类似的迷宫,机器人通常可以无需任何额外训练就立即解决问题。

实验结果

研究人员在计算机模拟的迷宫和连续控制任务(如平衡杆或行走)中测试了该方法。

  • 速度: CORAL 智能体比标准机器人更快地达到了顶尖性能。
  • 效率: 它们学习新任务所需的尝试次数(样本量)更少。
  • 鲁棒性: 它们能够处理复杂的、棘手的环境,而其他机器人可能会在那里卡住或失败。

简而言之,CORAL 教会了机器人拥有一个“聪明的朋友”,这个朋友会向它解释世界,从而让机器人几乎能瞬间适应新情况。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →