← 最新论文
🤖 AI

Grounding LTL Tasks in Sub-Symbolic RL Environments for Zero-Shot Generalization

本文提出了一种利用神经奖励机(Neural Reward Machines)联合训练多任务强化学习策略与符号接地器的方法,旨在使智能体能够在无需预先知晓符号到观测映射的情况下,在亚符号环境中遵循线性时序逻辑指令,从而实现优于现有方法的零样本泛化。

原作者: Matteo Pannacci, Andrea Fanti, Elena Umili, Roberto Capobianco

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Matteo Pannacci, Andrea Fanti, Elena Umili, Roberto Capobianco

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人进入一个它从未见过的房间。它看到了咖啡机、书桌和一个信箱,但对机器人而言,这些仅仅是屏幕上的形状和颜色。它不知道这台机器是用来冲咖啡的,也不知道那个缝隙是用来投递邮件的。现在,想象一个人类给出了一个复杂的指令:“去信箱那里,然后去咖啡机那里,最后去书桌那里,但在途中不要踩到红色的地砖。”对于人类来说,这很容易,因为我们理解词语和物体的含义。但对于机器人来说,这是一个巨大的谜题。它必须首先弄清楚哪些物体是哪些,然后记住事件的顺序,同时还要避开红色的地砖,并在此过程中学习如何移动。这就是教人工智能在现实世界中遵循指令所面临的挑战,因为在现实世界中,无法直接交给它一本关于物体名称的预制字典。

几十年来,研究人员一直试图通过给机器人一个完美的地图来解决这个问题,告诉它们哪个像素对应“咖啡”或“邮件”。这种方法在受控的实验室中有效,但在混乱、不可预测的现实世界中会失效。一种最近的研究中详细描述的新方法,试图教机器人如何在学习移动的同时,自主学习这些含义。科学家们专注于一种涉及时间和序列的特定指令类型,即时序逻辑(temporal logic)。可以将这理解为一种编写规则的方式,比如规定“做A,然后做B,但绝不要做C”,而不仅仅是“去点X”。目标是观察机器人能否在一个初始状态下对物体一无所知的世界中,仅通过摄像机画面和一个简单的成功或失败信号,来学习遵循这些复杂的、基于时间的规则。

研究人员构建了一个系统,让机器人同时学习两件事。首先,它学习一种策略(policy),即决定下一步采取什么行动的策略。其次,更重要的是,它学习一个“接地器”(grounder)。这是一个类似于翻译器的组件,试图弄清楚摄像机捕捉到的原始图像在指令层面意味着什么。如果机器人看到一个红色方块,而指令说“避开红色”,那么接地器最终必须学会将这个红色方块标记为“岩浆”或“危险”。困难之处在于,机器人没有老师来纠正它。它只能获得一种稀疏奖励(sparse reward):当它正确完成任务时得到一个微小的正向信号,如果失败则得到一个负向信号,中间过程则没有任何反馈。这就像是通过只在对话结束时被告知“是”或“不是”来学习一门新语言,而中间说的每一个单词都没有任何反馈。

为了解决这个问题,团队利用了指令本身结构的巧妙技巧。他们将指令视为一个随着机器人移动而改变状态的机器。如果机器人拿走了邮件,机器就会进入一个新的状态,变为“邮件已处理,现在寻找咖啡”。研究人员训练机器人的翻译器去预测这个机器体会给出的奖励。通过观察机器人的移动以及机器何时发出“成功”或“失败”的信号,翻译器会慢慢学会将它看到的图像与指令中的正确词汇相匹配。这是一个通过试错进行的过程,机器人利用任务的逻辑来教导自己符号的含义。研究人员在两个截然不同的环境中测试了这一点。一个是看起来像简化版视频游戏的网格环境,机器人需要在物品组成的迷宫中导航;另一个是平滑的连续空间,机器人的移动方式类似于在平面上行驶的汽车,试图按特定顺序访问不同颜色的区域。

结果显示,这种方法效果显著。在网格世界中,机器人遵循指令的程度几乎可以媲美那些一开始就被给予正确字典的机器人。它学会了识别物体并遵循事件序列,即使指令变得更长、更复杂也是如此。在连续世界中,机器人也学会了高精度地识别区域,尽管在处理最复杂的规避任务时稍显吃力。至关重要的是,机器人在学习移动的同时也在学习这些含义,无需单独的训练阶段。该系统证明,智能体可以通过尝试解决任务并利用规则结构来引导学习,从而实现符号接地(grounding symbols)——即将原始图像与抽象概念联系起来。

研究还对比了这种新方法与解决同一问题的另一种尝试。旧的方法试图根据指令的语法来逐步构建机器人的大脑,但在指令变长时便宣告失败,无法处理复杂的新任务。然而,新方法却能有效地扩展规模,表明学习物体的含义与学习移动的策略是深度耦合且应当共同学习的。研究人员发现,机器人识别物体的能力提升很快,通常在几百万步训练内就能达到很高的准确度。这表明,来自任务结构的间接反馈足以教导机器人什么是物体,即使没有人指给它看。

虽然该系统并不完美,特别是在那些最困难的连续环境中,对于所有方法来说,要在整个任务持续期间都避开危险都是一项挑战,但核心发现是明确的:通过让智能体在尝试完成工作的过程中学习世界特征的含义,可以训练人工智能在它不了解的世界中理解复杂的、基于时间的指令。这让我们离创造出能够进入新环境、听取一套规则并搞清楚该做什么(而不需要预编程每个物体的地图)的机器又近了一步。这项工作表明,通过将任务逻辑与环境学习相结合,机器人可以开始弥合原始数据与有意义的行为之间的鸿沟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →