← 最新论文
🤖 AI

Towards Zero-Shot Task Transfer with Neurosymbolic World Models

本文介绍了一种神经符号世界模型,该模型通过结构化符号组件将观测重构与奖励预测解耦,从而实现无需进一步环境交互即可对新奖励函数进行零样本自适应,并展示了优于纯神经方法的泛化能力。

原作者: Isidoro Tamassia, Lennert De Smet, Giuseppe Marra

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Isidoro Tamassia, Lennert De Smet, Giuseppe Marra

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个人工智能智能体正在学习如何在一个复杂的环境中导航,就像一个孩子学习走路一样。在机器学习领域,这些智能体通常依赖于“世界模型”(world models),即一种内在的心理地图,使它们能够预测如果采取特定行动后会发生什么。通过在脑海中模拟这些未来的场景,智能体可以规划其行动,而无需在现实世界中尝试每一种可能性。这种方法已经变得极其强大,使计算机能够通过高维感官数据(例如视频图像流)进行学习,从而精通游戏并控制机器人。然而,一个显著的障碍仍然存在:这些心理地图通常是为单一、特定的任务而构建的。如果目标发生了变化——比如,从到达一扇红门变为到达一扇蓝门——智能体往往必须重新学习它对世界的整个理解,因为它的内部地图与其在训练期间追求的特定奖励紧密交织在一起。

比利时鲁汶大学(KU Leuven)的研究人员开发了一种新方法来解决这种僵化性,创建了一个能够即时适应新目标且无需再次与环境交互的系统。他们的工作引入了一种新型的“神经符号”(neurosymbolic)世界模型,这是一种结合了神经网络的模式识别能力与符号推理的清晰逻辑结构的混合系统。这些模型不再学习单一且纠缠不清的表征,而是学习将环境的原始感官细节与决定成功的特定高层事实进行分离。这种分离使得智能体能够保留其对世界运动和变化方式的理解,同时只需更换判定“获胜”的规则即可。其结果是,智能体可以学习一次复杂的环境,然后将其知识应用于完全不同的任务,这种能力被称为“零样本迁移”(zero-shot transfer),只需用相同的底层事实重新定义目标即可实现。

这项创新的核心在于模型处理信息的方式。传统的模型学习的是一种压缩且抽象的世界版本,这种版本难以被人类解释,也难以重新利用。相比之下,这种新型神经符号模型强制系统去识别并预测状态的特定结构化属性,例如智能体的坐标或物体的位置。这些属性充当了桥梁。模型利用其神经网络来理解混乱的视觉世界,并将其转化为这些清晰的符号事实。一旦模型获得了这些事实,它就会使用一个独立的逻辑组件来预测奖励。由于奖励预测仅取决于这些清晰的事实,研究人员只需用一个新的针对不同目标的奖励函数来替换原有的函数,模型就能立即理解如何进行规划。智能体不需要看到新目标或尝试新目标,它只需使用相同的内部地图,在脑海中重新运行其心理模拟,并应用新的规则。

为了测试这一想法,研究人员在几个不同的环境中训练了他们的模型,包括一个智能体必须寻找目标的网格导航任务、一个具有连续运动的相同任务的3D版本,以及一个需要将箱子推到特定位置的益智游戏《推箱子》(Sokoban)。在这些训练阶段,智能体学习了如何导航并实现特定目标,例如到达一个固定的目标位置。随后,研究人员向模型提出了挑战,要求它们应对新任务,其中环境的运动规则保持完全不变,但目标发生了变化。在一种场景中,目标可能会移动到另一个房间;在另一种场景中,智能体可能需要到达物体的特定配置,而非仅仅是一个点。模型能够在不与真实环境进一步交互的情况下适应这些新目标。它们通过两种方法实现了这一点:要么通过使用搜索算法在脑海中探索各种可能性来规划新路径,要么完全在其内部模拟中优化其决策策略。

结果表明,这种方法不仅有效,而且比标准方法更高效。神经符号模型在学习训练任务时所需的示例更少,这表明其处理信息的结构化方式有助于它们更快地掌握环境。更重要的是,在面对新任务时,它们能够实现即时适应。传统模型在面对新目标时,通常需要一段重新训练的过程或大量的新数据才能理解,而神经符号智能体则能直接应用其现有的世界知识来应对新目标。即使在训练期间仅提供了部分符号事实的信息,或者完全没有为这些事实提供直接监督(即依靠模型本身的结构来引导学习)时,情况也是如此。

这项工作展示了迈向更灵活、更具复用性的人工智能的重要一步。通过将“理解世界运作方式”与“智能体试图达成的特定目标”解耦,研究人员创造了一个行为更像通用学习者而非专用工具的系统。该智能体不仅仅是记住了前往目的地的路径,它还学习了地形和运动规则,从而使其能够导航至该地形内定义的任何目的地。虽然该系统仍要求新目标必须能够使用训练期间学到的那套高层事实来描述,但它消除了在任务变化时进行昂贵重训的需求。这预示着一个未来,智能系统可以被部署在动态环境中,只要被告知要寻找什么,就能立即应对新挑战,而不必重新学习如何观察。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →