← 最新论文
🤖 machine learning

LpWM: A Case for Sparse Representations in World Models

本文介绍了 LpWM,这是一种联合嵌入预测架构,它利用通过整流分布匹配进行正则化的稀疏、非负潜在表示,与传统的稠密表示相比,显著降低了预测器的复杂度并提高了规划成功率,同时揭示了具有可解释性的、模态分解的动力学结构。

原作者: Yilun Kuang, Yash Dagade, Quentin Le Lidec, Lucas Maes, Randall Balestriero, Yann LeCun

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yilun Kuang, Yash Dagade, Quentin Le Lidec, Lucas Maes, Randall Balestriero, Yann LeCun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

要理解机器是如何学习在世界中移动的,请想象教一个孩子如何在房间里穿行。孩子不仅仅是记住一张静态的地图;他们还会建立一个心理模型,理解当他们推开一把椅子或打开一扇门时,房间会发生怎样的变化。在人工智能领域,这种心理模型被称为“世界模型”(world model)。为了让计算机规划路径或执行任务,它需要根据当前状态和所采取的行动来预测下一步会发生什么。一种常见的方法是将复杂的视觉世界转化为一种更简单的、内部的数字语言,即所谓的“潜空间”(latent space)。在这个隐藏的空间里,计算机通过推动这些数字向前演进,从而预测未来。然而,一个持久存在的问题是,这些内部表示往往变得过于密集,集合中的每一个数字都承载着某种数值,这使得预测任务变得异常困难且容易出错。

研究人员长期以来一直在思考是否存在一种更好的方式来构建这种内部语言。如果计算机使用的不是填满每一个位置的信息,而是一种稀疏语言——其中大多数数字为零,只有极少数携带意义——情况会怎样?这个想法表明,通过强制系统具有选择性,控制世界变化规律的过程可能会变得更容易学习。这是由来自纽约大学、杜克大学和布朗大学等机构的研究团队开展的一项新研究中所探讨的核心问题。他们旨在测试这种稀疏方法是否能让人工智能更容易理解并控制其环境,并特别观察了这些内部数字的几何结构如何影响任务的难度。

该团队引入了一个名为 LpWorldModel 的新系统,旨在学习这些稀疏表示。与以往鼓励内部代码每个部分都保持活跃的方法不同,该系统使用一种特定的数学约束,以确保代码中的大多数数字保持为精确的零。他们在两个不同的环境中训练了这个系统:一个是简单的导航任务(一个点穿过门口移动),另一个是更复杂的操控任务(一个机械臂必须将 T 形块推送到目标位置)。在较简单的环境中,无论内部代码是稠密的还是稀疏的,系统表现都很好,因为运动规则足够简单,即使是基础的预测器也能处理。然而,在更困难的推物体任务中,结果发生了剧烈变化。

当研究人员使用不同复杂度的预测器测试该系统时,他们发现稀疏方法提供了明显的优势。在复杂度处于中等范围时——即预测模型不够强大,无法处理稠密、杂乱的表示时——稀疏系统在稠密系统失败的地方取得了成功。具体而言,在推物体任务中,当使用具有中等容量的预测器时,稀疏系统相比稠密系统将规划成功率提高了高达 57%。这表明,通过将信息组织成稀疏格式,系统降低了建模世界动力学所需的复杂度。稠密系统之所以挣扎,是因为它必须学习一个复杂的交互网络,而稀疏系统则可以依赖一套更简单、更直接的规则。

除了提高性能外,研究人员还发现,稀疏表示组织信息的方式具有惊人的可解释性。系统自然地将世界的“模式”(mode)与状态的具体细节分离开来。在一个物理规则随代理所在区域而变化的测试环境中,系统利用特定数字的存在或缺失(即“支撑集”,support)来识别它处于哪个区域,从而有效地充当了应用不同物理规则的开关。随后,非零数字的实际数值则捕捉了连续的细节,例如代理在区域内的精确位置。这种分离使得系统能够理解世界的规则发生了改变,而不仅仅是看到一堆变化的像素。

在涉及机械臂与立方体交互的一个更复杂的场景中,研究人员发现稀疏系统可以追踪物体的物理状态,例如机械臂是否正在接触立方体。然而,如果没有额外的引导,系统往往会关注场景中移动最快的部分(如机械臂本身),而不是更缓慢但更重要的接触事件。通过添加一个简单的约束,鼓励系统在时间上保持稳定,他们成功地转移了焦点,使稀疏代码能够追踪机械臂与立方体之间的接触。这证明了稀疏表示可以经过调节,从而突出最重要的物理事件,将内部代码转变为一张关于世界动力学的可读地图。

该研究得出结论,稀疏表示为目前人工智能中使用的稠密方法提供了一种强大的替代方案。通过强制系统具备选择性,研究人员展示了使预测未来的任务变得更容易是可能的,从而允许更简单的模型实现更好的效果。研究结果表明,内部语言的几何结构至关重要;一种稀疏且有结构的方案比稠密且无结构的方案能更清晰地揭示系统的底层规则。尽管该系统仍需要仔细调优以确保其追踪正确的物理事件,但结果表明,稀疏性是通往更高效、更具解释性的世界模型的极具前景的路径,这可能使机器能够以更少的计算能力学习复杂的行为。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →