Enfold: Folding World-Generator Computation into Predictive Representations for Efficient Embodied Control
Enfold 是一个新颖的框架,它将世界生成模型的多层计算过程提炼为仅从当前视觉和语言语境中推断出的预测性表征,使具身智能体能够通过内化未来生成结构,而无需在每一步都实现未来的轨迹,从而在显著降低延迟的同时实现强大的控制。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人制作三明治。过去的方法是给机器人一个水晶球。在它移动任何一只手之前,机器人会利用这个水晶球生成一段关于未来的高清完整视频:看到面包被切开、奶酪滑落在面包片上、盘子被放下的画面。只有在脑海中看完这整部电影后,机器人才会决定下一步该做什么。这就像是在转动方向盘之前,先通过观看一段关于前方道路的完整电影来开车。这种方法功能强大,但同时也极其缓慢且计算成本高昂,就像为了决定左转还是右转,却要渲染一部大片一样。
这篇论文来自机器人学和人工智能领域,特别关注“世界模型(world models)”。世界模型本质上是一种通过预测接下来会发生什么来学习物理世界运作规律的 AI。作者探讨的核心理念是“预测性表示(predictive representations)”。你可以将其理解为背诵整部电影剧本与理解故事“规则”之间的区别。你不需要重看整部电影就能知道如果掉落一个玻璃杯,它会破碎;你只需要理解重力和易碎性的物理规律即可。作者提出的重大问题是:我们能否教会机器人理解未来的“结构”,而无需在每次需要移动时都强制它生成完整的、沉重的视频?
该论文介绍了一种名为 Enfold 的新方法。这个名字是“unfolding(展开/铺开)”一个未来(即旧方法所做的)与将该未来知识“enfolding(折叠/包裹)”进当前时刻的结合。Enfold 并不要求机器人生成完整的未来视频后再行动,而是教导一个“预测编码器(predictive encoder)”去吸收如何呈现那个未来的“计算过程”。
它是这样运作的:研究人员使用了一个强大的“教师”AI(一个视频生成器),这个教师 AI 非常擅长想象未来。当这个教师 AI 处理一段关于未来将会发生什么的视频时,它会经历许多内部步骤,对场景、物体和交互进行组织。Enfold 通过观察这些内部步骤,学习仅利用“当前的图像”和“机器人的指令”来预测它们。这就像是一个学生观察一位名厨烹饪复杂菜肴的过程。学生不需要每次想做三明治时都从头开始尝试烹饪整道菜,而是学习厨师内在的“肌肉记忆”和“厨房逻辑”。他们学会了根据当前平底锅的状态来预判下一步,而无需先在脑海中模拟整顿饭的过程。
研究发现,这种方法在速度和效率方面带来了颠覆性的改变。在测试中,Enfold 机器人的决策速度比之前的最先进方法 Fast-WAM 快了 3.7 倍,而其优化版本 Enfold-Flash 则快了 10.1 倍。尽管速度大幅提升,它并没有丧失智能;事实上,它在复杂任务中的表现甚至略有提升,在一个基准测试中达到了 97.8% 的成功率,在另一个测试中达到了 91.77%。
至关重要的是,论文反对“机器人必须生成完整视频才能进行智能行动”的观点。他们证明了通过将未来生成的计算过程“折叠”进一个紧凑的表示中,机器人仍然可以根据环境变化进行调整。例如,如果机器人在计划抓取盘子时,人类移动了盘子,Enfold 不仅仅是重放一段预录好的脚本;它会根据新的现实立即重新计算未来并调整动作。作者认为,这证明了机器人已经学习到了一种灵活的、预测性的世界理解能力,而不仅仅是死记硬背一条固定的路径。
简而言之,Enfold 表明我们不需要渲染整个未来来控制机器人。我们只需要教会机器人将未来的“逻辑”揣在兜里,从而实现即时且具有适应性的行动,将一个缓慢的视频渲染过程转化为一种闪电般快速、直觉式的决策。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。