Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation
Zeva 是一个新颖的框架,它通过将机器人物理经验中的因果交互提取到双时间尺度记忆中,使一个冻结的策略模型能够通过上下文学习进行自我演化并提升其跨任务性能,从而实现可泛化的具身操控,且无需梯度更新。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器人长期以来一直是工厂车间的专家,它们能以完美的精度重复成千上万次的相同动作。但一旦将它们带出那个受控环境,进入真实的厨房或实验室,它们往往会跌跌撞撞。物理世界是混乱的:物体会移动,表面是不平整的,而且机械手感知玻璃杯的方式与感知金属杯的方式也截然不同。多年来,教导机器人的主流方法是在它们离开实验室之前,喂给它们海量的视频和数据,希望它们能学到足够的通用规则来应对任何情况。然而,当这些机器人面对从未见过的场景时,它们经常失败,因为它们的内部“大脑”无法适应那一刻的新物理特性。它们被困在已有的知识中,无法从正在发生的错误中学习。
清华大学和 Z-Trans AI 的研究团队提出了一条不同的路径,即让机器人学会实时思考因果关系。他们引入了一个名为 Zeva 的系统,该系统允许机器人在不改变其底层软件代码的情况下提高自身性能。Zeva 不尝试重新训练机器人的“大脑”(这既缓慢又具有风险),而是像一本组织严密的笔记本。当机器人尝试执行一项任务时,它会记录下移动时发生的精确情况:它看到了某个特定物体,它的手臂以某种方式移动,然后物体是保持原位还是翻倒了。系统从那次单一的交互中提取教训——即动作与结果之间的因果联系——并将其存储起来。当机器人再次尝试同一项任务时,它会查阅这本“笔记本”,找到相关的教训,并利用它来调整下一次动作。这个过程瞬间完成,使得机器人能够随着每一次尝试而变得更好,即使其核心程序保持冻结且未做任何改变。
研究人员在两个截然不同的世界中测试了这个想法。首先,他们使用了一个复杂的厨房计算机模拟环境,那里充满了像热水壶、烤面包机和搅拌机这样复杂的物体。在这个虚拟环境中,Zeva 面临五项不同的任务,例如打开微波炉或打开搅拌机盖。结果令人瞩目。虽然其他先进的机器人系统成功率大约在 60 到 72% 之间,但 Zeva 的成功率达到了 76.8%。更重要的是,该系统展现出了明显的自我改进模式。在第一次尝试某项任务时,机器人的成功率仅为四分之一左右。但随着它被允许不断尝试同一个场景,利用失败中的教训来指导下一步行动,其成功率稳步上升。到第四次尝试时,它的成功率已达到 73%。这证明了机器人不仅仅是在碰运气,它确实在从自身动作的物理反馈中学习。
为了确保这不仅仅是计算机模拟的结果,团队将该系统带入了真实的化学实验室。他们为一个物理机械臂配备了处理试管、烧杯等精细玻璃器皿的能力,并使其能够执行倾倒水或称量化学物质等任务。这个环境比模拟环境更加不可预测,存在真实的重力、摩擦力以及打破玻璃的风险。在这里,Zeva 再次超越了现有的最佳系统。在最简单的任务(如拿起试管)中,它的成功率为 100%。在更复杂的序列任务(如配制盐溶液)中,它实现了 70% 的成功率,显著高于竞争对手。研究人员还测量了机器人完成了多少流程,而不仅仅是看它是否完成了整个工作。即使任务很困难,Zeva 也能比其他任何系统都完成更多的必要步骤,这表明其通过交互进行学习的能力有助于它应对混乱的物理现实。
Zeva 成功的关键在于它如何组织记忆。该系统并不仅仅存储一份关于它做过所有事情的长列表,因为那样处理起来太慢。相反,它结合使用了两种类型的记忆。一种是短期追踪,记录最后几秒钟的动作,帮助机器人理解当前正在发生什么。另一种是持久记忆,保留以往尝试中最有用的教训,即使那些尝试失败了。当机器人开始新的尝试时,它会在持久记忆中搜索与当前面临情况相似的情况。然后,它利用过去的经验作为引导。例如,如果机器人之前尝试倾倒水,而由于倾斜过快导致杯子翻倒,它会记住这种特定的因果关系。在下一次尝试时,它会参考这段记忆并放慢倾斜速度,从而避免同样的错误。这个过程是在不改变机器人主程序的情况下进行的,这意味着机器人可以即时学习和适应,而无需经历重新训练整个大脑那种缓慢且危险的过程。
研究人员还发现,这个系统不仅可以从自身的错误中学习,还可以从人类身上学习。在一项实验中,人类通过物理引导机械臂完成了一次复杂任务的成功尝试。系统记录了这次人类演示,提取了其中的因果教训,并将其存入记忆。当机器人随后独立尝试该任务时,它利用这单次人类示例来启动学习。这种“热身”让机器人在起步阶段的表现就更好,与完全从零开始学习相比,成功率提高了高达 15%。这表明,机器人可以从单次人类演示中学习一项新技能,然后通过自身的反复练习来完善这项技能,将人类的最佳引导与自身的自我进化能力结合在一起。
研究还探讨了机器人在一个任务中学到的教训是否能帮助它完成完全不同的另一个任务。他们发现,该系统能够识别出新任务中的物理效应是否与之前见过的相似。例如,倾斜容器倒水的动作被识别为与倾斜容器混合化学物质的动作相似,尽管物体和目标各不相同。这种跨任务迁移知识的能力意味着,机器人不需要在每次面对新挑战时都从零开始。它可以利用其建立起来的物理因果关系库,这使其更加多才多艺,并能在广泛的场景中胜任。
尽管取得了这些成功,研究人员也明确指出了这项工作的局限性。目前,该系统仅能从其为了完成特定工作而进行的尝试中学习。它还没有能力仅仅为了学习新事物而到处游走和探索,这种行为被称为“主动探索”。作者表示,未来的工作重点将是教导机器人自主选择实验,通过刻意尝试不同的动作,来减少对物理世界运作方式的不确定性。在此之前,Zeva 代表了一个重要的进步,它表明机器人不需要通过重新训练来变得更聪明。通过仅仅关注自身行为的后果,并记住哪些有效、哪些无效,机器人可以进化自己的能力,将每一次失败都转化为下一次尝试的教训。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。