Action-aligned Representation Geometry in Vision–Language–Action Models
本文揭示了视觉-语言-动作(VLA)模型在训练过程中会一致地形成结构化且与动作对齐的潜空间几何结构,这种结构作为一种关键的组织原则,与任务性能相关联,在不同层级间呈层级化涌现,并且对于有效的动作预测与泛化至关重要。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
能够视觉感知、理解语言并自主控制身体移动的机器人已不再是科幻小说中的情节,它们正成为一个被称为“具身人工智能”(embodied artificial intelligence)的快速增长领域的研究核心。多年来,研究人员一直致力于教机器如何将像“拿起杯子”这样简单的句子转化为机械臂精确且连续的动作。目前最成功的现代方法涉及在海量的视频演示库上训练大规模计算机模型,这一过程被称为行为克隆(behavior cloning)。这些通常被称为“视觉-语言-动作”(Vision-Language-Action)系统的模型充当机器人的大脑,接收图像和文本,并输出一系列指令。然而,尽管这些系统正变得越来越强大,它们的内部运作机制仍然是一个谜。我们知道它们有效,但并不真正理解它们是如何组织接收到的海量视觉和语言信息,从而决定特定的物理运动的。缺乏这种理解,我们很难知道机器人为什么失败、如何修复它,或者如何使其更加可靠。
哈佛大学的一个研究小组现在揭开了这个“黑箱”的面纱,揭示了隐藏在这些复杂模型内部令人惊讶且有序的结构。通过研究这些“人工大脑”如何处理信息,科学家们发现,随着模型学习执行任务,它们对世界的内部表征并不会保持为混乱的堆砌。相反,这些表征会自发地排列成一种高度结构化的几何模式,并且与机器人需要采取的行动完美对齐。这一发现表明,机器人成功的秘诀不仅在于它所看到的数据,还在于它如何将这些数据在内部组织成一张清晰、可预测的地图,使相似的动作被归为一类,而不同的动作则被清晰地分隔开。
研究人员利用最初用于研究简单图像识别网络如何学习的框架——即“神经坍缩”(neural collapse)——来调查这一现象。在机器人技术的背景下,这一概念描述了一种状态,即模型关于特定动作的内部“想法”变得极其紧凑且一致。想象一个房间里挤满了试图寻找不同出口的人;在混乱的状态下,人们会随机游走。但随着他们熟悉了布局,所有前往同一扇门的人都会紧密地聚集在一起,而前往不同门的群体则会彼此远离,形成一张清晰、有序的地图。哈佛研究团队发现,视觉-语言-动作模型也经历了类似的转变。在接受了数千次机器人演示训练后,对应于相同物理动作(如“抓取把手”)的内部信号开始坍缩成紧密、统一的簇。与此同时,代表不同动作(如“按下按钮”与“抬起箱子”)的信号则组织成一种平衡、对称的排列,使模型能够轻松选择正确的路径。
这种几何秩序并非单次实验中的偶然现象。研究人员在多种机器人模型、不同的连续运动数字指令转换方式,以及从堆叠积木到清理桌面等多样化任务中测试了这一现象。他们观察到同一个模式在持续出现:随着机器人性能的提升,其内部几何结构变得更加结构化。这些模型不仅仅是在记忆特定的例子,它们是在学习一条关于如何对动作进行分组的基本规则。这种结构在模型训练过程中逐渐显现,从网络的早期层开始,并在决定动作前的最终层变得最为显著。研究人员还证实,这种秩序是针对特定任务的。当他们用随机标签替换正确的动作标签时,几何结构便无法形成,这证明了这种组织是由控制机器人的实际目标驱动的,而非计算机对数据进行分组的某种通用倾向。
为了证明这种几何结构不仅仅是一个副作用,而是机器人思考的关键部分,研究团队进行了一系列精细的干预实验。他们选取了一个训练好的机器人模型,并在其运行时微妙地扰动其内部信号。当他们破坏相似动作的紧密聚类或打乱不同动作组的排列时,机器人的性能立即下降,并出现了更多错误。相反,当他们调整信号以强化这种自然的几何秩序时,机器人的行为保持了稳定和准确。这提供了强有力的证据,证明结构化的几何形状是机器人做出正确决策的功能性必要条件。它不仅仅是学习的副产品,更是模型在从视觉场景转向成功动作的过程中所使用的机制。
这项研究还阐明了为什么向机器人喂入更多数据能让它们变得更聪明。研究人员在不同规模的演示数据上训练了模型,并发现数据量与内部几何质量之间存在直接联系。在更大规模数据集上训练的模型展现出了更精细、更有序且更鲁棒的几何结构。这表明,大数据的益处不仅在于看到了更多例子,还在于为模型提供了足够的信息,以构建一张更清晰、更可靠的世界内部地图。模型看到的模型数据越多,它组织动作理解的能力就越强,从而实现更一致、更成功的行为。
这些发现为我们看待机器智能提供了一种全新的视角。与其将这些模型视为仅仅将输入映射到输出的透明系统,我们现在可以将它们视为构建了一个结构化的、与行动对齐的景观。在这个景观中,通往成功动作的路径是由一种自然地将相似行为分组并将不同行为分离的几何结构所铺就的。这一发现提供了一个强大的工具,使研究人员能够诊断机器人为何失败,比较不同的模型设计,并理解这些系统如何泛化到新情境。通过揭示机器人学习过程中隐藏在混沌中的秩序,这项工作让我们离构建不仅功能强大,而且可理解、可靠的物理世界伙伴又近了一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。