✨ 要点🔬 技术摘要
想象一下,你正在看一张红色玩具车的照片。现在,想象同一张照片,但汽车被移动到了左边,或者旋转了,或者放大了。对于人类来说,我们能瞬间明白:“这仍然是那辆红色的玩具车,只是换了个位置。”我们将物体的身份 (它是一辆红车)与它的位置 (它在那儿)分离开来了。
这篇论文提出了一种让计算机学习这项技能的新方法。作者称之为**“类别-姿态解耦”(Class-Pose Decomposition)**。
以下是其工作原理的简单拆解,使用了日常类比:
1. 问题所在:计算机会感到困惑
通常,当计算机观察数据(如图像)时,它试图将所有内容挤进一个巨大的“思维盒子”里。如果物体移动了,计算机往往会认为它是一个完全不同的东西,因为像素发生了变化。它难以区分“物体是什么”和“物体在哪里”。
2. 解决方案:两个独立的抽屉
作者建议将计算机的“思维盒子”(称为潜空间/latent space )拆分为两个截然不同的抽屉:
抽屉 A(“类别”): 这个抽屉保存身份。它回答:“这是一个椅子?一只猫?还是一辆红色的车?”它忽略物体在哪里。无论你如何移动物体,它都保持不变。
抽屉 B(“姿态”): 这个抽屉保存几何信息。它回答:“它是旋转了?还是向左移动了?还是放大了?”它能完美地追踪运动。
作者声称,通过强制计算机使用这两个独立的抽屉,它能学到更清晰的世界图景。
3. 核心秘诀:“对称性”规则
计算机如何在没有老师告诉它“这是一个椅子”或“这是一个旋转”的情况下,学会使用这些抽屉呢?
作者使用了一个概念叫做**“等变性”(Equivariance)**。你可以把它理解为计算机大脑中的一条严格物理定律:
规则: “如果你拿取一个物体,移动它(应用一种对称性),然后再观察它,其结果应该等同于先观察它,然后再移动它的内部表示。”
类比: 想象你有一张城市地图。
如果你在现实世界中向北走了 5 个街区,你在地图上的位置也应该向北移动 5 个街区。
计算机是在这条规则下接受训练的。它会被给予成对的图像(移动前和移动后),并被告知:“你的内部地图必须像现实世界发生的变化一样精确地更新。”
4. 为什么这种方法更好
该论文将他们的方法与其他 AI 方法进行了对比,发现其方法优越之处在于两个主要原因:
它是“无损的”(没有信息丢失): 其他一些方法试图让计算机在运行过程中去摸索运动规则;作者认为这就像是通过猜测来学习语言,你可能会掌握大意,但会错过细节。而他们的方法假设“运动规则”(群论数学)是已知的,从而允许计算机构建一个完美的、结构化的地图,其中没有任何信息丢失。
它是“解耦的”(清晰的分离): 在其他方法中,“是什么”和“在哪里”会混在一起。如果旋转一个物体,计算机可能会意外地改变它对物体“是什么”的认知。而在这种新方法中,“类别”抽屉保持纹丝不动,而“姿态”抽屉进行旋转。它们彼此互不干扰。
5. 现实世界的证明:机器人的地图
作者在机器人和图像上测试了这一点。
测试: 他们向计算机展示了物体移动的图像。
结果: 计算机不仅识别出了物体,还构建了一个完美的、几何化的环境地图。
应用: 由于计算机对“姿态”理解得非常好,它可以通过观察机器人的移动,同时利用机器人的摄像头画面构建出多个不同房间(公寓)的地图。它仅通过理解运动的对称性,就能准确告诉机器人它在房间里的具体位置。
总结
简而言之,这篇论文教会了计算机不要把移动的物体看作是一团混乱且不断变化的像素。相反,它教会了计算机像人类一样思考:“那是同一个物体(类别),只是换了个位置(姿态)。” 通过在数学上强制计算机将这两个概念放在不同的盒子里,它创造了一种更聪明、更准确、更可靠的机器理解世界的方式。
技术摘要:通过类-位姿分解实现等变表示学习
问题陈述 智能体需要能够反映感知数据内在结构的丰富表示。虽然诸如自动编码器和对比学习之类的自监督方法具有通用性,但它们往往无法捕捉隐藏在数据中的基本属性,例如内在对象类别与其位姿(pose)之间的分离。近期的研究表明,解耦这些因素需要特定的偏置或监督。许多数据集中的一个基本几何结构是对称性(例如,作用于对象位姿的刚体变换,或移动智能体探索中的帧变化)。挑战在于学习到的表示不仅要对这些对称性具有等变性,还要是无损的、可解释的且解耦的,从而保留数据的完整几何结构。
方法论 作者提出了一个通用的框架,将潜空间分解为两个不同的组件:代表内在数据类别的不变因子和代表位姿的对称成分。
理论基础: 该方法基于群论。作者将对称性形式化为作用在数据空间 X X X 上的群 G G G 。在假设该作用是自由 的(即不存在非单位元固定点的元素)前提下,他们依赖于一个理论结果(命题 2.1),该结果指出存在一个等变同构 X ≃ ( X / G ) × G X \simeq (X/G) \times G X ≃ ( X / G ) × G 。这里,X / G X/G X / G 代表轨道集合(内在类别),而 G G G 代表对称群(位姿)。这种分解保证了表示是无损的,并且保留了数据的几何结构。
潜空间分解: 潜空间 Z Z Z 被定义为乘积 Z = E × G Z = E \times G Z = E × G ,其中:
E E E 是代表类别(轨道)的不变集合。
G G G 是代表位姿的对称群。 群 G G G 对 E E E 的作用是平凡的,并通过自身乘法作用于自身。
学习目标: 模型 ϕ : X → E × G \phi: X \to E \times G ϕ : X → E × G 使用三元组数据集 ( x , g , y ) (x, g, y) ( x , g , y ) 进行训练,其中 y = g ⋅ x y = g \cdot x y = g ⋅ x 。损失函数根据相对对称信息来鼓励等变性:L ( θ ; x , g , y ) = d E ( ϕ E ( y ) , ϕ E ( x ) ) + d G ( ϕ G ( y ) , g ⋅ ϕ G ( x ) ) L(\theta; x, g, y) = d_E(\phi_E(y), \phi_E(x)) + d_G(\phi_G(y), g \cdot \phi_G(x)) L ( θ ; x , g , y ) = d E ( ϕ E ( y ) , ϕ E ( x )) + d G ( ϕ G ( y ) , g ⋅ ϕ G ( x ))
第一项 (d E d_E d E ) 强制执行不变性,确保属于同一轨道的点映射到相同的类别表示。为了防止“轨道塌陷”并确保单射性(无损表示所必需),作者采用了 InfoNCE 损失,鼓励潜点相互分离。
第二项 (d G d_G d G ) 强制执行关于位姿分量上群作用的等变性。
实现: 为了处理非欧几里得群(例如 $SO(3)),作者使用来自其李代数 ),作者使用来自其李代数 ),作者使用来自其李代数 \mathfrak{g}的指数映射来参数化群 的指数映射来参数化群 的指数映射来参数化群 G。模型输出一个元素 。模型输出一个元素 。模型输出一个元素 v \in \mathfrak{g},通过 ,通过 ,通过 e^v映射到 映射到 映射到 G。对于 。对于 。对于 G=SO(3)$,这可以使用罗德里格斯公式(Rodrigues' formula)高效计算。
核心贡献
类-位姿分解: 一种通过分解潜空间来学习等变表示的方法,该方法显式地将内在数据类别与位姿分离。
通用的数学形式化: 一个基于群论的框架,在温和的假设(自由群作用)下,保证了无损、可解释且解耦的表示。
实证研究: 在具有各种对称性(平移、缩放、旋转)和应用场景(场景制图)的数据集上进行了全面的评估。
实验结果 作者在五个数据集上评估了其方法:Sprites、Shapes、Multi-Sprites、Chairs 和 Apartments(模拟移动智能体)。他们将该方法与以下模型进行了比较:
MDP 同态 (MDPH): 在没有先验群知识的情况下学习潜在动作。
线性模型: 使用矩阵乘法的线性潜空间(非自由作用)。
等变神经渲染 (ENR): 使用具有近似等变性的离散化潜在网格。
发现:
几何保持: 可视化结果表明,所提方法正确地在不变分量 E E E 中分离了轨道,并在位姿分量中保留了群 G G G 的几何结构。对于“Apartments”数据集,模型成功地同时提取了多个环境的地图。
性能: 该方法在单步预测上达到了近乎完美的命中率。至关重要的是,在长轨迹(10 步和 20 步)上,所提方法显著优于基准模型。
MDPH 由于其学习到的潜在动作缺乏结构约束,导致了误差累积。
线性模型由于作用不是自由的(绕自身旋转向量没有效果),导致性能下降,被迫造成信息丢失。
ENR 由于潜在空间的离散化,遭受了插值误差的影响。
解耦性: 该框架自然实现了解耦,允许通过作用于位姿分量来独立改变对称因子。
意义与主张 论文声称,通过利用李群理论的抽象语言,其框架为适用于任意群和数据类型的等变表示学习提供了一个通用解决方案。不同于以往专注于特定场景(如欧几里得表示或群卷积)或学习无结构潜在动力学的研究,这种方法保证了同构(无损)表示。作者强调,他们的方法能够恢复内在类别和位姿,从而促进诸如移动智能体的自监督定位与建图等任务。
局限性与未来工作 作者承认,其形式化方法假设对称群是预先已知的,而不是从数据中推断出来的。虽然这在提供里程计对称信息的机器人领域是可行的,但在其他领域可能会受到限制。他们指出,从数据中学习群结构是一个潜在的、尽管可解释性较低的研究方向。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。