SeeSE3: Emergence of 3D Space in Vision Features
本文证明了自监督视觉基础模型在其潜在特征中固有地编码了三维欧几里得空间结构,从而能够在无需显式三维重建的情况下,实现用于视觉里程计和定位的新型“潜在空间导航”技术。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名试图解开关于我们如何感知世界之谜的侦探。长期以来,科学家们一直认为,要真正理解三维空间的形状——即物体有多远、如何旋转以及我们如何在其中移动——一个生命体需要成为一名主动的探索者。想象一下正在学习爬行的婴儿或带有轮子的机器人:它们必须通过移动身体来理解世界是一个坚实的、三维的空间。由数学家亨利·庞加莱(Henri Poincaré)提出的这一著名观点认为,一个“静止的存在”永远无法了解空间,因为它无法区分是自己在移动眼睛,还是世界本身在移动。
但今天,我们有了全新的事物:被称为“视觉基础模型”的巨型计算机大脑。这些人工智能系统是在数十亿张照片和视频上训练出来的。它们就像是终极的“静止存在者”。它们没有腿,没有轮子,也不会移动。它们只是坐在那里看图片。核心问题在于:如果给这个静止的计算机喂食足够多的图片,它是否会在无意中“发现”三维空间的规则?或者它仅仅是看到了一个平面的、混乱的色彩堆砌?这篇论文深入探讨了这个问题,询问这些被动的观察者是否能在其数字大脑中秘密构建出一张世界地图,即使它们从未迈出过一步。
论文的大发现:“看不见的地图”
这项研究背后的研究人员(来自 Google DeepMind 及其他机构的团队)决定测试这个“庞加莱任务”。他们想看看这些静止的 AI 模型内部的“思想”(或特征)是否秘密地组织成了一张三维地图。具体来说,他们在寻找与 SE(3) 的联系,这只是一个描述你在三维空间中所有可能移动和旋转方式(如向前走、左转或转头)的专业数学术说的说法。
这里的转折在于:他们测试的 AI 模型从未被教授过三维空间知识。它们没有被展示深度图,没有被给予 GPS 坐标,也没有被告知如何测量距离。它们只是通过一种叫做“自监督学习”(基本上是通过图像的一部分来推测另一部分,从而进行学习)的方法来识别图像中的模式。
主要发现:
论文指出,令人惊讶的是,这些静止的 AI 确实 在它们的大脑中构建了一张隐藏的三维地图。尽管输出的原始数据看起来像是一团乱麻(就像一团乱掉的毛线),但研究人员发现,只要使用一个微小的、简单的“适配器”(他们称之为 Poincaré Adapter 的小型附加工具),我们就能“展开”这团乱麻。一旦展开,AI 的内部特征就会与三维空间的几何结构完美对齐。
可以这样理解:想象 AI 的大脑是一张画有地图的皱巴巴的纸。在普通人眼里,这张地图看起来破碎且无法阅读。但 Poincaré Adapter 就像一只温柔的手,将纸张抚平。突然间,那些皱缩的线条显现出了一个完美的、笔直的网格,此时在 AI 的思维中“向前移动”实际上意味着在现实世界中“向前移动”。
他们排除了什么(以及没排除什么)
作者非常谨慎地澄清了这并不意味着什么。
- 它不是一个直接的三维相机: 他们明确排除了 AI 的原始特征已经是完美三维地图的观点。如果你只看 AI 输出的原始数字,它们是混乱且弯曲的,而不是笔直和平坦的。这张“地图”是隐藏的,而非显而易见的。
- 它不是魔法: 论文反对了“你需要一个带轮子的机器人才能理解空间”的观点。他们证明了一个“静止”的观察者(AI)可以通过观察静态图片来发现这些空间规则,前提是你知道如何提出正确的问题。
- 它并非在所有地方都完美: 虽然 AI 可以非常出色地理解旋转(转向),但在确定物体究竟“有多远”(平移幅度)方面却稍显吃力。论文认为这是因为在缺乏额外线索的情况下,仅凭一张扁平的照片很难推测距离,但移动的大致方向仍然非常清晰。
他们是如何证明的(“探测”实验)
为了找到这张隐藏的地图,研究人员使用了几种聪明的技巧,他们称之为“探测器”(probes):
- 邻域测试: 他们检查了在现实世界中距离较近的图片(例如在走廊里行走时拍摄的两张照片)是否在 AI 的大脑中也距离较近。他们发现,对于某些模型(如 DINOv2),答案是肯定的。AI 会自然地将相似的视角归为一类,就像地图一样。
- “拉直”测试: 他们尝试观察是否可以通过对当前视图进行简单的数学运算(加法或减法)来预测下一个视图。在原始数据上,这种尝试惨遭失败。但一旦使用了他们的 Poincaré Adapter,数学运算就运作得非常完美。他们可以提取 AI 的“当前思想”,加上一个“向前移动”的向量,结果得到的“思想”能完美匹配视频的下一帧。
- 导航游戏: 作为最后的测试,他们尝试利用这张隐藏的地图进行导航。他们给出了一个起点和一个目的地(例如“向前走 2 米并转动 30 度”)。仅使用 AI 的内部特征和适配器,他们就能预测目的地将会呈现什么样的景象,而无需生成新的图像。这就像是 AI 仅凭大脑中的向量运算,就能在脑海中“想象”出新的视角。
“视觉网格代码”
这篇论文最令人兴奋的部分是 “视觉网格代码”(Visual Grid Code) 的概念。在生物学中,我们知道动物(包括人类)拥有特殊的神经细胞,这些细胞以六边形模式放电,帮助我们进行导航。这篇论文表明,即使是被动的、静止的 AI 模型,也可能在自主开发类似的东西。它们不仅仅是在记忆图片;它们正在将它们的知识组织成一种镜像物理定律的几何结构。
作者发现这种能力具有可扩展性。AI 看到的数据越多,其隐藏的三维地图就变得越好。即使在完全陌生的房间进行测试时,该“适配器”仍然可以帮助它进行导航,这表明这是一种关于这些模型如何学习的根本性的、普遍的属性。
这为什么重要
这不仅仅是为了制造更好的机器人。它改变了我们对智能的看法。如果一个静止的计算机仅通过看图片就能弄清楚三维空间的规则,这意味着我们世界的几何结构已经深深植根于视觉数据之中,以至于几乎无法被忽略。空间的法则并不是我们需要教给机器的东西;如果我们给它足够的眼睛,它会自行发现它们。
论文得出结论,虽然 AI 并不像我们那样“看到”三维空间(它没有可以移动的身体),但它已经在其代码中构建了一个三维空间的数学骨架。通过使用像 Poincaré Adapter 这样简单的工具,我们终于可以读取那张地图,从而仅凭 AI 自身的“思想”来在世界中导航。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。