← 最新论文
📄 other

Semantic Visual Representations Emerge from Embodied Self-Supervised Learning

本文介绍了具身自监督学习(E-SSL),这是一种利用自然人类交互中的时间一致性和感觉运动偶然性来生成高层语义视觉表示的模型,该模型不仅性能超越了现有模型,而且与前言期儿童的视觉皮层更加一致,并为人类视觉发育和流专业化的起源提供了新的见解。

原作者: Arthur Aubret

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Arthur Aubret

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大脑的秘密 GPS:运动如何帮助我们观察世界

想象一下,如果你试图通过盯着一张静止、冻结的照片来学习“狗”长什么样。你可能会记住颜色和毛发纹理,但你会错过它奔跑时耳朵抖动的样子,或者它转头时形状的变化。现在,想象一下通过实际绕着这只狗走动来学习:从各个角度观察它,并感受你自己的身体如何移动以保持视线锁定。这就是静态计算机程序与人类婴儿之间的区别。几十年来,科学家们一直被一个大问题所困扰:人类的大脑在几乎没有老师、没有教科书的情况下,是如何如此快速地理解世界的?我们知道婴儿并不仅仅是坐着不动;他们爬行、伸手、翻滚,不断地移动眼睛和身体。本文探讨了这样一个观点:这种运动不仅仅是生命存在的副作用,它实际上是解锁我们观察和理解物体能力的钥匙。

研究人员正在测试两个在科学界流传已久的观点。第一个是时间一致性(Temporal Consistency),这是一种高级说法,意思就是“在时间上接近发生的事件很可能是相关的”。如果你看到一个红球,然后一秒钟后你在稍微不同的位置又看到了一个红球,你的大脑就会假设这是同一个球。第二个观点是感觉运动偶发性(Sensorimotor Contingencies),即规则是“我的动作会改变我所看到的景象”。如果我向左转头,世界就会向右移动。如果我拿起一个杯子,手柄就会显现出来。论文提出了疑问:如果我们教一台计算机仅通过观察人们移动和环顾四周的视频来学习,并利用这两个简单的规则,它是否能学会像人类一样观察?更重要的是,它是否能学会像一个甚至还没学会说话的婴儿那样观察?

通过“行走”学习的机器人

认识一下 E-SSL(具身自监督学习)。把它想象成一个数字化的机器人大脑,它没有老师,没有教科书,甚至没有语言。它不是被喂入数百万张带有“这是猫”或“这是汽车”标签的图片,而是被给予了 300 小时的原始第一视角视频素材,这些视频是由佩戴在真实人类身上的眼镜记录下来的。这些视频展示了人类究竟看到了什么,他们的眼睛在看哪里,以及他们的头部和身体是如何移动的。

机器人的任务是靠自己摸索出世界的规则。它使用了两个技巧。首先,它观察两张间隔极短的照片。如果图像变化不大,它就假设物体是同一个(时间一致性)。其次,它观察人类在两张照片之间是如何移动头部或眼睛的。它试图学习到“当我这样移动头部时,世界会那样移动”(感觉运动偶发性)。这就像一个孩子学习到:如果他们旋转身体,房间也会跟着旋转;但如果他们只是眨眨眼,房间依然保持不动。

他们发现了什么?

结果非常强大,令人惊讶。尽管这个机器人从未听过一个单词,也从未见过任何告诉它物体是什么的标签,但它开始构建了一个非常像人类的心理世界地图。

1. 它学会了识别物体(几乎达到了成人的水平)
当研究人员在标准图片测验(如使用 ImageNet-1k 数据集进行物体识别)中测试机器人时,它的正确率约为 71%。这比其他试图模仿大脑但没有使用运动机制的“受生物启发”计算机模型有了巨大的飞跃。虽然它仍比拥有多年语言和经验的成年人落后约 20%,但它已经远超同类计算机模型。它证明了你不需要老师来教你什么是“马克杯”或“狗”;你只需要在周围活动并观察事物如何变化。

2. 它像婴儿一样思考
这里是最酷的部分。研究人员将机器人的“大脑”与真实婴儿的大脑进行了对比。他们发现,机器人的视觉方式与 9 个月大婴儿的大脑活动匹配度,远高于与成年人大脑的匹配度。

  • “形状 vs 纹理”测试: 婴儿以通过“形状”而非颜色或纹理来识别物体而闻名。红球和蓝球对婴儿来说都是“球”。经过运动学习后的机器人也开始这样做。它学会了专注于物体的形状,就像蹒跚学步的孩子一样。
  • “手柄”的发现: 机器人学会了如果它看到了一个手柄,那可能就是一个马克杯,即使它还没看到整个杯子。这是人类儿童在 18 个月左右才具备的技能,而机器人仅仅通过观察人们的移动就发展出了这种能力。

3. 运动是“秘密配方”
论文运行了一个有趣的实验,以观察为什么运动很重要。他们模拟了一个“木偶版”机器人。在这个版本中,机器人看到了同样的视频,但头部运动是被打乱或伪造的。结果,机器人的学习效果变差了。

  • “晚期行走者”效应: 他们还模拟了一个在训练了一段时间后才开始学习移动头部的机器人。结果如何?这个机器人的视觉效果比那个一开始就立即移动的机器人要差。这表明,人类婴儿开始爬行或走路(位移/运动)的时刻,是他们视觉发育的一个关键“顿悟”时刻。这不仅仅是因为他们看得更多了,更是因为他们的脑部终于可以将自身的肌肉指令与所见景象联系起来,从而极大地加速了学习。

4. 大脑的两条高速公路
最后,论文发现了关于机器人的“大脑”如何组织自身的问题。人类大脑有两条主要的视觉高速公路:

  • 腹侧流(Ventral Stream,即“是什么”路径): 帮助我们识别物体是什么(例如,“那是只猫”)。
  • 背侧流(Dorsal Stream,即“在哪里/如何”路径): 帮助我们理解物体在哪里以及如何与之互动(例如,“我需要抓那个杯子”)。

研究人员发现,机器人的学习自然地分成了这两类路径,就像人类大脑一样。学习“时间”(时间一致性)的部分变得非常擅长识别物体(腹侧);而学习“运动”(感觉运动偶发性)的部分则变得非常擅长理解空间变化和动作(背侧)。这表明,我们大脑中的这两条截然不同的路径可能并非天生就有的硬连线,而是可能通过观察世界变化并进行简单运动这一行为自然涌现出来的。

核心结论

这篇论文表明,人类视觉的秘密不仅在于拥有高质量的照相机(我们的眼睛)或超级计算机(我们的大脑)。更在于我们是具身的(Embodied)。我们移动、我们触摸,并改变我们的视角。通过仅仅在世界中移动并观察我们的动作如何改变所见的景象,我们的脑部自然地学会了识别形状、理解物体,并将视觉划分为“是什么”和“在哪里”。

虽然这个机器人还没有 3 岁幼儿那么聪明(幼儿甚至能更好地泛化形状),但它证明了你不需要语言或海量数据集就能开始观察世界。你只需要动起来。这表明,当婴儿开始爬行时,他们的大脑会获得一次巨大的升级,将一片模糊的色彩转化为一个可以识别、可以抓取的真实世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →